
Gemma 4 на ноутбуке работает отзывчиво. GPU выполняет свою работу, ответы приходят за несколько секунд, и модель ощущается как настоящий помощник. Переместите её на NAS, и она замедлится настолько, что вопрос станет небольшим обязательством. Этот разрыв — именно то, что нам нужно. Когда модель находится на общем хранилище, она может быть доступна для всей семьи или команды, а дополнительная секунда задержки превращает её обратно в инструмент вместо рефлекса.
Мы выбрали восемь приложений, которые мы используем на NAS для хостинга локальных LLM сегодня. Некоторые — это сервер, некоторые — интерфейс, некоторые — слой развёртывания. Вместе они охватывают рабочий процесс от загрузки модели к семейству клиентов, обращающихся к общей конечной точке.
На что обратить внимание в приложении LLM, размещённом на NAS
- Работает без монитора. NAS не имеет монитора и часто не имеет GPU.
- Открывает стабильный HTTP API, поэтому любой клиент может с ним взаимодействовать.
- Управляет моделями без переупаковки Docker-образа.
- Передаёт токены потоком, потому что модель на NAS работает медленнее, а потоковая передача делает её полезной.
- Слой контроля доступа, даже простой токен, потому что конечная точка находится в локальной сети.
Восемь приложений ниже соответствуют как минимум четырём из пяти критериям. Рейтинг упорядочивает их по тому, насколько легко их запустить на Synology, QNAP или самостоятельно собранном NAS.
Быстрое сравнение
| Приложение | Лучше всего для | Работает на | Поддержка GPU | Лицензия |
|---|---|---|---|---|
| Ollama | Самый простой NAS сервер | Linux, macOS, Windows | CUDA, Metal, ROCm | MIT |
| LM Studio | Хост модели с точки и щелчком | Linux, macOS, Windows | CUDA, Metal, ROCm | Proprietary (free) |
| Open WebUI | Общий веб-интерфейс | Docker | Через бэкенд | MIT |
| LocalAI | Совместимая замена OpenAI | Docker | CUDA, ROCm, CPU | MIT |
| Text Generation WebUI | Настройка для опытных пользователей | Linux, macOS, Windows | CUDA, ROCm, CPU | AGPL |
| Jan | Локальный клиент для рабочего стола | Windows, macOS, Linux | CUDA, Metal, CPU | AGPL |
| vLLM | Высокопроизводительный вывод | Linux | CUDA (GPU серверов) | Apache 2 |
| llama.cpp | Вывод на голом CPU | Любая ОС | Любая | MIT |
1. Ollama, лучше всего для самого простого NAS сервера
Ollama — это ближайший аналог установки в одну команду для NAS. Docker-образ, порт 11434, и каждый клиент, который говорит на Ollama или OpenAI API, может с ним взаимодействовать. Библиотека моделей включает Llama, Gemma, Mistral, Qwen и растущий список вариантов instruct.
Где это падает: тонкие элементы управления выборкой скрыты за флагами. Любой, кто хочет вручную менять шаблоны подсказок, в конце концов попадает в синтаксис modelfile.
Цена:
- Бесплатно, MIT.
Платформы: Linux, macOS, Windows (все как Docker или встроенные).
Загрузить: ollama.com
Итог: Рекомендация по умолчанию для любого, кто впервые устанавливает LLM на NAS.
2. LM Studio, лучше всего для хоста модели с точки и щелчком
LM Studio — это приложение для рабочего стола, которое также запускает совместимый с OpenAI сервер. Укажите его на папку моделей, смонтированную на NAS, включите сервер, и клиенты в локальной сети могут его вызвать. GUI скрывает части llama.cpp, которые пугают людей.
Где это падает: это приложение для рабочего стола в первую очередь, поэтому установка без монитора на NAS означает запуск её внутри легкого X-сервера или выбор NAS с экраном для настройки.
Цена:
- Бесплатно для личного использования.
Платформы: Windows, macOS, Linux.
Загрузить: lmstudio.ai
Итог: Правильный выбор, когда член семьи хочет изменить модели и не хочет трогать терминал.
3. Open WebUI, лучше всего для общего веб-интерфейса
Open WebUI — это веб-интерфейс в стиле ChatGPT для бэкенда, размещённого на NAS. Укажите его на Ollama, LM Studio или LocalAI, добавьте пользователей, и каждый член семьи получит свои чаты и общую библиотеку подсказок. RAG над локальными файлами поставляется в коробке.
Где это падает: это интерфейс, а не среда выполнения. Ollama или LocalAI всё ещё выполняют работу модели.
Цена:
- Бесплатно, MIT.
Платформы: Docker на Linux, плюс встроенная установка на NAS через Portainer.
Загрузить: openwebui.com
Итог: Правильное сочетание с Ollama, когда цель — общий, ориентированный на браузер семейный чат.
4. LocalAI, лучше всего для совместимой замены OpenAI
LocalAI открывает совместимую конечную точку OpenAI (chat, embeddings, images, TTS) против локальных моделей. Любое приложение, которое говорит на API OpenAI, может с ним взаимодействовать без изменений. Бэкенды охватывают llama.cpp, whisper.cpp и stable-diffusion.cpp.
Где это падает: файл конфигурации плотный, и каждой модели нужна собственная запись. Ollama делает отображение за вас.
Цена:
- Бесплатно, MIT.
Платформы: Docker на Linux, плюс встроенные версии для Windows и macOS.
Загрузить: localai.io
Итог: Правильный сервер, когда клиент — это OpenAI SDK, и замена базового URL — это вся миграция.
5. Text Generation WebUI, лучше всего для настройки опытных пользователей
Text Generation WebUI (oobabooga) — это более старый, более богатый интерфейс, который также запускает сервер. Параметры выборки, загрузка LoRA и шаблоны подсказок в стиле карточек персонажей — всё открыто. Любой, кто хочет настроить модель за пределами стандартов, находится здесь.
Где это падает: интерфейс был перестроен дважды и всё ещё показывает свои корни опытного пользователя. Это не тот инструмент, который вы передаёте члену семьи.
Цена:
- Бесплатно, AGPL.
Платформы: Windows, macOS, Linux.
Загрузить: github.com/oobabooga/text-generation-webui
Итог: Выбор для любого, кто хочет ручек выборки, которые Ollama и LM Studio скрывают.
6. Jan, лучше всего для локального клиента для рабочего стола
Jan — это локальный клиент ChatGPT. Он поставляется со своей собственной среды выполнения для NAS только с CPU, но также говорит с удалённым сервером Ollama или LocalAI. Чаты и подсказки остаются на диске, поэтому вся история — это локальный файл.
Где это падает: как сервер NAS, это не самое сильное соответствие. Используйте его как клиент и позвольте Ollama или LocalAI выполнять обслуживание.
Цена:
- Бесплатно, AGPL.
Платформы: Windows, macOS, Linux.
Загрузить: jan.ai
Итог: Правильный спутник рабочего стола для сервера NAS для любого, кто не хочет веб-вкладку.
7. vLLM, лучше всего для высокопроизводительного вывода
vLLM — это сервер производственного уровня. Внимание к страницам, параллелизм тензоров и непрерывное группирование делают его самым быстрым способом обслуживания большой модели для множества клиентов. Хитрость в том, что ему нужен настоящий GPU (Ampere или позже).
Где это падает: это не установка, дружественная к NAS. Шасси NAS без GPU центра обработки данных не может запустить его так, как предполагают документы.
Цена:
- Бесплатно, Apache 2.
Платформы: Linux (обычно Docker с набором инструментов контейнера NVIDIA).
Загрузить: github.com/vllm-project/vllm
Итог: Выбор, когда “NAS” — это Linux-система с настоящим GPU, обслуживающая домашнюю лабораторию клиентов.
8. llama.cpp, лучше всего для голого вывода CPU
llama.cpp — это низкоуровневая среда выполнения, которую оборачивает всё остальное в этом списке. Он работает на сборках NAS только с CPU, где отсутствует настоящий GPU, с квантованными моделями, которые сжимают модель с 8B параметрами в несколько гигабайт.
Где это падает: нет интерфейса. Это двоичный сервер и CLI. Соедините его с Open WebUI или Ollama.
Цена:
- Бесплатно, MIT.
Платформы: Любая (Linux, macOS, Windows, ARM включая Raspberry Pi и Apple Silicon).
Загрузить: github.com/ggerganov/llama.cpp
Итог: Правильный выбор, когда NAS только с CPU и каждый гигабайт оперативной памяти имеет значение.
Как выбрать нужный
- Установка в одну команду на NAS: Ollama.
- Общий веб-чат для семьи: Ollama плюс Open WebUI.
- Конечная точка, совместимая с OpenAI, которую может вызвать любой SDK: LocalAI.
- Замена модели с точкой и щелчком: LM Studio.
- Контроль выборки и LoRA: Text Generation WebUI.
- Локальный клиент рабочего стола, обращающийся к NAS: Jan.
- Серьёзная пропускная способность GPU для множества клиентов: vLLM.
- NAS только с CPU: llama.cpp.
Часто задаваемые вопросы
Какая модель работает на NAS без GPU?
Квантованные версии Gemma, Llama или Mistral в диапазоне 3B-8B работают на современном CPU NAS с несколькими токенами в секунду. Это медленно для интерактивного чата, отлично для разового резюме или ночного задания.
Нужен ли GPU на моём NAS?
Только для интерактивной скорости. NAS только с CPU всё ещё может запустить небольшую модель; время ответа составляет несколько секунд на предложение вместо токенов в секунду.
Могу ли я оставить модель на NAS приватной для моей локальной сети?
Да. Ollama, LM Studio и LocalAI привязываются к интерфейсу локальной сети по умолчанию. Добавьте базовую аутентификацию или обратный прокси для чего-то большего, чем домашняя локальная сеть.
Сколько места на диске нужно для локальных моделей?
Квантованная модель 8B занимает около 5 ГБ. Квантованная модель 70B занимает близко к 40 ГБ. NAS со свободным объёмом 500 ГБ вмещает полную библиотеку.
Могут ли несколько человек использовать модель одновременно?
Ollama, LocalAI и Text Generation WebUI по умолчанию сериализуют. vLLM обрабатывает одновременные запросы естественным образом. Для небольшой семьи сериализация в порядке.
Что насчёт конфиденциальности?
Каждое приложение в этом списке запускает модель локально. Никакая подсказка или ответ не отправляются третьей стороне, если приложение не настроено на это.