Запуск нескольких небольших локальных LLM на десктопе

XDA опубликовал статью в этом месяце, утверждая, что две локальные модели по 2 ГБ, работающие параллельно, превосходят одну модель на 8 ГБ почти в каждой реальной задаче, и автор был прав. Небольшая модель, настроенная на код, плюс небольшая модель, настроенная на беседу, работающие бок о бок, используют меньше оперативной памяти, отвечают быстрее и позволяют направить правильный вопрос нужному инструменту. Сложность заключается в инструментарии: большинство локальных LLM приложений предполагают одну модель одновременно и одно окно чата. Все восемь приложений для запуска нескольких локальных LLM одновременно на десктопе ниже обрабатывают параллельные модели либо встроенным образом, либо предоставляя совместимую с OpenAI конечную точку, на которую может указывать второе приложение.

На что обратить внимание при выборе многомодельного LLM-ранера

Реальные критерии для запуска более чем одной модели:

Быстрое сравнение

Приложение Лучше всего для Множественные модели Бесплатный план Начальная цена ПИ
Ollama CLI-first, OpenAI endpoint Да (параллельная загрузка) Бесплатно Бесплатно Нет (CLI)
LM Studio Менеджер моделей с точкой клика Да Бесплатно Бесплатно Да
Jan Полностью автономный чат + backend Да Бесплатно Бесплатно Да
llama.cpp server Наиболее прямое управление, минимальный объем Да (за процесс) Бесплатно Бесплатно Нет
LiteLLM Маршрутизация на 100+ backends Маршрутизатор Бесплатно Бесплатно (облако опционально) Веб-интерфейс
Open WebUI Многомодельный интерфейс чата Да Бесплатно Бесплатно Да (веб)
vLLM Производительность уровня производства Да (параллелизм тензоров) Бесплатно Бесплатно Нет
Msty Локальное + облако в одном приложении Да (Split Chat) Бесплатно 8,99 USD/месяц Да

Приложения

1. Ollama, стандартный runtime

Ollama загружает и выгружает модели по требованию и предоставляет API, совместимый с OpenAI, на порту 11434. Установите OLLAMA_NUM_PARALLEL=2 и OLLAMA_MAX_LOADED_MODELS=3 в своей среде, перезагрузите сервис, и вы сможете обращаться к двум моделям параллельно из любого клиента. На M2 Pro с 32 ГБ унифицированной памяти мы запустили Qwen2.5-Coder 3B и Llama 3.2 3B рядом с запасом места для небольшой модели видения.

Где это не работает: Нет встроенного графического интерфейса. Длина контекста по умолчанию (2048) мала для реальной работы, поэтому настройте её. Процесс ollama serve не автоматически привязывает модели к определённым GPU на установках с несколькими GPU.

Цены:

Платформы: macOS, Windows, Linux.

Загрузка: Ollama | GitHub

Вывод: Базовый слой. Почти каждое другое приложение в этом списке либо обёртывает Ollama, либо использует его архитектуру. Установите сначала его.

2. LM Studio, полированный графический интерфейс

LM Studio — это приложение, которое большинство людей устанавливает в первую очередь. Оно поставляется с полным браузером моделей, интерфейсом чата и, начиная с версии 0.3, встроенным локальным сервером, который запускает несколько моделей параллельно. Каталог моделей выбирается прямо из Hugging Face и фильтруется по тому, что подойдёт вашей машине. Режим Split Chat позволяет вам сравнивать две модели по одному и тому же запросу в реальном времени.

Где это не работает: Не является открытым исходным кодом (бесплатно для личного использования, свяжитесь с ними для рабочего использования). Включённая версия llama.cpp может отставать от upstream.

Цены:

Платформы: Windows, macOS, Linux.

Загрузка: LM Studio

Вывод: Лучшая точка входа, если вы хотите графический интерфейс. Используйте с Ollama для написания скриптов.

3. Jan, открытый исходный код LM Studio

Jan — это открытый вариант LM Studio: та же идея, лицензия MIT и заявленная цель работать полностью автономно. Многомодельные потоки чата позволяют каждому потоку привязаться к другой модели. Он запускает собственный backend llama.cpp и может проксировать удалённый Ollama или API, совместимый с OpenAI, когда вы хотите большую модель.

Где это не работает: Более молодой проект, чем LM Studio. Меньше упакованных расширений.

Цены:

Платформы: Windows, macOS, Linux.

Загрузка: Jan | GitHub

Вывод: Выберите это, если открытый исходный код имеет значение. Функционально очень похоже на LM Studio.

4. llama.cpp server, базовый примитив

llama.cpp поставляется с не имеющим состояния HTTP-сервером, который вы запускаете для каждой модели. Две команды оболочки, два порта, две модели. Это самый плотный способ держать две квантизации GGUF в оперативной памяти: нет обёртки, нет планировщика, нет телеметрии и минимальные накладные расходы памяти из всего здесь.

Где это не работает: Вы устанавливаете собственную маршрутизацию. Нет графического интерфейса. Нет менеджера моделей. Только командная строка для установки.

Цены:

Платформы: Windows, macOS, Linux (также Docker).

Загрузка: GitHub

Вывод: Для людей, которые хотят понять, что скрывают слои абстракции. Идеально для написания скриптов установок.

5. LiteLLM, маршрутизатор

LiteLLM не размещает модели; он маршрутизирует их. Укажите на вашу инстанцию Ollama, сервер LM Studio, ключ API Anthropic и конечную точку Azure, затем отправляйте каждый запрос через один URL, совместимый с OpenAI, и позвольте маршрутизатору решать. Файл конфигурации YAML с резервными вариантами для каждой модели и ограничениями скорости позволяет помощнику по кодированию переключиться на меньшую локальную модель, когда большая занята.

Где это не работает: Добавляет дополнительный процесс для управления. Отладка решений маршрутизации требует некоторого чтения журналов.

Цены:

Платформы: Windows, macOS, Linux (Python, Docker).

Загрузка: GitHub

Вывод: Клей между несколькими runners. Пропустите, если вы запускаете только один backend, обязателен, если вы запускаете три.

6. Open WebUI, фронтенд наподобие ChatGPT

Open WebUI — это полированный интерфейс чата для локальных моделей. Подключите его к Ollama (или любой конечной точке, совместимой с OpenAI), и он даёт вам многопользовательскую аутентификацию, историю чата, переключение моделей в середине разговора и сравнение моделей рядом в одной вкладке браузера. Удобно для семьи, где четыре человека делят одну машину.

Где это не работает: Работает в Docker для плавного опыта; нативная установка возможна, но сложнее. Использует около 500 МБ оперативной памяти перед загрузкой любой модели.

Цены:

Платформы: Windows, macOS, Linux (Docker).

Загрузка: GitHub

Вывод: Лучший фронтенд, если у вас уже работает Ollama. Режим Split Chat — это убийственная функция.

7. vLLM, двигатель производительности

vLLM — это то, что вы устанавливаете, когда инструменты десктопа перестают масштабироваться. Управление памятью PagedAttention держит несколько моделей с лучшей утилизацией VRAM, чем любой одномодельный runner. Параллелизм тензоров разделяет одну модель между GPU; несколько развёртываний на одном сервере размещают разные модели одновременно. Избыточно для ноутбука, необходимо для рабочей станции с двумя GPU.

Где это не работает: Linux-first (Windows через WSL2). Требует Python и настройку CUDA. Не нацелено на случайных пользователей.

Цены:

Платформы: Linux, Windows (WSL2), macOS (Apple Silicon частично).

Загрузка: GitHub

Вывод: Используйте только, если у вас серьёзный GPU. На одном 4090 Ollama проще и почти столь же быстро.

8. Msty, локальное + облачное приложение для десктопа

Msty поставляется как одиночный бинарный файл десктопа, который запускает локальные модели через встроенный runtime и облачные модели через ваши собственные ключи API, рядом в одном окне. Split Chat сравнивает до четырёх моделей для каждого запроса. Функция Knowledge Stacks индексирует локальные документы и делится индексом между моделями.

Где это не работает: Бесплатный уровень щедр, но ограничивает split chat двумя моделями. Платный уровень для четырёхстороннего split дороговат.

Цены:

Платформы: Windows, macOS, Linux.

Загрузка: Msty

Вывод: Самый простой способ сравнить локальные против облачных моделей рядом. Платите только, если вам нужен четырёхсторонний split.

Как выбрать правильный

FAQ

Могу ли я запустить два LLM на одном GPU?

Да, если обе квантизированные версии поместятся в VRAM. Модель 3B при Q4_K_M использует около 2 ГБ; две из них удобно помещаются на карте с 8 ГБ. Установите OLLAMA_MAX_LOADED_MODELS выше 1, чтобы держать их в горячем состоянии.

Действительно ли небольшие локальные LLM хороши?

Начиная с Qwen 2.5 и Llama 3.2 в диапазоне 3B-7B, небольшие модели обрабатывают резюмирование, завершение кода, извлечение и краткосрочный чат почти с качеством GPT-3.5. Они не справляются с длинным контекстом рассуждения и сложными многошаговыми задачами. Маршрутизируйте вокруг этого с большей моделью для сложных запросов.

Какова разница между Ollama и LM Studio?

Ollama — это CLI-first runtime с HTTP API. LM Studio — это GUI-first приложение для десктопа, которое запускает встроенный сервер llama.cpp. Они могут работать параллельно на одной машине.

Нужна ли мне GPU для запуска локальных LLM?

Нет, но это помогает. Модель 3B работает с читаемой скоростью (10-20 токен/сек) на современном Apple Silicon CPU или чипе Intel/AMD с 16 ГБ оперативной памяти. GPU толкают это до 60-200 токен/сек.

Какое приложение работает быстрее всего?

За токен, vLLM на современном NVIDIA GPU. За установку, llama.cpp с хорошей квантизацией. За удобство, Ollama.