Запуск нескольких локальных моделей ИИ на рабочем столе с помощью Ollama

Лучшие приложения для запуска нескольких локальных моделей ИИ на рабочем столе — это те, которые перестают рассматривать ваш GPU как консоль с одним слотом для картриджей. Недавний материал XDA от автора, отказавшегося от погони за большими локальными моделями, ясно формулирует это: две модели по 2ГБ, работающие параллельно, превосходили одну модель на 8ГБ, потому что каждая небольшая модель была выбрана для конкретной задачи. Модель кода на 3B справлялась с автодополнением. Модель чата на 3B обрабатывала беседу. Ни одна из них не должна была быть универсальной.

Вот именно этот паттерн нас интересует. Не погоня за бенчмарками. Маршрутизация. Мы протестировали семь десктопных раннеров и оркестраторов за последние несколько недель, замерили, как быстро они переключают модели, проверили, могут ли они одновременно держать две загруженные, и оценили удобство маршрутизации на практике. Этот список предназначен для тех, у кого есть видеокарта на 12–24 ГБ и кто хочет реального помощника плюс модель кода плюс, может быть, модель зрения, все на одной машине.

На что обратить внимание при выборе локального мультимодельного раннера

Шесть вещей отличают инструменты, которые делают рабочие процессы с несколькими моделями приятными, от тех, которые загоняют вас в ловушку одной модели.

Быстрое сравнение

Приложение Лучше всего для Платформы Бесплатный план Платный уровень История многомодельности
Ollama Основной раннер и слой API Windows, macOS, Linux Полностью бесплатно, открытый исходный код Нет Горячая замена по требованию, держит недавние модели в памяти
LM Studio GUI с вкладками нескольких моделей Windows, macOS, Linux Бесплатно для личного использования Лицензия для команды на работу Загрузка нескольких моделей одновременно, переключение вкладок
Msty Параллельный чат между моделями Windows, macOS, Linux Бесплатный уровень Пожизненная лицензия Aurum Одновременные ответы от до восьми моделей
Jan Многомодельный чат с открытым исходным кодом Windows, macOS, Linux Полностью бесплатно, открытый исходный код Нет Замена по беседе, OpenAI-совместимый сервер
Open WebUI Маршрутизация конвейера над Ollama Веб-интерфейс, самостоятельный Полностью бесплатно, открытый исходный код Нет Выбор модели по запросу, сценарии конвейера
LocalAI Drop-in маршрутизатор API Windows, macOS, Linux, Docker Полностью бесплатно, открытый исходный код Нет Одна конечная точка маршрутизирует ко многим бэкендам и форматам
LiteLLM Прокси между бэкендами Windows, macOS, Linux Полностью бесплатно, открытый исходный код Управляемый облачный уровень Маршрутизация по имени модели к любому локальному или удаленному провайдеру

Приложения

1. Ollama, лучше всего для горячей замены локальных моделей

Ollama — это приложение, от которого зависит большинство остального в этом списке, и неспроста. Его CLI и API вокруг llama.cpp сделали управление моделями похожим на docker pull, и его поведение с несколькими моделями — это причина, по которой рабочие процессы с двумя небольшими моделями вообще работают. Запустите ollama run llama3.2:3b для чата и ollama run qwen2.5-coder:3b для автодополнения, и демон держит недавно использованную в памяти при загрузке другой. Время жизни по умолчанию составляет пять минут, поэтому быстрый переход обратно не требует переоплаты за загрузку. Установите OLLAMA_KEEP_ALIVE выше, и модель остается в памяти до тех пор, пока давление VRAM не заставит её выгрузить.

OpenAI-совместимая конечная точка по адресу http://localhost:11434/v1 означает, что каждый плагин IDE, фронтенд чата и фреймворк агента, которые мы тестировали, подключились без адаптеров. На видеокарте на 24ГБ мы держали модель чата на 7B и модель кода на 3B в памяти одновременно с достаточным запасом.

Где она отстает: Нет GUI. Обнаружение модели — это текстовый файл под названием Modelfile. Поддержка GPU Windows была стабильной с момента выпуска нативной версии, но всё ещё отстает от macOS по полированности.

Цены:

Платформы: Windows, macOS, Linux.

Скачать: Сайт издателя - GitHub

Вывод: Установите это в первую очередь. Даже если ваше основное приложение — GUI приложение, вам, вероятно, нужен Ollama как бэкенд.

2. LM Studio, лучше всего для GUI одновременного хранения нескольких моделей

LM Studio — это приложение для передачи пользователю без CLI, который всё ещё хочет трюк с малыми моделями. Серия 0.3 добавила поддержку нескольких моделей в одном окне, поэтому вы можете загрузить модель чата в одну вкладку, модель кода в другую и переключаться между ними без ожидания загрузки каждый раз. Встроенный сервер открывает OpenAI-совместимую конечную точку для каждой загруженной модели, что означает, что расширение редактора может обращаться к модели кода, пока ваше окно чата продолжает разговор с моделью чата.

Обнаружение модели — это поле поиска по Hugging Face с встроенным выбором квантизации и оценкой VRAM. Пользовательский интерфейс показывает слайдеры разгрузки GPU для каждой модели, что важно при попытке разместить две модели среднего размера на одной видеокарте.

Где она отстает: Не с открытым исходным кодом. Бесплатная лицензия покрывает личное использование, и есть отдельная лицензия для рабочего использования, которую поток загрузки просит вас принять. Некоторые форматы квантизации загружаются медленнее, чем в raw llama.cpp.

Цены:

Платформы: Windows, macOS, Linux.

Скачать: Сайт издателя - GitHub

Вывод: Лучший выбор, если вы хотите настоящий GUI, несколько загруженных моделей и рабочий сервер API без касания терминала.

3. Msty, лучше всего для параллельного чата и сравнения

Msty — это приложение, которое заставило нас перестать A/B тестировать модели копированием и вставкой. Его режим с разделённым экраном позволяет вам отправить один запрос двум, четырём или до восьми моделям одновременно и прочитать ответы рядом. Это точно рабочий процесс, который вам нужен, когда вы пытаетесь понять, какая небольшая модель стоит держать загруженной. Направьте её на Ollama и она автоматически наследует ваши локальные модели. Направьте на ключи OpenAI или Anthropic и она сравнивает локальное с размещённым в том же виде.

Функция Knowledge Stack позволяет вам прикреплять папки документов и PDF и запрашивать их между моделями, что хорошо сочетается с небольшой моделью чата плюс небольшой моделью вложений, держащихся в памяти вместе.

Где она отстает: Не с открытым исходным кодом. Бесплатный уровень покрывает личное использование, и обновление Aurum открывает разделённый чат выше двух моделей, синхронизацию рабочего пространства и несколько других дополнений. Пользовательский интерфейс насыщен функциями и требует сеанса, чтобы научиться.

Цены:

Платформы: Windows, macOS, Linux.

Скачать: Сайт издателя

Вывод: Выберите это, когда вам действительно нужно увидеть ответы двух моделей на один и тот же вопрос одновременно.

4. Jan, лучшие многомодельные чат-клиенты с открытым исходным кодом

Jan — это альтернатива с открытым исходным кодом, если вы хотите GUI в стиле LM Studio без вопроса о лицензии. Она поставляется со своим собственным механизмом вывода, может работать против серверов Ollama или llama.cpp и позволяет вам менять модель отдельно для каждой беседы. Каждый тред помнит, какую модель, какой системный запрос и какие параметры он использовал, поэтому тред кода и тред письма могут указывать на разные специалисты без взаимного воздействия.

Встроенный локальный сервер открывает OpenAI-совместимую конечную точку, и приложение само расширяется через небольшой API расширения. При нашем тестировании переключение модели между двумя тредами было почти мгновенным, когда целевая модель уже была загружена, и около трёх до восьми секунд, когда её пришлось загружать с диска на NVMe.

Где она отстает: Не может держать несколько моделей в своём собственном механизме одновременно. Если вы хотите две загруженные одновременно, направьте её на Ollama и дайте Ollama управлять держанием в памяти. Ускорение GPU на Windows всё ещё отстает от сборки macOS для некоторых форматов квантизации.

Цены:

Платформы: Windows, macOS, Linux.

Скачать: Сайт издателя - GitHub

Вывод: Правильный выбор, если открытый исходный код имеет значение и вы хотите маршрутизацию модели для каждого потока без работы с CLI.

5. Open WebUI, лучший уровень маршрутизации над Ollama

Open WebUI раньше был известен как Ollama WebUI и остаётся самым полным веб-фронтенд для самостоятельно размещённого локального стека. То, что заработало ему место здесь, — это система конвейеров: вы можете определить сценарии, которые выбирают модель для каждого запроса на основе содержания запроса, истории сообщений или прикреплённых файлов. Классический пример — конвейер маршрутизации, который отправляет всё, начинающееся с блока кода, вашей модели кодировщика и всё остальное вашей модели чата, всё внутри одной беседы.

Он также поддерживает параллельные ответы моделей в одном сообщении, плюс RAG со своим собственным хранилищем документов, плюс вызовы функций. Так как он открывает всё это по LAN, одно поле Ollama в подвале может служить маршрутизированным многомодельным чатом для каждой машины в доме.

Где она отстает: Ориентирован на веб. Здесь нет собственного клиента рабочего стола, поэтому вы либо запускаете его локально в браузере, либо размещаете на сервере. Установка требует Docker или Python, а не двойного клика по установщику.

Цены:

Платформы: Работает везде, где работают Docker или Python. Доступ через браузер на Windows, macOS, Linux.

Скачать: Сайт издателя - GitHub

Вывод: Используйте это, когда вы хотите программируемую маршрутизацию и вам комфортно с пятиминутной установкой Docker.

6. LocalAI, лучший drop-in маршрутизатор API между семействами моделей

LocalAI — это ответ на конкретную проблему. У вас есть модель чата в GGUF, модель whisper для транскрипции, модель изображения для диффузии и небольшая модель вложений, и вы хотите одну конечную точку, которая говорит OpenAI-совместимо для всех них. Она запускает каждый бэкенд в своём рабочем процессе, маршрутизирует запросы по имени модели и возвращает ответы в той же форме, что и размещённый API. Ваш плагин Continue, ваш инструмент заметок и ваш пользовательский сценарий всё указывают на один URL и выбирают свою модель по имени.

Для паттерна двух-малых-моделей это означает рабочий процесс, подобный Continue, запрашивающему qwen-coder-3b, пока ваше приложение заметок запрашивает llama-3.2-3b, оба подаются из одного прокси, оба горячей загружаемые, оба изолированные, поэтому тяжёлая работа с вложениями не останавливает чат.

Где она отстает: Установка тяжелее, чем Ollama. Конфигурация модели — это YAML для каждого бэкенда. Ускорение GPU работает, но требует некоторых знаний о том, что у вас установлено. Документация полная, но предполагает, что вы уже знаете, как выглядит OpenAI-совместимый запрос.

Цены:

Платформы: Windows, macOS, Linux, Docker.

Скачать: Сайт издателя - GitHub

Вывод: Правильный выбор, когда вы хотите один локальный API, который говорит к тексту, зрению, аудио и вложениям без склеивания отдельных серверов вместе.

7. LiteLLM, лучший кроссбэкенд-прокси для маршрутизации задач

LiteLLM начинался как Python SDK для вызова сотни поставщиков моделей с одним интерфейсом, и его сервер прокси — это то, что заработало ему место в списке, ориентированном на локальное. Запустите его впереди Ollama, LM Studio, LocalAI или любой смеси, и клиенты говорят с ним через OpenAI-совместимый запрос. Он переписывает запрос для того бэкенда, который находится позади запрошенного имени модели. Это означает одна конечная точка маршрутизирует chat к вашему локальному Llama и code к вашему локальному Qwen Coder, с одним и тем же инструментом получающим оба без знания, где находится каждый из них.

Это также обрабатывает откаты, повторные попытки, ограничения скорости и бюджеты для каждого ключа, что имеет значение в тот момент, когда вы начинаете позволять более чем одному приложению совместно использовать ваш GPU.

Где она отстает: Это прокси, а не раннер. Вам всё ещё нужен Ollama или LocalAI позади для фактической подачи моделей. Конфигурация — это файл YAML. Полированная приборная панель находится в управляемом облачном уровне, поэтому самостоятельные хостеры полагаются на бесплатный UI плюс файлы конфигурации.

Цены:

Платформы: Windows, macOS, Linux, Docker.

Скачать: Сайт издателя - GitHub

Вывод: Добавьте это в день, когда у вас есть более чем одно приложение, обращающееся к более чем одной локальной модели, и вы хотите один источник истины для имён, маршрутизации и лимитов.

Как выбрать правильный

Если вы хотите наименьшую установку для трюка с малыми моделями, запустите Ollama и всё. Вытащите модель чата на 3B и модель кода на 3B, дайте демону держать одну в памяти, пока вы используете другую, и направьте ваш редактор на локальную конечную точку.

Если вы хотите GUI и нет терминала, установите LM Studio. Загрузите две модели в две вкладки и используйте её встроенный сервер для чего-либо, что нужно в API.

Если вы действительно хотите сравнить модели перед привязкой VRAM к ним, используйте Msty и разделите один и тот же запрос между кандидатами, пока один не выиграет.

Если вы хотите GUI и открытый исходный код, запустите Jan поверх Ollama.

Если вы хотите маршрутизировать по содержанию запроса, а не по приложению, самостоятельно разместите Open WebUI впереди Ollama и напишите конвейер.

Если ваша рабочая нагрузка включает зрение, транскрипцию или вложения наряду с чатом, поместите LocalAI в середину и дайте одному API служить всему этому.

Если у вас уже есть три инструмента, обращающихся к двум моделям, и это становится беспорядочным, бросьте LiteLLM впереди и переименуйте всё по роли.

ЧЗВ

Я действительно могу запустить две локальные модели ИИ одновременно?

Да, на любом GPU с достаточным VRAM для хранения обоих. Две квантизированные модели на 3B или 4B удобно подходят на карту на 12ГБ. Ollama и LM Studio могут держать обе в памяти, и запросы к тому, который неактивен, возвращают результаты сразу без холодной загрузки. Материал XDA, который вдохновил эту статью, — это рабочий пример, а не теоретический.

Одна большая локальная модель ИИ всегда лучше, чем две малые?

Нет для реальных рабочих процессов. Одна модель на 8B должна быть универсалистом, что означает, что она средний кодировщик и средний писатель. Две модели на 3B, выбранные для их специализации (модель кодировщика плюс модель чата, скажем), часто превосходят большую одиночную модель в каждой специализированной задаче, особенно с правильной маршрутизацией. Одно место, где большая одиночная модель всё ещё выигрывает, — это глубокое рассуждение по одному сложному вопросу, которому нужна длинная история.

Какое лучшее бесплатное приложение для запуска нескольких локальных моделей на рабочем столе?

Ollama для демона и API. Добавьте Jan или Open WebUI сверху, когда вам нужен GUI или программируемая маршрутизация. Все три открытого исходного кода и бесплатны без ограничения мест.

Позволяет ли LM Studio вам запустить две модели одновременно?

Да, с серии 0.3 она поддерживает загрузку нескольких моделей в одном сеансе с вкладками, и встроенный OpenAI-совместимый сервер открывает каждую загруженную модель как отдельную конечную точку. Главное ограничение — VRAM.

Сколько VRAM мне нужно для запуска двух локальных моделей ИИ?

Удобный минимум для двух квантизированных моделей на 3B или 4B — это 12ГБ. На картах на 8ГБ вы можете более-менее запустить две очень малые модели в Q4, но вы потеряете некоторое помещение для параллелизма. Для 7B плюс 3B, державшихся в памяти вместе, планируйте на 16ГБ и выше.

В чём разница между Ollama и LocalAI?

Ollama — это сосредоточенный раннер вокруг llama.cpp с чистым CLI, текстовым каталогом моделей и OpenAI-совместимой конечной точкой. LocalAI — это более широкий слой API, который может фронтировать много бэкендов одновременно, включая текст, изображение, аудио и вложения, с конфигурацией YAML для каждого бэкенда. Ollama легче начать. LocalAI — это то, к чему вы переходите, когда ваш рабочий процесс больше, чем чат.