Статья XDA об Nvidia Personal AI Router вызвала отклик: два ПК за одной точкой, маршруты запросов моделей по весу и здоровью, без редактирования конфигов в пяти приложениях. Главное было в том, что выпуск Nvidia — это один вариант категории, которую стек с открытым исходным кодом уже охватывает и охватывает с более широкой поддержкой моделей. Если у вас есть рабочая станция с 4090 и мини-ПК с Ollama в шкафу, прокси, который их унифицирует, — это недостающий элемент.
Мы протестировали семь балансировщиков нагрузки и шлюзов для локального LLM-вывода в 2026 году. Каждый вариант работает перед Ollama, vLLM, LM Studio, llama.cpp или их комбинацией, предоставляет одну совместимую с OpenAI конечную точку и обрабатывает маршрутизацию, когда один бэкэнд занят, офлайн или не подходит для задачи.
На что обратить внимание при выборе локального балансировщика AI
- Совместимость с OpenAI. Каждый серьезный клиент (Open WebUI, Cline, Continue, Aider, Zed) ожидает
/v1/chat/completions. Если ваш маршрутизатор использует собственный API, вы потратите весь выходной на исправление клиентов. - Охват бэкэндов. Ollama, vLLM, LM Studio, llama.cpp и SGLang — общие локальные движки. Охватите их все, иначе вы выбросите маршрутизатор через три месяца.
- Проверки здоровья и отработка отказов. Локальные установки выходят офлайн. Маршрутизатор, который продолжает отправлять запросы на отключенный GPU, хуже, чем round-robin.
- Маршрутизация по стоимости и возможностям. Не каждому запросу нужна модель на 70B. Направьте легкие запросы на маленькую локальную модель и зарезервируйте большую для сложных случаев.
- Наблюдаемость. Логи, задержка для каждой модели и трассировка запросов — это разница между “это медленно” и “8B съедает весь трафик, потому что он всегда отвечает первым”.
Быстрое сравнение
| Приложение | Лучше всего для | Бэкэнды | Лицензия | Открытый исходный код |
|---|---|---|---|---|
| LiteLLM | Универсальный прокси со 100+ поставщиками | Любой совместимый с OpenAI | MIT | Да |
| Olla | Чисто локальный, минимальный размер | Ollama, vLLM, LM Studio, SGLang, llama.cpp | Apache 2.0 | Да |
| Nvidia Personal AI Router | Установки Nvidia на Windows | Оптимизированные бэкэнды Nvidia | Бесплатно (регистрация) | Нет |
| vLLM | Высокопроизводительное обслуживание одной модели | Движок vLLM | Apache 2.0 | Да |
| Ollama | Простейший хост множественной модели | Нативный | MIT | Да |
| LocalAI | OpenAI-клон с поддержкой большего количества медиа-моделей | GGUF, ONNX, diffusers | MIT | Да |
| Portkey | Корпоративный шлюз с контролем политики | 200+ поставщиков | AGPL / платный уровень | Исходный код доступен |
7 лучших приложений для балансировки нагрузки локального AI-вывода
1. LiteLLM — лучше всего в целом
LiteLLM работает в виде прокси Python или Rust перед вашими моделями и выдает одну точку /v1, совместимую с OpenAI. Указывайте ему любую комбинацию Ollama, vLLM, размещенного Anthropic и OpenAI, и он будет балансировать нагрузку между ними, переключаться при 429, кэшировать повторяющиеся запросы и применять бюджеты для каждого ключа. Переписанный на Rust в 2026 году вариант пропускает более 1500 запросов в секунду на одном узле, что намного больше, чем когда-либо потребуется домашней лаборатории, но приятно на общем шлюзе команды.
Где он не справляется: Конфигурационный файл быстро растет, когда вы добавляете деревья резервирования и уровни затрат. Панель мониторинга функциональна, но это не то, что вы показывали бы.
Цена: Бесплатный и открытый исходный код (MIT). Платный корпоративный уровень добавляет SSO и журналы аудита.
Платформы: Windows, macOS, Linux, Docker.
Скачать: litellm.ai · GitHub
Вывод: Если вы хотите один маршрутизатор, который растет от домашней лаборатории к размещенным API, начните отсюда.
2. Olla — лучше всего для чисто локальной опции
Olla — это специально разработанный LLM-прокси для самостоятельно размещаемого вывода. Он общается с Ollama, LM Studio, vLLM, llama.cpp, SGLang и самим LiteLLM, автоматически обнаруживает модели во всех бэкэндах и остается ниже 50 МБ памяти. Отработка отказа между двумя Ollama-ящиками — это пятилинейный файл YAML, а открытые метрики питают Prometheus без плагина.
Где он не справляется: Нет встроенного отслеживания затрат или применения бюджета, потому что он не трогает размещенные API. Сообщество меньше, чем у LiteLLM.
Цена: Бесплатный и открытый исходный код (Apache 2.0).
Платформы: Windows, macOS, Linux, Docker. Один статический бинарный файл.
Скачать: thushan.github.io/olla · GitHub
Вывод: Выберите это, если весь ваш стек работает на оборудовании, которое вы владеете, и вы хотите маршрутизатор, который загружается за секунду.
3. Nvidia Personal AI Router — лучше всего для готового решения на оборудовании Nvidia
Nvidia Personal AI Router — это предмет статьи XDA. Он поставляется как приложение Windows, которое сканирует вашу локальную сеть, находит узлы вывода на базе Nvidia и объединяет их за локальной точкой. Маршрутизация модели, потоковая передача и передача квантизации обрабатываются внутри маршрутизатора, а клиентские приложения из одного набора (Nvidia ChatRTX и Nvidia AI Workbench) подключаются прямо в них.
Где он не справляется: Ориентирован на Nvidia: Radeon и Intel Arc-установки — это граждане второго класса. Маршрутизатор не предоставляет совместимую с OpenAI точку нативно, поэтому клиентам третьих сторон нужен шим.
Цена: Бесплатно с учетной записью разработчика Nvidia.
Платформы: Windows.
Скачать: nvidia.com/ai-router
Вывод: Самый простой способ объединить две установки Nvidia в одну точку AI, если вы никогда не покидаете экосистему Nvidia.
4. vLLM — лучше всего для максимизации использования одного мощного GPU
vLLM не является маршрутизатором в себе, но его совместимый с OpenAI сервер с непрерывной партионизацией и PagedAttention толкает пропускную способность на одном GPU намного дальше, чем может достичь Ollama. В двухузловой установке запуск vLLM позади LiteLLM или Olla — это стандартный паттерн для обслуживания одной большой модели команде, пока более дешевые бэкэнды обрабатывают длинный хвост.
Где он не справляется: Загрузка модели медленнее, чем в Ollama; нет резервного на основе CPU. Поддержка квантизации отстает от llama.cpp.
Цена: Бесплатный и открытый исходный код (Apache 2.0).
Платформы: Linux с CUDA, ROCm или Intel XPU. Windows через WSL2. Поддержка Metal macOS ведется сообществом.
Вывод: Используйте это как один из бэкэндов, которому ваш маршрутизатор направляет работу, а не как сам маршрутизатор.
5. Ollama — лучше всего для простого размещения множественных моделей
Ollama остается в списке, потому что большинство домашних установок уже его используют, и его встроенная очередь разумно обрабатывает несколько одновременных запросов. Расположите маршрутизатор перед ним для высокой доступности или запустите два Ollama-ящика с Olla для активного резервирования отработки отказа.
Где он не справляется: Пропускная способность на GPU отстает от vLLM на 4-8x при пакетной работе. Нет отслеживания затрат, нет маршрутизирующего интеллекта.
Цена: Бесплатный и открытый исходный код (MIT).
Платформы: Windows, macOS, Linux, Docker.
Скачать: ollama.com · GitHub
Вывод: Надежный бэкэнд, а не маршрутизатор. Держите его и положите что-то более умное спереди.
6. LocalAI — лучше всего, если маршрутизатор также является хостом вывода
LocalAI — это один бинарный файл, который говорит OpenAI API и размещает LLM, модели встраивания, TTS, генерацию изображений и преобразование речи в текст. Он может вызывать другие бэкэнды Ollama или vLLM в фоновом режиме, что делает его приличным “все в одном” для домашней лаборатории с одним узлом, где вы предпочли бы запустить один процесс вместо трех.
Где он не справляется: Менее гибкий, чем LiteLLM для гибридных локальных плюс размещенных установок. Поддержка медиа-моделей означает, что двоичный файл тяжелый.
Цена: Бесплатный и открытый исходный код (MIT).
Платформы: Windows, macOS, Linux, Docker.
Скачать: localai.io · GitHub
Вывод: Хороший выбор, если вы хотите маршрутизатор и полный хост медиа-моделей на одном ящике.
7. Portkey — лучше всего, если вам нужны контроли политики
Portkey — это вариант уровня корпоративного. Он находится перед локальными и размещенными моделями так, как LiteLLM, но добавляет защиты, редакцию PII и политики маршрутизации для каждой команды из коробки. Версия с открытым исходным кодом, размещенная самостоятельно, охватывает основы маршрутизации; SSO, аудит и управляемая панель сидят позади платного уровня.
Где он не справляется: AGPL пугает некоторых домашних лабораторантов. Полный механизм политики полезен только если команда на нем опирается.
Цена: Бесплатно самостоятельно размещаемый (AGPL); платные управляемые уровни начинаются с скромной ежемесячной платы на место.
Платформы: Docker на любой ОС хоста.
Скачать: portkey.ai · GitHub
Вывод: Избыточно для одиночной домашней лаборатории, правильный размер для шлюза небольшой команды.
Как выбрать правильный
- Если вы хотите один маршрутизатор, который растет от домашней лаборатории к размещенным API: LiteLLM.
- Если весь ваш стек локальный и вы хотите минимальный размер: Olla.
- Если оба ПК — это Nvidia и вы никогда не покидаете Windows: Nvidia Personal AI Router.
- Если небольшой команде нужны защиты и политика: Portkey.
- Если вы хотите маршрутизатор, который также хостит diffusers и TTS: LocalAI.
- Держите Ollama как надежный бэкэнд и vLLM для одного мощного GPU.
ЧЗВ
В чем разница между балансировщиком нагрузки и движком вывода?
Движок вывода (vLLM, Ollama, llama.cpp) запускает фактическую модель. Балансировщик нагрузки или шлюз (LiteLLM, Olla) сидит спереди и решает, какой движок получит каждый запрос. Вам нужны оба: один для обслуживания, один для маршрутизации.
Могу ли я балансировать нагрузку локальных моделей с размещенным API в качестве резервной копии?
Да. LiteLLM и Portkey построены ровно для этого. Сначала настройте локальную модель с более низким весом стоимости, затем размещенного поставщика в качестве резервной; маршрутизатор использует размещенный API только когда ваш GPU выключен или перегружен.
Нужен ли мне маршрутизатор, если у меня только один GPU?
Строго говоря, нет. Но это все еще помогает. Маршрутизатор дает вам стабильную точку, логику повтора и наблюдаемость, поэтому если вы позже поменяете Ollama на vLLM, вам не нужно трогать какие-либо клиентские приложения.
Работает ли Nvidia Personal AI Router с AMD или Intel GPU?
Официально нет. Он ориентирован на оборудование Nvidia и CUDA. Для смешанных установок LiteLLM или Olla будут обращаться с любым совместимым с OpenAI бэкэндом одинаково независимо от производителя.
Какой имеет самую низкую задержку?
Olla добавляет менее 5 мс на локальной сети в тестах благодаря своему ядру Go. LiteLLM сидит около 10-15 мс с движком Rust на теплом кэше. Для большей части чата и кодирующих рабочих нагрузок, либо невидима рядом с собственным временем декодирования модели.