LiteLLM

Статья XDA об Nvidia Personal AI Router вызвала отклик: два ПК за одной точкой, маршруты запросов моделей по весу и здоровью, без редактирования конфигов в пяти приложениях. Главное было в том, что выпуск Nvidia — это один вариант категории, которую стек с открытым исходным кодом уже охватывает и охватывает с более широкой поддержкой моделей. Если у вас есть рабочая станция с 4090 и мини-ПК с Ollama в шкафу, прокси, который их унифицирует, — это недостающий элемент.

Мы протестировали семь балансировщиков нагрузки и шлюзов для локального LLM-вывода в 2026 году. Каждый вариант работает перед Ollama, vLLM, LM Studio, llama.cpp или их комбинацией, предоставляет одну совместимую с OpenAI конечную точку и обрабатывает маршрутизацию, когда один бэкэнд занят, офлайн или не подходит для задачи.

На что обратить внимание при выборе локального балансировщика AI

Быстрое сравнение

Приложение Лучше всего для Бэкэнды Лицензия Открытый исходный код
LiteLLM Универсальный прокси со 100+ поставщиками Любой совместимый с OpenAI MIT Да
Olla Чисто локальный, минимальный размер Ollama, vLLM, LM Studio, SGLang, llama.cpp Apache 2.0 Да
Nvidia Personal AI Router Установки Nvidia на Windows Оптимизированные бэкэнды Nvidia Бесплатно (регистрация) Нет
vLLM Высокопроизводительное обслуживание одной модели Движок vLLM Apache 2.0 Да
Ollama Простейший хост множественной модели Нативный MIT Да
LocalAI OpenAI-клон с поддержкой большего количества медиа-моделей GGUF, ONNX, diffusers MIT Да
Portkey Корпоративный шлюз с контролем политики 200+ поставщиков AGPL / платный уровень Исходный код доступен

7 лучших приложений для балансировки нагрузки локального AI-вывода

1. LiteLLM — лучше всего в целом

LiteLLM работает в виде прокси Python или Rust перед вашими моделями и выдает одну точку /v1, совместимую с OpenAI. Указывайте ему любую комбинацию Ollama, vLLM, размещенного Anthropic и OpenAI, и он будет балансировать нагрузку между ними, переключаться при 429, кэшировать повторяющиеся запросы и применять бюджеты для каждого ключа. Переписанный на Rust в 2026 году вариант пропускает более 1500 запросов в секунду на одном узле, что намного больше, чем когда-либо потребуется домашней лаборатории, но приятно на общем шлюзе команды.

Где он не справляется: Конфигурационный файл быстро растет, когда вы добавляете деревья резервирования и уровни затрат. Панель мониторинга функциональна, но это не то, что вы показывали бы.

Цена: Бесплатный и открытый исходный код (MIT). Платный корпоративный уровень добавляет SSO и журналы аудита.

Платформы: Windows, macOS, Linux, Docker.

Скачать: litellm.ai · GitHub

Вывод: Если вы хотите один маршрутизатор, который растет от домашней лаборатории к размещенным API, начните отсюда.

2. Olla — лучше всего для чисто локальной опции

Olla — это специально разработанный LLM-прокси для самостоятельно размещаемого вывода. Он общается с Ollama, LM Studio, vLLM, llama.cpp, SGLang и самим LiteLLM, автоматически обнаруживает модели во всех бэкэндах и остается ниже 50 МБ памяти. Отработка отказа между двумя Ollama-ящиками — это пятилинейный файл YAML, а открытые метрики питают Prometheus без плагина.

Где он не справляется: Нет встроенного отслеживания затрат или применения бюджета, потому что он не трогает размещенные API. Сообщество меньше, чем у LiteLLM.

Цена: Бесплатный и открытый исходный код (Apache 2.0).

Платформы: Windows, macOS, Linux, Docker. Один статический бинарный файл.

Скачать: thushan.github.io/olla · GitHub

Вывод: Выберите это, если весь ваш стек работает на оборудовании, которое вы владеете, и вы хотите маршрутизатор, который загружается за секунду.

3. Nvidia Personal AI Router — лучше всего для готового решения на оборудовании Nvidia

Nvidia Personal AI Router — это предмет статьи XDA. Он поставляется как приложение Windows, которое сканирует вашу локальную сеть, находит узлы вывода на базе Nvidia и объединяет их за локальной точкой. Маршрутизация модели, потоковая передача и передача квантизации обрабатываются внутри маршрутизатора, а клиентские приложения из одного набора (Nvidia ChatRTX и Nvidia AI Workbench) подключаются прямо в них.

Где он не справляется: Ориентирован на Nvidia: Radeon и Intel Arc-установки — это граждане второго класса. Маршрутизатор не предоставляет совместимую с OpenAI точку нативно, поэтому клиентам третьих сторон нужен шим.

Цена: Бесплатно с учетной записью разработчика Nvidia.

Платформы: Windows.

Скачать: nvidia.com/ai-router

Вывод: Самый простой способ объединить две установки Nvidia в одну точку AI, если вы никогда не покидаете экосистему Nvidia.

4. vLLM — лучше всего для максимизации использования одного мощного GPU

vLLM не является маршрутизатором в себе, но его совместимый с OpenAI сервер с непрерывной партионизацией и PagedAttention толкает пропускную способность на одном GPU намного дальше, чем может достичь Ollama. В двухузловой установке запуск vLLM позади LiteLLM или Olla — это стандартный паттерн для обслуживания одной большой модели команде, пока более дешевые бэкэнды обрабатывают длинный хвост.

Где он не справляется: Загрузка модели медленнее, чем в Ollama; нет резервного на основе CPU. Поддержка квантизации отстает от llama.cpp.

Цена: Бесплатный и открытый исходный код (Apache 2.0).

Платформы: Linux с CUDA, ROCm или Intel XPU. Windows через WSL2. Поддержка Metal macOS ведется сообществом.

Скачать: vllm.ai · GitHub

Вывод: Используйте это как один из бэкэндов, которому ваш маршрутизатор направляет работу, а не как сам маршрутизатор.

5. Ollama — лучше всего для простого размещения множественных моделей

Ollama остается в списке, потому что большинство домашних установок уже его используют, и его встроенная очередь разумно обрабатывает несколько одновременных запросов. Расположите маршрутизатор перед ним для высокой доступности или запустите два Ollama-ящика с Olla для активного резервирования отработки отказа.

Где он не справляется: Пропускная способность на GPU отстает от vLLM на 4-8x при пакетной работе. Нет отслеживания затрат, нет маршрутизирующего интеллекта.

Цена: Бесплатный и открытый исходный код (MIT).

Платформы: Windows, macOS, Linux, Docker.

Скачать: ollama.com · GitHub

Вывод: Надежный бэкэнд, а не маршрутизатор. Держите его и положите что-то более умное спереди.

6. LocalAI — лучше всего, если маршрутизатор также является хостом вывода

LocalAI — это один бинарный файл, который говорит OpenAI API и размещает LLM, модели встраивания, TTS, генерацию изображений и преобразование речи в текст. Он может вызывать другие бэкэнды Ollama или vLLM в фоновом режиме, что делает его приличным “все в одном” для домашней лаборатории с одним узлом, где вы предпочли бы запустить один процесс вместо трех.

Где он не справляется: Менее гибкий, чем LiteLLM для гибридных локальных плюс размещенных установок. Поддержка медиа-моделей означает, что двоичный файл тяжелый.

Цена: Бесплатный и открытый исходный код (MIT).

Платформы: Windows, macOS, Linux, Docker.

Скачать: localai.io · GitHub

Вывод: Хороший выбор, если вы хотите маршрутизатор и полный хост медиа-моделей на одном ящике.

7. Portkey — лучше всего, если вам нужны контроли политики

Portkey — это вариант уровня корпоративного. Он находится перед локальными и размещенными моделями так, как LiteLLM, но добавляет защиты, редакцию PII и политики маршрутизации для каждой команды из коробки. Версия с открытым исходным кодом, размещенная самостоятельно, охватывает основы маршрутизации; SSO, аудит и управляемая панель сидят позади платного уровня.

Где он не справляется: AGPL пугает некоторых домашних лабораторантов. Полный механизм политики полезен только если команда на нем опирается.

Цена: Бесплатно самостоятельно размещаемый (AGPL); платные управляемые уровни начинаются с скромной ежемесячной платы на место.

Платформы: Docker на любой ОС хоста.

Скачать: portkey.ai · GitHub

Вывод: Избыточно для одиночной домашней лаборатории, правильный размер для шлюза небольшой команды.

Как выбрать правильный

ЧЗВ

В чем разница между балансировщиком нагрузки и движком вывода?

Движок вывода (vLLM, Ollama, llama.cpp) запускает фактическую модель. Балансировщик нагрузки или шлюз (LiteLLM, Olla) сидит спереди и решает, какой движок получит каждый запрос. Вам нужны оба: один для обслуживания, один для маршрутизации.

Могу ли я балансировать нагрузку локальных моделей с размещенным API в качестве резервной копии?

Да. LiteLLM и Portkey построены ровно для этого. Сначала настройте локальную модель с более низким весом стоимости, затем размещенного поставщика в качестве резервной; маршрутизатор использует размещенный API только когда ваш GPU выключен или перегружен.

Нужен ли мне маршрутизатор, если у меня только один GPU?

Строго говоря, нет. Но это все еще помогает. Маршрутизатор дает вам стабильную точку, логику повтора и наблюдаемость, поэтому если вы позже поменяете Ollama на vLLM, вам не нужно трогать какие-либо клиентские приложения.

Работает ли Nvidia Personal AI Router с AMD или Intel GPU?

Официально нет. Он ориентирован на оборудование Nvidia и CUDA. Для смешанных установок LiteLLM или Olla будут обращаться с любым совместимым с OpenAI бэкэндом одинаково независимо от производителя.

Какой имеет самую низкую задержку?

Olla добавляет менее 5 мс на локальной сети в тестах благодаря своему ядру Go. LiteLLM сидит около 10-15 мс с движком Rust на теплом кэше. Для большей части чата и кодирующих рабочих нагрузок, либо невидима рядом с собственным временем декодирования модели.