Ollama — самый популярный локальный LLM сервер для домашних лабораторий Proxmox

Каждое сообщение, отправленное в ChatGPT или Claude, покидает здание. Для большинства людей этот компромисс приемлем. Но растущее число владельцев домашних лабораторий считает иначе, и сервер Proxmox, который уже запускает Plex, Home Assistant и Pi-hole, имеет ровно столько свободных CPU, RAM и (часто) GPU, сколько необходимо локальной языковой модели. Один недавний отчет от самохостера, который отказался от облачного AI в пользу локальной LLM на Proxmox, хорошо резюмировал привлекательность: оборудование было уже оплачено, поэтому модель стала тем, что наконец сделало всю домашнюю лабораторию стоящей. Мы собрали семь приложений, стоящих запуска в VM или LXC контейнере для достижения этого, ранжированные по простоте установки, эффективности оборудования и тому, насколько близко ежедневный опыт приближается к ChatGPT. Это лучшие приложения для хостинга локальной LLM на Proxmox в этом году.

На что следует обратить внимание при выборе хоста Proxmox LLM

Не каждый проект локальной LLM построен для запуска без интерфейса на гипервизоре. Несколько вещей отличают стоящие установку от тех, которые будут вас замедлять.

Быстрое сравнение

Приложение Лучше всего для Развертывание Бесплатный уровень Поддержка GPU
Ollama Общий хост Proxmox Linux VM, LXC, Docker Бесплатно, открытый исходный код NVIDIA, AMD (ROCm), CPU
Open WebUI Лучший интерфейс поверх Ollama Docker на том же VM/LXC Бесплатно, открытый исходный код Наследует GPU бэк-энда
LM Studio Обнаружение моделей на рабочем столе Приложение рабочего стола (не без интерфейса) Бесплатно NVIDIA, Apple Silicon
text-generation-webui Расширенные и старые форматы моделей Linux VM, Docker Бесплатно, открытый исходный код NVIDIA, AMD, CPU
vLLM Высокопроизводительное, производственное обслуживание Linux VM, Docker Бесплатно, открытый исходный код NVIDIA (лучше), AMD (частично)
llama.cpp server Самый худой, родной GGUF Linux VM, LXC, Docker Бесплатно, открытый исходный код NVIDIA, AMD, Apple Silicon, CPU
LocalAI Замена OpenAI-API “drop-in” Linux VM, LXC, Docker Бесплатно, открытый исходный код NVIDIA, CPU

7 приложений, ранжированные

1. Ollama — лучший в целом

Ollama — это приложение, на которое приземляются большинство домовладельцев Proxmox в первую очередь, и обычно то, на котором они остаются. Установка — это единая команда shell внутри VM Debian или Ubuntu (или привилегированного LXC контейнера с правильными модулями ядра), а загрузка модели так же проста, как ollama run llama3. Он предоставляет OpenAI-совместимый API на порту 11434 по умолчанию, что означает, что Home Assistant, Continue.dev и десятки других инструментов подключаются к нему без дополнительной конфигурации.

Где он отстает: Встроенный интерфейс — это командный чат, а не веб-интерфейс, поэтому большинство людей объединяют его с Open WebUI или похожим фронтенд. Passthrough GPU в LXC контейнер требует точного совпадения драйвера NVIDIA между хостом и контейнером, что больше замедляет первого пользователя, чем маршрут VM.

Цена: Бесплатно, открытый исходный код.

Платформы: Linux VM, LXC, Docker, также нативный на Windows и macOS для локального тестирования вне лаборатории.

Загрузить: ollama.com

Вывод: Выбор по умолчанию для хоста Proxmox LLM и бэк-энд, на котором большинство других приложений в этом списке построены для работы.

2. Open WebUI — лучший интерфейс поверх Ollama

Open WebUI превращает Ollama во что-то, что действительно выглядит и ощущается как ChatGPT: история чата, множественные беседы, переключение модели из выпадающего списка, загрузка документов с ответами, полученными путем поиска, и многопользовательские входы с разрешениями для каждого пользователя. Он работает в собственном Docker контейнере прямо рядом с Ollama, поэтому они вместе удобно помещаются в один LXC контейнер или небольшую VM.

Развертывания для семьи или домашнего хозяйства получают наибольшую пользу здесь. Каждый человек получает свой собственный вход, свою собственную историю чата и администратор может установить, какие модели доступны для кого.

Где он отстает: Это интерфейс, а не сервер моделей, поэтому полностью зависит от Ollama (или другого OpenAI-совместимого бэк-энда), уже работающего под ним. Экраны управления разрешениями и пользователями требуют нескольких минут, чтобы привыкнуть к ним в первый раз.

Цена: Бесплатно, открытый исходный код.

Платформы: Docker на Linux VM или LXC контейнер, рядом с Ollama.

Загрузить: github.com/open-webui/open-webui

Вывод: Выбор для кого-то, кто хочет, чтобы домашнее хозяйство действительно использовало локальную LLM вместо того, чтобы использовал только человек, который ее установил.

3. LM Studio — лучше для обнаружения моделей

LM Studio — это полированное приложение рабочего стола для Windows, macOS и Linux, которое делает просмотр, загрузку и тестирование моделей Hugging Face легким, с встроенным каталогом, оценками RAM и VRAM перед загрузкой, и режимом локального сервера, который предоставляет тот же OpenAI-совместимый API, который используют другие приложения в этом списке. Это менее родное для Proxmox, чем Ollama, поскольку оно предназначено для работы с GUI на рабочей станции, а не без интерфейса в контейнере, но оно заслуживает место здесь, потому что это самый быстрый способ выяснить, какая модель действительно подходит вашему оборудованию перед тем, как приступить к развертыванию Proxmox.

Некоторые домовладельцы запускают LM Studio на компьютере рабочего стола исключительно для исследования модели, а затем загружают выигравшую модель в Ollama на поле Proxmox для всегда включенного сервера.

Где он отстает: Запуск без интерфейса внутри VM работает, но теряет смысл приложения, поскольку GUI является главной привлекательностью. Это не построено для типа непредвиденной операции boot-and-forget, которую домашняя лаборатория хочет.

Цена: Бесплатно.

Платформы: Windows, macOS, Linux рабочий стол (не контейнер-родной).

Загрузить: lmstudio.ai

Вывод: Полезно как инструмент разведения перед развертыванием, а не как сам хост Proxmox.

4. text-generation-webui — лучше для расширенных и старых форматов моделей

text-generation-webui, часто называемый “oobabooga” в честь его создателя, ветеран этого списка и до сих пор приложение с самой широкой поддержкой формата: GGUF, GPTQ, AWQ и EXL2 все загружаются через тот же интерфейс, вместе с поддержкой LoRA fine-tune и режимом raw completion в стиле блокнота. Для кого-то, запускающего более старую или более неясную модель, для которой более новые инструменты прекратили поддержку, это обычно то место, где она все еще работает.

Веб-интерфейс включает карточки персонажей, предустановки чата и расширения для таких вещей, как долгосрочная память и голос, функции, нацеленные скорее на хобби-экспериментирование, чем на чистый ежедневный опыт чата.

Где он отстает: Интерфейс показывает свой возраст рядом с Open WebUI, и шeer количество настроек и расширений может перегрузить того, кто просто хочет работающий почтовый ящик чата. Обновления иногда нарушают совместимость с определенными форматами квантизации.

Цена: Бесплатно, открытый исходный код.

Платформы: Linux VM, Docker, также работает на Windows и macOS.

Загрузить: github.com/oobabooga/text-generation-webui

Вывод: Правильный выбор для любителей, запускающих необычные форматы моделей или fine-tunes, которые другие серверы не поддерживают.

5. vLLM — лучше для высокопроизводительного и производственного обслуживания

vLLM построена для другой проблемы, чем большинство этого списка: обслуживание многих одновременных запросов быстро, используя PagedAttention, чтобы сохранить память GPU эффективной под нагрузкой. На поле Proxmox с правильно переданным GPU, vLLM будет работать на намного более высокой пропускной способности, чем Ollama, когда несколько людей или несколько приложений обращаются к модели одновременно, что имеет значение для домашней лаборатории, запускающей LLM за несколькими сервисами (ассистент кодирования, UI чата и конвейер автоматизации, все одновременно).

Он говорит OpenAI API изначально, поэтому подходит для тех же инструментов, которые разговаривают с Ollama.

Где он отстает: Установка тяжелее, требования GPU строже, и производительность чата одного пользователя не значительно лучше, чем у более простых вариантов здесь. CPU-only или домашние лаборатории с низким VRAM получают мало пользы от этого.

Цена: Бесплатно, открытый исходный код.

Платформы: Linux VM с passthrough GPU, Docker.

Загрузить: github.com/vllm-project/vllm

Вывод: Оверкилл для замены ChatGPT одного пользователя, но правильный инструмент, когда домашняя лаборатория начинает обслуживать локальную модель нескольким приложениям или людям одновременно.

6. llama.cpp server — самый худой, родной GGUF

llama.cpp — это двигатель вывода C++, на котором большинство приложений в этом списке работают под капотом, и его собственный встроенный сервер (llama-server) — это самый худой способ предоставить GGUF модель через OpenAI-совместимый API без каких-либо дополнительных слоев. Использование ресурсов является самым низким в этом списке, что делает его сильным подходящим для небольшого LXC контейнера или хоста Proxmox, который также должен запустить другие сервисы на том же оборудовании.

Он включает минимальный встроенный веб-интерфейс чата, функциональный, но простой, который достаточен для базового использования без добавления Open WebUI на вершину.

Где он отстает: Нет менеджера моделей, нет многопользовательских учетных записей, и конфигурация происходит через флаги командной строки, а не через экран настроек. Это вознаграждает кого-то, комфортного с терминалом больше, чем кто-то, кто хочет установку “укажи и щелкни”.

Цена: Бесплатно, открытый исходный код.

Платформы: Linux VM, LXC, Docker, также собирается на Windows, macOS и Apple Silicon.

Загрузить: github.com/ggerganov/llama.cpp

Вывод: Выбор для выжимания модели на минимальном оборудовании или в LXC контейнер с ограниченными ресурсами.

7. LocalAI — лучшая OpenAI-API замена “drop-in”

LocalAI нацелена на то, чтобы быть почти полной заменой “drop-in” для OpenAI API, охватывая не только завершение чата, но и генерацию изображений, преобразование текста в речь и вложения за тем же интерфейсом. Для домашней лаборатории, которая уже имеет приложения или автоматизация, подключенные к вызову OpenAI API, LocalAI позволяет этой точке интеграции оставаться неизменной, в то время как фактический вывод происходит локально на поле Proxmox.

Он поддерживает широкий диапазон бэк-эндов, включая llama.cpp, поэтому один и тот же сервер может запускать несколько различных форматов моделей в зависимости от того, что требует данный запрос.

Где он отстает: Широта поддерживаемых типов моделей добавляет сложность конфигурации по сравнению с однопурпурным сервером, как Ollama, и проект движется достаточно быстро, что документация иногда отстает от последнего выпуска.

Цена: Бесплатно, открытый исходный код.

Платформы: Linux VM, LXC, Docker.

Загрузить: localai.io

Вывод: Правильный выбор, когда существующий инструмент уже построен против OpenAI API и замена конечной точки, а не переписывание интеграции, является целью.

Как выбрать правильный

Для одного человека, заменяющего ChatGPT для ежедневного использования, Ollama в паре с Open WebUI охватывает почти все: интерфейс чата, переключение модели и конечную точку API для чего-либо еще в сети. Домашнее хозяйство, использующее один поле Proxmox, получает пользу от той же парики, поскольку многопользовательские логины Open WebUI держат истории чата отдельно без необходимости нескольких VM.

Любитель, который хочет poking в fine-tunes, предустановки персонажей или старые форматы квантизации, получает больше пробега от text-generation-webui, даже с его более крутой кривой обучения. Кто-то все еще решает, какая модель подходит их оборудованию, должен начать с LM Studio на рабочем столе перед тем, как приступить к VM Proxmox в конкретной установке.

Rig, богатый GPU, обслуживающий несколько приложений или пользователей одновременно, является единственным случаем, когда vLLM получает ее дополнительную стоимость установки, поскольку его преимущество пропускной способности показывается только под одновременной нагрузкой. Box, только CPU, или хост Proxmox с ограниченным RAM для слайда, лучше обслуживается llama.cpp server напрямую, который имеет минимальные издержки из всего на этом списке. И лаборатория с существующей автоматизацией уже вызывается OpenAI API — это один четкий случай для LocalAI, поскольку она позволяет этой точке интеграции оставаться ровно так же, как она была.

Часто задаваемые вопросы

Может ли Proxmox запустить LLM без GPU? Да. Ollama, llama.cpp server и LocalAI все работают только на CPU, и квантизированная модель 7B или 8B полезна для чата на современном многоядерном CPU, хотя ответы приходят заметно медленнее, чем на GPU. Меньшие квантизированные модели (3B и меньше) остаются отзывчивыми даже на скромном оборудовании.

Какая локальная LLM ближе всего к качеству ChatGPT? Качество модели зависит от того, какие веса загружены, а не какой сервер их запускает, поэтому любой из этих приложений может запустить те же модели. Большие открытые модели в диапазоне 70B-plus, работающие в хорошей квантизации, приходят ближайшими к ответам уровня ChatGPT, хотя им нужен существенный VRAM или медленный CPU fallback для хорошей работы.

Является ли Ollama бесплатным? Да. Ollama бесплатна и открыта, без платного уровня, подписки или ограничения использования, поскольку вывод происходит полностью на оборудовании, на котором она работает.

Должен ли я использовать VM или LXC контейнер для Ollama? LXC контейнер легче и быстрее запускается, что подходит для установки только на CPU или лаборатории, плотной на RAM. VM — более безопасный выбор для passthrough GPU, поскольку он изолирует стек драйверов NVIDIA от хоста Proxmox и избегает проблем с совпадением версий, которые возникают, когда контейнер использует ядро хоста и драйверы.

Какая модель работает на 16 GB VRAM? Модель 13B в 4-битовой или 5-битовой квантизации GGUF удобно подходит в 16 GB VRAM с местом для разумного окна контекста. Некоторые хорошо оптимизированные квантизации 34B также подходят при сокращенной длине контекста, хотя 13B и меньше дает наибольшее место для более длинных разговоров.