
У этого старого игрового ПК, лежащего в шкафу, впереди еще много жизни. Машина эпохи 2018 года с процессором Ryzen или Intel, 32 ГБ оперативной памяти и б/у видеокартой запустит модель 7B на скорости разговора и комфортно справится с моделью 13B. Укажите семейные ноутбуки на сервер, и у вас будет приватный, всегда включенный AI, который отвечает в локальной сети за пару секунд. Лучшие приложения для превращения старого ПК в локальный AI-сервер хорошо выбирают модели, поставляют HTTP API для других инструментов и позволяют машине спать между запросами. Мы выбрали семь приложений, которые превратят оборудование десятилетней давности в полезный AI-сервис.
На что обратить внимание в приложении локального AI-сервера
Шесть вещей имеют значение для AI на старом оборудовании:
- Backend и формат.
llama.cpp(GGUF) поддерживает больше всего; MLC и ONNX — альтернативы. - Путь только для CPU. Работает ли приложение с приемлемой скоростью на машине без GPU.
- Широкая поддержка GPU. Nvidia (CUDA), AMD (ROCm), Intel (SYCL) и Apple Silicon (Metal).
- Обработка одновременных запросов. Могут ли члены семьи запрашивать одновременно без задержек.
- OpenAI-совместимый API. Могут ли другие инструменты указывать на сервер и думать, что они разговаривают с OpenAI API.
- Потолок памяти. ОЗУ плюс VRAM определяют, какая модель поместится. Q4 квантизация примерно вдвое снижает потребность в памяти.
Быстрое сравнение
| Приложение | Лучше всего для | Поддержка GPU | API | Особенность |
|---|---|---|---|---|
| Ollama | Самый простой сервер | Nvidia, AMD, Apple | OpenAI-совместимый | Одна команда запускает модель |
| LM Studio | Дружественный интерфейс | Nvidia, AMD, Apple | OpenAI-совместимый | Лучшее открытие моделей |
| Jan | Полностью локальный ChatGPT | Nvidia, AMD, Apple | OpenAI-совместимый | Чат плюс сервер в одном приложении |
| GPT4All | Базовая линия только для CPU | Nvidia, AMD, CPU | Локальный API | Работает на очень старом оборудовании |
| llama.cpp | Управление на уровне железа | Nvidia, AMD, Apple, CPU | Чистый HTTP | Движок большинства приложений из списка |
| Open WebUI | Веб-интерфейс для Ollama | Любой (клиент) | Подключается к Ollama | ChatGPT-подобный интерфейс для локальной сети |
| LocalAI | Замена OpenAI “под ключ” | Nvidia, AMD, CPU | OpenAI-совместимый | Обслуживает изображения, аудио, вложения |
Приложения
1. Ollama, лучше всего для “запуск модели одной командой”
Ollama поставляет фоновый сервис, который загружает, квантизирует и обслуживает модели из отобранной библиотеки. Одна команда (ollama run llama3.2) загружает веса, загружает модель и открывает пользователю чат. Сервис открывает OpenAI-совместимую конечную точку на localhost:11434, так что любой инструмент, который разговаривает с OpenAI, может указать на старый ПК и получить то же самое поведение.
Где он не удается: Собственная библиотека Ollama использует пользовательский формат манифеста. Использование случайного GGUF из Hugging Face требует небольшой Modelfile и шага импорта.
Цена: Бесплатно, лицензия MIT.
Платформы: Windows, macOS, Linux.
Скачать: Ollama
Итог: Начните отсюда. Установите его, выполните одну команду, и локальная сеть получает AI-сервер.
2. LM Studio, лучше всего для дружественного интерфейса
LM Studio — это настольное приложение, которое просматривает Hugging Face, загружает модели GGUF и запускает их локально. Он имеет интерфейс чата и переключатель “локальный сервер”, который открывает OpenAI-совместимую конечную точку. Интерфейс показывает прогнозируемое использование ОЗУ и VRAM перед загрузкой, что действительно полезно при выборе квантизации.
Где он не удается: Закрытый исходный код. Некоторые части приложения зависят от доступности в Интернете даже для локального использования, хотя модель работает автономно.
Цена: Бесплатно для личного использования.
Платформы: Windows, macOS, Linux.
Скачать: LM Studio
Итог: Выберите это, когда друг, запускающий старый ПК, не хочет трогать терминал.
3. Jan, лучше всего для полностью локального клона ChatGPT
Jan — это настольное приложение, которое поставляется как ChatGPT-подобный клиент, менеджер моделей и локальный API-сервер в одном пакете. Загрузки моделей видны, и “режим сервера” делает те же модели доступными для других приложений в локальной сети. Весь дизайн с открытым исходным кодом и ориентирован на конфиденциальность.
Где он не удается: Новее чем Ollama и LM Studio; случайные шероховатости в поддержке моделей.
Цена: Бесплатно, лицензия AGPL.
Платформы: Windows, macOS, Linux.
Скачать: Jan
Итог: Выбор, если цель — одно приложение, которое действует как клиент чата и сервер в локальной сети.
4. GPT4All, лучше всего для базовой линии только для CPU
GPT4All был разработан для случая, когда нет GPU вообще. Он запускает модели GGUF на CPU с приемлемой производительностью на любой машине с 2018 года и позже. Настольное приложение управляет моделями, и локальный API-сервер можно включить из настроек.
Где он не удается: Скорость на CPU ограничена пропускной способностью памяти. Ожидайте 4-8 токенов/сек на модели 7B на современном CPU без GPU.
Цена: Бесплатно, лицензия MIT.
Платформы: Windows, macOS, Linux.
Скачать: GPT4All
Итог: Для офисного ПК без GPU. Он все еще запускает помощника.
5. llama.cpp, лучше всего для управления на уровне железа
llama.cpp — это движок, который оборачивают большинство приложений выше. Запуск его напрямую — это самый быстрый путь на старом оборудовании, потому что нет накладных расходов. Бинарник llama-server открывает HTTP-конечную точку; бинарник llama-cli запускает интерактивный чат. Все — это один C++-проект без рантайма.
Где он не удается: Только командная строка. Конфигурация находится в флагах, а не в интерфейсе.
Цена: Бесплатно, лицензия MIT.
Платформы: Windows, macOS, Linux (сборка из исходного кода везде).
Скачать: GitHub
Итог: Выбор, когда цель — выжать каждый последний токен в секунду из старой машины.
6. Open WebUI, лучше всего для веб-интерфейса
Open WebUI — это самостоятельно размещенный веб-интерфейс, который разговаривает с Ollama (или любой OpenAI-совместимой конечной точкой). Установите его на старый ПК, и каждое устройство в локальной сети получает ChatGPT-подобную страницу на http://server-ip:3000. Пользователи, разрешения, документы RAG и маршрутизация нескольких моделей — все встроено.
Где он не удается: Работает поверх backend-моделей, поэтому требует Ollama или OpenAI-совместимого сервера позади.
Цена: Бесплатно, самостоятельное размещение; BSD-3-Clause.
Платформы: Docker на любом хосте.
Скачать: GitHub
Итог: Интерфейс пользователя, который хотят большинство семей. Установите его сразу после Ollama.
7. LocalAI, лучше всего для замены OpenAI “под ключ”
LocalAI заменяет OpenAI API в локальной сети. Дополнения чата, вложения, генерация изображений (Stable Diffusion), преобразование текста в речь и речи в текст — все находятся за теми же HTTP-конечными точками, которые использует OpenAI. Любой инструмент с OpenAI SDK работает на LocalAI, изменяя одну переменную окружения.
Где он не удается: Широкая область означает более медленный запуск. Каждый модальный режим имеет свой собственный выбор модели.
Цена: Бесплатно, лицензия MIT.
Платформы: Docker на Linux, Windows (WSL2), macOS.
Итог: Выберите это, когда цель — заменить OpenAI локальным сервером сразу во многих приложениях.
Как выбрать правильную комбинацию
Для домашней лаборатории, которая просто должна работать: Ollama плюс Open WebUI. Один обслуживает модели в локальной сети; другой дает семье страницу для посещения.
Для друга, который не будет трогать терминал: LM Studio на рабочем столе и позвольте ему разговаривать локально.
Для старого ПК только для CPU в офисе: GPT4All с моделью 3B. Или llama.cpp с той же моделью, если терминал в порядке.
Для универсального решения, которое дает и чат, и сервер без разделения на два приложения: Jan.
Для домашнего хозяйства с множеством AI-инструментов (личные помощники, IDE для кодирования, приложения для заметок): LocalAI, чтобы каждый инструмент видел OpenAI-подобную конечную точку.
FAQ
Какую модель мне следует запустить в первую очередь? Llama 3.2 3B или Qwen 2.5 3B на Q4_K_M. Обе помещаются в 4 ГБ оперативной памяти, работают со скоростью 15-30 токенов/сек на одном современном CPU и дают практически флагманские ответы на обычные вопросы.
Мне нужен GPU? Нет, но это меняет то, что вы можете запустить. Без GPU ожидайте модели 7B на скорости 5-10 токенов/сек. Даже с используемой Nvidia RTX 3060 (12 ГБ), модель 13B на скорости 30-50 токенов/сек становится практичной.
Сколько оперативной памяти мне нужно? 16 ГБ — минимум для моделей 7B. 32 ГБ открывает территорию 13B. 64 ГБ или больше начинает держать 34B и 70B (с квантизацией).
Могу ли я получить доступ к этому извне дома? Да, через сетку VPN, например Tailscale. Не открывайте конечную точку Ollama или LocalAI в общедоступный Интернет. По умолчанию нет встроенной аутентификации.
Сколько энергии потребляет старый ПК в режиме ожидания? Старый рабочий стол с GPU потребляет 40-80 Вт в режиме ожидания. Это 50-100 долларов в год электричества в большинстве рынков. Если машина запрашивается только несколько раз в день, установите пробуждение по LAN в BIOS и переведите ее в спящий режим между сеансами.
Как это сравнивается с запуском Ollama на Mac mini? Mac mini с Apple Silicon с 16 или 24 ГБ унифицированной памяти — это наиболее энергоэффективный путь. Если старый ПК все еще полезен где-то, оставьте его. Если начинать с нуля, используемый M1 mini часто превосходит башню 2018 года в ватт-часах на токен.