Лучшие приложения для превращения старого ПК в локальный AI-сервер

У этого старого игрового ПК, лежащего в шкафу, впереди еще много жизни. Машина эпохи 2018 года с процессором Ryzen или Intel, 32 ГБ оперативной памяти и б/у видеокартой запустит модель 7B на скорости разговора и комфортно справится с моделью 13B. Укажите семейные ноутбуки на сервер, и у вас будет приватный, всегда включенный AI, который отвечает в локальной сети за пару секунд. Лучшие приложения для превращения старого ПК в локальный AI-сервер хорошо выбирают модели, поставляют HTTP API для других инструментов и позволяют машине спать между запросами. Мы выбрали семь приложений, которые превратят оборудование десятилетней давности в полезный AI-сервис.

На что обратить внимание в приложении локального AI-сервера

Шесть вещей имеют значение для AI на старом оборудовании:

Быстрое сравнение

Приложение Лучше всего для Поддержка GPU API Особенность
Ollama Самый простой сервер Nvidia, AMD, Apple OpenAI-совместимый Одна команда запускает модель
LM Studio Дружественный интерфейс Nvidia, AMD, Apple OpenAI-совместимый Лучшее открытие моделей
Jan Полностью локальный ChatGPT Nvidia, AMD, Apple OpenAI-совместимый Чат плюс сервер в одном приложении
GPT4All Базовая линия только для CPU Nvidia, AMD, CPU Локальный API Работает на очень старом оборудовании
llama.cpp Управление на уровне железа Nvidia, AMD, Apple, CPU Чистый HTTP Движок большинства приложений из списка
Open WebUI Веб-интерфейс для Ollama Любой (клиент) Подключается к Ollama ChatGPT-подобный интерфейс для локальной сети
LocalAI Замена OpenAI “под ключ” Nvidia, AMD, CPU OpenAI-совместимый Обслуживает изображения, аудио, вложения

Приложения

1. Ollama, лучше всего для “запуск модели одной командой”

Ollama поставляет фоновый сервис, который загружает, квантизирует и обслуживает модели из отобранной библиотеки. Одна команда (ollama run llama3.2) загружает веса, загружает модель и открывает пользователю чат. Сервис открывает OpenAI-совместимую конечную точку на localhost:11434, так что любой инструмент, который разговаривает с OpenAI, может указать на старый ПК и получить то же самое поведение.

Где он не удается: Собственная библиотека Ollama использует пользовательский формат манифеста. Использование случайного GGUF из Hugging Face требует небольшой Modelfile и шага импорта.

Цена: Бесплатно, лицензия MIT.

Платформы: Windows, macOS, Linux.

Скачать: Ollama

Итог: Начните отсюда. Установите его, выполните одну команду, и локальная сеть получает AI-сервер.

2. LM Studio, лучше всего для дружественного интерфейса

LM Studio — это настольное приложение, которое просматривает Hugging Face, загружает модели GGUF и запускает их локально. Он имеет интерфейс чата и переключатель “локальный сервер”, который открывает OpenAI-совместимую конечную точку. Интерфейс показывает прогнозируемое использование ОЗУ и VRAM перед загрузкой, что действительно полезно при выборе квантизации.

Где он не удается: Закрытый исходный код. Некоторые части приложения зависят от доступности в Интернете даже для локального использования, хотя модель работает автономно.

Цена: Бесплатно для личного использования.

Платформы: Windows, macOS, Linux.

Скачать: LM Studio

Итог: Выберите это, когда друг, запускающий старый ПК, не хочет трогать терминал.

3. Jan, лучше всего для полностью локального клона ChatGPT

Jan — это настольное приложение, которое поставляется как ChatGPT-подобный клиент, менеджер моделей и локальный API-сервер в одном пакете. Загрузки моделей видны, и “режим сервера” делает те же модели доступными для других приложений в локальной сети. Весь дизайн с открытым исходным кодом и ориентирован на конфиденциальность.

Где он не удается: Новее чем Ollama и LM Studio; случайные шероховатости в поддержке моделей.

Цена: Бесплатно, лицензия AGPL.

Платформы: Windows, macOS, Linux.

Скачать: Jan

Итог: Выбор, если цель — одно приложение, которое действует как клиент чата и сервер в локальной сети.

4. GPT4All, лучше всего для базовой линии только для CPU

GPT4All был разработан для случая, когда нет GPU вообще. Он запускает модели GGUF на CPU с приемлемой производительностью на любой машине с 2018 года и позже. Настольное приложение управляет моделями, и локальный API-сервер можно включить из настроек.

Где он не удается: Скорость на CPU ограничена пропускной способностью памяти. Ожидайте 4-8 токенов/сек на модели 7B на современном CPU без GPU.

Цена: Бесплатно, лицензия MIT.

Платформы: Windows, macOS, Linux.

Скачать: GPT4All

Итог: Для офисного ПК без GPU. Он все еще запускает помощника.

5. llama.cpp, лучше всего для управления на уровне железа

llama.cpp — это движок, который оборачивают большинство приложений выше. Запуск его напрямую — это самый быстрый путь на старом оборудовании, потому что нет накладных расходов. Бинарник llama-server открывает HTTP-конечную точку; бинарник llama-cli запускает интерактивный чат. Все — это один C++-проект без рантайма.

Где он не удается: Только командная строка. Конфигурация находится в флагах, а не в интерфейсе.

Цена: Бесплатно, лицензия MIT.

Платформы: Windows, macOS, Linux (сборка из исходного кода везде).

Скачать: GitHub

Итог: Выбор, когда цель — выжать каждый последний токен в секунду из старой машины.

6. Open WebUI, лучше всего для веб-интерфейса

Open WebUI — это самостоятельно размещенный веб-интерфейс, который разговаривает с Ollama (или любой OpenAI-совместимой конечной точкой). Установите его на старый ПК, и каждое устройство в локальной сети получает ChatGPT-подобную страницу на http://server-ip:3000. Пользователи, разрешения, документы RAG и маршрутизация нескольких моделей — все встроено.

Где он не удается: Работает поверх backend-моделей, поэтому требует Ollama или OpenAI-совместимого сервера позади.

Цена: Бесплатно, самостоятельное размещение; BSD-3-Clause.

Платформы: Docker на любом хосте.

Скачать: GitHub

Итог: Интерфейс пользователя, который хотят большинство семей. Установите его сразу после Ollama.

7. LocalAI, лучше всего для замены OpenAI “под ключ”

LocalAI заменяет OpenAI API в локальной сети. Дополнения чата, вложения, генерация изображений (Stable Diffusion), преобразование текста в речь и речи в текст — все находятся за теми же HTTP-конечными точками, которые использует OpenAI. Любой инструмент с OpenAI SDK работает на LocalAI, изменяя одну переменную окружения.

Где он не удается: Широкая область означает более медленный запуск. Каждый модальный режим имеет свой собственный выбор модели.

Цена: Бесплатно, лицензия MIT.

Платформы: Docker на Linux, Windows (WSL2), macOS.

Скачать: LocalAI · GitHub

Итог: Выберите это, когда цель — заменить OpenAI локальным сервером сразу во многих приложениях.

Как выбрать правильную комбинацию

Для домашней лаборатории, которая просто должна работать: Ollama плюс Open WebUI. Один обслуживает модели в локальной сети; другой дает семье страницу для посещения.

Для друга, который не будет трогать терминал: LM Studio на рабочем столе и позвольте ему разговаривать локально.

Для старого ПК только для CPU в офисе: GPT4All с моделью 3B. Или llama.cpp с той же моделью, если терминал в порядке.

Для универсального решения, которое дает и чат, и сервер без разделения на два приложения: Jan.

Для домашнего хозяйства с множеством AI-инструментов (личные помощники, IDE для кодирования, приложения для заметок): LocalAI, чтобы каждый инструмент видел OpenAI-подобную конечную точку.

FAQ

Какую модель мне следует запустить в первую очередь? Llama 3.2 3B или Qwen 2.5 3B на Q4_K_M. Обе помещаются в 4 ГБ оперативной памяти, работают со скоростью 15-30 токенов/сек на одном современном CPU и дают практически флагманские ответы на обычные вопросы.

Мне нужен GPU? Нет, но это меняет то, что вы можете запустить. Без GPU ожидайте модели 7B на скорости 5-10 токенов/сек. Даже с используемой Nvidia RTX 3060 (12 ГБ), модель 13B на скорости 30-50 токенов/сек становится практичной.

Сколько оперативной памяти мне нужно? 16 ГБ — минимум для моделей 7B. 32 ГБ открывает территорию 13B. 64 ГБ или больше начинает держать 34B и 70B (с квантизацией).

Могу ли я получить доступ к этому извне дома? Да, через сетку VPN, например Tailscale. Не открывайте конечную точку Ollama или LocalAI в общедоступный Интернет. По умолчанию нет встроенной аутентификации.

Сколько энергии потребляет старый ПК в режиме ожидания? Старый рабочий стол с GPU потребляет 40-80 Вт в режиме ожидания. Это 50-100 долларов в год электричества в большинстве рынков. Если машина запрашивается только несколько раз в день, установите пробуждение по LAN в BIOS и переведите ее в спящий режим между сеансами.

Как это сравнивается с запуском Ollama на Mac mini? Mac mini с Apple Silicon с 16 или 24 ГБ унифицированной памяти — это наиболее энергоэффективный путь. Если старый ПК все еще полезен где-то, оставьте его. Если начинать с нуля, используемый M1 mini часто превосходит башню 2018 года в ватт-часах на токен.