XDA опубликовали статью в этом месяце, утверждая, что меньший локальный AI стек — это более продуктивный локальный AI стек. Автор накопил обычный беспорядок: два запуска моделей, три пользовательских интерфейса, базу векторов, которую никто не использовал, и папку адаптеров, которую они забыли. Сокращение до минимального набора облегчило установку, сделало ее проще в обслуживании и проще в использовании. Мы протестировали восемь лучших приложений для минималистичного локального AI стека на рабочем столе, на MacBook Pro M3, рабочей станции Windows с RTX 4070 и на Debian боксе с AMD 7800 XT, сосредоточившись на том, как каждое из них работает как единственный инструмент в стеке, а не как один из многих.
На что обратить внимание в минималистичном приложении для локального AI
- Установка одного бинарного файла или близко к этому. Инструмент, который устанавливается через
brew installили.msiлучше инструмента, которому нужен Docker плюс Python плюс файл конфигурации. - Управление моделью, которое не мешает. Загрузка GGUF должна быть одной командой. Удаление одного не должно требовать поиска скрытой папки.
- Совместимость с API. Совместимая с OpenAI конечная точка — это то, что позволяет вам указать любой инструмент на вашу локальную модель без переписывания обеих сторон.
- Автоматическое обнаружение GPU и CPU. Стек должен определить, есть ли у вас Metal, CUDA, ROCm или только CPU и использовать правильный вариант. Ручной выбор бэкэнда — это беспорядок, который эти инструменты должны были удалить.
- Дисциплина в использовании памяти. Инструмент, который работает на холостом ходу с использованием 2 ГБ ОЗУ для обслуживания модели, которая умещается в 8 ГБ, делает что-то неправильно.
Быстрое сравнение
| Приложение | Лучше всего для | Платформы | Бесплатный план | Начальная цена | Выдающаяся функция |
|---|---|---|---|---|---|
| llama.cpp | Эталонный runtime | Windows, macOS, Linux | Бесплатно, открытый исходный код | Бесплатно | Портативный одиночный бинарный файл inference |
| llamafile | Один файл, без установки | Windows, macOS, Linux | Бесплатно, открытый исходный код | Бесплатно | Модель плюс runtime в одном исполняемом файле |
| Ollama | Самый простой CLI плюс API | Windows, macOS, Linux | Бесплатно, открытый исходный код | Бесплатно | ollama run и у вас есть конечная точка OpenAI |
| Jan | Собственный пользовательский интерфейс рабочего стола с API | Windows, macOS, Linux | Бесплатно, открытый исходный код | Бесплатно | Кроссплатформенный чат рабочего стола |
| KoboldCpp | Одиночный бинарный файл пользовательского интерфейса плюс API | Windows, macOS, Linux | Бесплатно, открытый исходный код | Бесплатно | GGUF runner с встроенным веб пользовательским интерфейсом |
| Msty | Отполированный платный пользовательский интерфейс на локальных моделях | Windows, macOS, Linux | Бесплатный уровень | Подписка Msty для продвинутых функций | Многомодельный интерфейс чата |
| GPT4All | Простейший чат только для рабочего стола | Windows, macOS, Linux | Бесплатно, открытый исходный код | Бесплатно | Дружеский для начинающих, нет CLI |
| LM Studio | Полнофункциональный локальный runner | Windows, macOS, Linux | Бесплатно для личного пользования | Коммерческое лицензирование | Интерфейс обнаружения модели, широкая поддержка бэкэнда |
Приложения
1. llama.cpp — лучший для эталонного runtime, на котором строят все остальные
llama.cpp — это runtime, который большая часть этого списка обворачивает тем или иным способом. Это портативный независимый от зависимостей C++ сервер inference, который запускает модели GGUF на CPU, Metal, CUDA и ROCm. Сам по себе как минималистичный стек, llama-server предоставляет вам совместимую с OpenAI конечную точку, а llama-cli дает вам REPL. Этого достаточно для большей части локальной AI работы.
Где это не справляется: Нет отполированного пользовательского интерфейса. Вы компилируете или загружаете бинарный файл релиза. Управление моделью ручное.
Цены:
- Бесплатно: полностью открытый исходный код
- Платно: нет
Платформы: Windows, macOS, Linux
Загрузить: github.com/ggerganov/llama.cpp
Краткое резюме: llama.cpp — это выбор, когда вы хотите как можно меньше движущихся частей и вам удобно в терминале.
2. llamafile — лучший для runtime и модели в одном исполняемом файле
llamafile от проекта Mozilla Ocho объединяет модель и runtime llama.cpp в один бинарный файл Cosmopolitan-libc, который работает на Windows, macOS и Linux без установки. Загрузите файл, chmod его, запустите его. Он открывает браузерный пользовательский интерфейс и предоставляет совместимую с OpenAI API на localhost. Это наиболее буквальное толкование “минималистичного локального AI” в списке.
Где это не справляется: Портативные одиночные бинарные файлы могут вызвать проблемы с инструментами безопасности хоста. Загрузка новой модели означает загрузку нового llamafile.
Цены:
- Бесплатно: полностью открытый исходный код
- Платно: нет
Платформы: Windows, macOS, Linux
Загрузить: github.com/Mozilla-Ocho/llamafile
Краткое резюме: llamafile — это выбор, когда установка должна быть одним файлом и только одним файлом.
3. Ollama — лучший для самого простого CLI плюс API рабочего процесса
Ollama обворачивает llama.cpp с самым чистым опытом установки и команд из всего в этом списке. ollama pull llama3.2:8b загружает модель. ollama run llama3.2:8b открывает чат. ollama serve предоставляет совместимую с OpenAI конечную точку на портике 11434 по умолчанию. Формат Modelfile позволяет закрепить системные подсказки и параметры с одним текстовым файлом.
Где это не справляется: Установка по умолчанию запускает сервер как фоновую службу, которая вам может быть не нужна. Ручная квантизация модели ограничена по сравнению с raw llama.cpp.
Цены:
- Бесплатно: полностью открытый исходный код
- Платно: нет
Платформы: Windows, macOS, Linux
Загрузить: ollama.com
Краткое резюме: Ollama — это выбор, когда установка в одну команду и запуск в одну команду — это минимальная планка.
4. Jan — лучший для собственного пользовательского интерфейса рабочего стола, который вы владеете
Jan — это создаваемое с нуля приложение рабочего стола для локальных моделей, с открытым исходным кодом, со встроенным сервером API, совместимым с OpenAI. Это то, что вы устанавливаете, когда хотите настоящий чат рабочего стола без поверхности LM Studio. Команда поставляет сборки для всех трех ОС и сохраняет простой поток обнаружения модели.
Где это не справляется: Более молодой проект, чем LM Studio или Ollama. Некоторые продвинутые функции (специализированные бэкэнды, глубокая кастомизация модели) отстают.
Цены:
- Бесплатно: полностью открытый исходный код
- Платно: нет
Платформы: Windows, macOS, Linux
Загрузить: jan.ai
Краткое резюме: Jan — это выбор, когда правильный пользовательский интерфейс рабочего стола является решающим фактором.
5. KoboldCpp — лучший для одиночного бинарного файла пользовательского интерфейса плюс API на портативной мишени
KoboldCpp начался как форк llama.cpp, предназначенный для сообщества KoboldAI, и превратился в одиночный бинарный файл GGUF runner с браузерным пользовательским интерфейсом, конечной точкой API, поддержкой изображений и аудио входа и без этапа установки. Поместите бинарный файл и GGUF рядом, запустите одну команду, и все готово.
Где это не справляется: Некоторые специализированные функции (интеграция Horde, подсказки специфичные для KoboldAI) не важны для использования общего чата.
Цены:
- Бесплатно: полностью открытый исходный код
- Платно: нет
Платформы: Windows, macOS, Linux
Загрузить: github.com/LostRuins/koboldcpp
Краткое резюме: KoboldCpp — это выбор, когда вам нужен одиночный бинарный файл, который дает вам и пользовательский интерфейс, и API без более тяжелого приложения.
6. Msty — лучший для отполированного коммерческого пользовательского интерфейса на локальных моделях
Msty использует подход LM Studio и производит более чистый пользовательский интерфейс. Чатьте рядом с несколькими моделями, подключитесь к локальным конечным точкам Ollama или Jan, и организуйте разговоры в папках. Бесплатный уровень щедрый; платный уровень — это то, что разблокирует функции для нескольких пользователей и рабочего пространства.
Где это не справляется: Закрытый исходный код. Не на минималистичном конце “установить один бинарный файл с открытым исходным кодом”. Для одиночного пользователя, который предпочитает полировку принципам, это нормально.
Цены:
- Бесплатно: полный основной пользовательский интерфейс
- Платно: подписка Msty для продвинутых функций рабочего пространства
Платформы: Windows, macOS, Linux
Загрузить: msty.app
Краткое резюме: Msty — это выбор, когда полировка пользовательского интерфейса стоит того, чтобы пожертвовать ограничением с открытым исходным кодом.
7. GPT4All — лучший для дружественного для начинающих чата рабочего стола
GPT4All от Nomic — это самый дружелюбный способ запустить локальную LLM для человека, который не хочет касаться терминала. Установите приложение, просмотрите кураторский список моделей, выберите одну, чатьте. Он также предоставляет локальный API и интегрируется с Nomic Atlas для документооснованного RAG, если вы решите выйти за рамки чата.
Где это не справляется: Кураторский список моделей — это небольшое подмножество того, что доступно на Hugging Face. Продвинутые пользователи вырастают из него.
Цены:
- Бесплатно: полностью открытый исходный код
- Платно: нет
Платформы: Windows, macOS, Linux
Загрузить: gpt4all.io
Краткое резюме: GPT4All — это выбор для пользователя локального AI в первый раз, который хочет приложение рабочего стола, которое просто работает.
8. LM Studio — лучший для полнофункционального локального runner
LM Studio — это максималистичный конец “все еще одно приложение рабочего стола”. Обнаружение модели из Hugging Face, поддержка нескольких бэкэндов (llama.cpp, MLX на Apple Silicon), полный пользовательский интерфейс чата, сервер API и поверхность конфигурации модели, которая все открывает. Это то, на что люди переходят по умолчанию, когда простота Ollama слишком ограничена.
Где это не справляется: Не открытый исходный код. Больший размер установки, чем выше. Максималистичная поверхность функций — это противоположность минималистичному стеку, который аргументировал кусок XDA, но он включен здесь как справочная точка для того, что происходит, когда вы отказываетесь урезать.
Цены:
- Бесплатно: личное использование
- Платно: коммерческое лицензирование для коммерческих развертываний
Платформы: Windows, macOS, Linux
Загрузить: lmstudio.ai
Краткое резюме: LM Studio — это выбор, когда полнофункциональный локальный runner стоит большей установки, чем любой из вышеперечисленных.
Как выбрать правильный
- Минимально жизнеспособный стек: Ollama. Установите его, загрузите модель, готово. Все остальное опционально.
- Если вы предпочли бы один файл и без установки: llamafile.
- Если вы хотите эталонный runtime без обертки: llama.cpp напрямую.
- Если вы хотите чат рабочего стола и открытый исходный код: Jan.
- Если вы хотите одиночный бинарный файл, который также является пользовательским интерфейсом: KoboldCpp.
- Если полировка более важна, чем открытый исходный код: Msty поверх конечной точки Ollama.
- Если вы никогда не устанавливали локальную модель раньше: GPT4All.
- Если вы переросли Ollama и хотите больше настроек: LM Studio.
ЧЗВ
Какую модель я должен запустить на 16 ГБ ОЗУ? Квантизация Q4 модели 7B или 8B работает хорошо в этом конверте и охватывает большинство случаев чата и кодирования. Квантизация Q4 из 13B возможна, но плотная.
Работают ли эти приложения на Apple Silicon? Да. llama.cpp, Ollama, Jan, KoboldCpp, LM Studio и Msty все используют Metal на Apple Silicon и получают практически встроенную скорость. llamafile поставляется с бинарными файлами Apple Silicon.
Могу ли я указать инструменты в стиле ChatGPT на локальную модель? Да. Ollama, llama.cpp, Jan, KoboldCpp, LM Studio и llamafile все предоставляют совместимую с OpenAI конечную точку на localhost. Укажите любой инструмент, который принимает пользовательский базовый URL, на http://localhost:<port>/v1.
Чем минималистичный стек отличается от максималистичного? Меньше движущихся частей. Один runtime, один менеджер моделей, один пользовательский интерфейс. Максималистичные стеки добавляют векторные базы данных, слои оркестрации и фреймворки агентов. Большинство одиночных пользователей не нуждаются ни в чем из этого, пока конкретная проблема не потребует этого.
Какие из них способны быть агентами сразу же? Нет. Это runtime inference и чат пользовательские интерфейсы. Для цикла агента вы добавляете отдельный инструмент, который говорит протокол OpenAI Chat Completions против одной из этих конечных точек.
Какой стек наименьший на диске? llamafile плюс одна количественная модель — это самая легкая возможная установка. Ollama плюс его хранилище моделей — это близкий вторичный и проще расти.