llama.cpp

XDA опубликовали статью в этом месяце, утверждая, что меньший локальный AI стек — это более продуктивный локальный AI стек. Автор накопил обычный беспорядок: два запуска моделей, три пользовательских интерфейса, базу векторов, которую никто не использовал, и папку адаптеров, которую они забыли. Сокращение до минимального набора облегчило установку, сделало ее проще в обслуживании и проще в использовании. Мы протестировали восемь лучших приложений для минималистичного локального AI стека на рабочем столе, на MacBook Pro M3, рабочей станции Windows с RTX 4070 и на Debian боксе с AMD 7800 XT, сосредоточившись на том, как каждое из них работает как единственный инструмент в стеке, а не как один из многих.

На что обратить внимание в минималистичном приложении для локального AI

Быстрое сравнение

Приложение Лучше всего для Платформы Бесплатный план Начальная цена Выдающаяся функция
llama.cpp Эталонный runtime Windows, macOS, Linux Бесплатно, открытый исходный код Бесплатно Портативный одиночный бинарный файл inference
llamafile Один файл, без установки Windows, macOS, Linux Бесплатно, открытый исходный код Бесплатно Модель плюс runtime в одном исполняемом файле
Ollama Самый простой CLI плюс API Windows, macOS, Linux Бесплатно, открытый исходный код Бесплатно ollama run и у вас есть конечная точка OpenAI
Jan Собственный пользовательский интерфейс рабочего стола с API Windows, macOS, Linux Бесплатно, открытый исходный код Бесплатно Кроссплатформенный чат рабочего стола
KoboldCpp Одиночный бинарный файл пользовательского интерфейса плюс API Windows, macOS, Linux Бесплатно, открытый исходный код Бесплатно GGUF runner с встроенным веб пользовательским интерфейсом
Msty Отполированный платный пользовательский интерфейс на локальных моделях Windows, macOS, Linux Бесплатный уровень Подписка Msty для продвинутых функций Многомодельный интерфейс чата
GPT4All Простейший чат только для рабочего стола Windows, macOS, Linux Бесплатно, открытый исходный код Бесплатно Дружеский для начинающих, нет CLI
LM Studio Полнофункциональный локальный runner Windows, macOS, Linux Бесплатно для личного пользования Коммерческое лицензирование Интерфейс обнаружения модели, широкая поддержка бэкэнда

Приложения

1. llama.cpp — лучший для эталонного runtime, на котором строят все остальные

llama.cpp — это runtime, который большая часть этого списка обворачивает тем или иным способом. Это портативный независимый от зависимостей C++ сервер inference, который запускает модели GGUF на CPU, Metal, CUDA и ROCm. Сам по себе как минималистичный стек, llama-server предоставляет вам совместимую с OpenAI конечную точку, а llama-cli дает вам REPL. Этого достаточно для большей части локальной AI работы.

Где это не справляется: Нет отполированного пользовательского интерфейса. Вы компилируете или загружаете бинарный файл релиза. Управление моделью ручное.

Цены:

Платформы: Windows, macOS, Linux

Загрузить: github.com/ggerganov/llama.cpp

Краткое резюме: llama.cpp — это выбор, когда вы хотите как можно меньше движущихся частей и вам удобно в терминале.

2. llamafile — лучший для runtime и модели в одном исполняемом файле

llamafile от проекта Mozilla Ocho объединяет модель и runtime llama.cpp в один бинарный файл Cosmopolitan-libc, который работает на Windows, macOS и Linux без установки. Загрузите файл, chmod его, запустите его. Он открывает браузерный пользовательский интерфейс и предоставляет совместимую с OpenAI API на localhost. Это наиболее буквальное толкование “минималистичного локального AI” в списке.

Где это не справляется: Портативные одиночные бинарные файлы могут вызвать проблемы с инструментами безопасности хоста. Загрузка новой модели означает загрузку нового llamafile.

Цены:

Платформы: Windows, macOS, Linux

Загрузить: github.com/Mozilla-Ocho/llamafile

Краткое резюме: llamafile — это выбор, когда установка должна быть одним файлом и только одним файлом.

3. Ollama — лучший для самого простого CLI плюс API рабочего процесса

Ollama обворачивает llama.cpp с самым чистым опытом установки и команд из всего в этом списке. ollama pull llama3.2:8b загружает модель. ollama run llama3.2:8b открывает чат. ollama serve предоставляет совместимую с OpenAI конечную точку на портике 11434 по умолчанию. Формат Modelfile позволяет закрепить системные подсказки и параметры с одним текстовым файлом.

Где это не справляется: Установка по умолчанию запускает сервер как фоновую службу, которая вам может быть не нужна. Ручная квантизация модели ограничена по сравнению с raw llama.cpp.

Цены:

Платформы: Windows, macOS, Linux

Загрузить: ollama.com

Краткое резюме: Ollama — это выбор, когда установка в одну команду и запуск в одну команду — это минимальная планка.

4. Jan — лучший для собственного пользовательского интерфейса рабочего стола, который вы владеете

Jan — это создаваемое с нуля приложение рабочего стола для локальных моделей, с открытым исходным кодом, со встроенным сервером API, совместимым с OpenAI. Это то, что вы устанавливаете, когда хотите настоящий чат рабочего стола без поверхности LM Studio. Команда поставляет сборки для всех трех ОС и сохраняет простой поток обнаружения модели.

Где это не справляется: Более молодой проект, чем LM Studio или Ollama. Некоторые продвинутые функции (специализированные бэкэнды, глубокая кастомизация модели) отстают.

Цены:

Платформы: Windows, macOS, Linux

Загрузить: jan.ai

Краткое резюме: Jan — это выбор, когда правильный пользовательский интерфейс рабочего стола является решающим фактором.

5. KoboldCpp — лучший для одиночного бинарного файла пользовательского интерфейса плюс API на портативной мишени

KoboldCpp начался как форк llama.cpp, предназначенный для сообщества KoboldAI, и превратился в одиночный бинарный файл GGUF runner с браузерным пользовательским интерфейсом, конечной точкой API, поддержкой изображений и аудио входа и без этапа установки. Поместите бинарный файл и GGUF рядом, запустите одну команду, и все готово.

Где это не справляется: Некоторые специализированные функции (интеграция Horde, подсказки специфичные для KoboldAI) не важны для использования общего чата.

Цены:

Платформы: Windows, macOS, Linux

Загрузить: github.com/LostRuins/koboldcpp

Краткое резюме: KoboldCpp — это выбор, когда вам нужен одиночный бинарный файл, который дает вам и пользовательский интерфейс, и API без более тяжелого приложения.

6. Msty — лучший для отполированного коммерческого пользовательского интерфейса на локальных моделях

Msty использует подход LM Studio и производит более чистый пользовательский интерфейс. Чатьте рядом с несколькими моделями, подключитесь к локальным конечным точкам Ollama или Jan, и организуйте разговоры в папках. Бесплатный уровень щедрый; платный уровень — это то, что разблокирует функции для нескольких пользователей и рабочего пространства.

Где это не справляется: Закрытый исходный код. Не на минималистичном конце “установить один бинарный файл с открытым исходным кодом”. Для одиночного пользователя, который предпочитает полировку принципам, это нормально.

Цены:

Платформы: Windows, macOS, Linux

Загрузить: msty.app

Краткое резюме: Msty — это выбор, когда полировка пользовательского интерфейса стоит того, чтобы пожертвовать ограничением с открытым исходным кодом.

7. GPT4All — лучший для дружественного для начинающих чата рабочего стола

GPT4All от Nomic — это самый дружелюбный способ запустить локальную LLM для человека, который не хочет касаться терминала. Установите приложение, просмотрите кураторский список моделей, выберите одну, чатьте. Он также предоставляет локальный API и интегрируется с Nomic Atlas для документооснованного RAG, если вы решите выйти за рамки чата.

Где это не справляется: Кураторский список моделей — это небольшое подмножество того, что доступно на Hugging Face. Продвинутые пользователи вырастают из него.

Цены:

Платформы: Windows, macOS, Linux

Загрузить: gpt4all.io

Краткое резюме: GPT4All — это выбор для пользователя локального AI в первый раз, который хочет приложение рабочего стола, которое просто работает.

8. LM Studio — лучший для полнофункционального локального runner

LM Studio — это максималистичный конец “все еще одно приложение рабочего стола”. Обнаружение модели из Hugging Face, поддержка нескольких бэкэндов (llama.cpp, MLX на Apple Silicon), полный пользовательский интерфейс чата, сервер API и поверхность конфигурации модели, которая все открывает. Это то, на что люди переходят по умолчанию, когда простота Ollama слишком ограничена.

Где это не справляется: Не открытый исходный код. Больший размер установки, чем выше. Максималистичная поверхность функций — это противоположность минималистичному стеку, который аргументировал кусок XDA, но он включен здесь как справочная точка для того, что происходит, когда вы отказываетесь урезать.

Цены:

Платформы: Windows, macOS, Linux

Загрузить: lmstudio.ai

Краткое резюме: LM Studio — это выбор, когда полнофункциональный локальный runner стоит большей установки, чем любой из вышеперечисленных.

Как выбрать правильный

ЧЗВ

Какую модель я должен запустить на 16 ГБ ОЗУ? Квантизация Q4 модели 7B или 8B работает хорошо в этом конверте и охватывает большинство случаев чата и кодирования. Квантизация Q4 из 13B возможна, но плотная.

Работают ли эти приложения на Apple Silicon? Да. llama.cpp, Ollama, Jan, KoboldCpp, LM Studio и Msty все используют Metal на Apple Silicon и получают практически встроенную скорость. llamafile поставляется с бинарными файлами Apple Silicon.

Могу ли я указать инструменты в стиле ChatGPT на локальную модель? Да. Ollama, llama.cpp, Jan, KoboldCpp, LM Studio и llamafile все предоставляют совместимую с OpenAI конечную точку на localhost. Укажите любой инструмент, который принимает пользовательский базовый URL, на http://localhost:<port>/v1.

Чем минималистичный стек отличается от максималистичного? Меньше движущихся частей. Один runtime, один менеджер моделей, один пользовательский интерфейс. Максималистичные стеки добавляют векторные базы данных, слои оркестрации и фреймворки агентов. Большинство одиночных пользователей не нуждаются ни в чем из этого, пока конкретная проблема не потребует этого.

Какие из них способны быть агентами сразу же? Нет. Это runtime inference и чат пользовательские интерфейсы. Для цикла агента вы добавляете отдельный инструмент, который говорит протокол OpenAI Chat Completions против одной из этих конечных точек.

Какой стек наименьший на диске? llamafile плюс одна количественная модель — это самая легкая возможная установка. Ollama плюс его хранилище моделей — это близкий вторичный и проще расти.