XDA провели неделю, тестируя все достойные внимания малые языковые модели для обычного ноутбука, и получили три работающих варианта. Статья вышла на той же неделе, когда Qwen 3, Llama 3.2 и Gemma 3 одновременно выпустили кванты с параметрами 1B–8B, которые работают намного лучше своего размера. Лучшие приложения для небольших локальных LLM на рабочем столе — это уже не исследовательские игрушки. Они занимают 4 ГБ оперативной памяти, работают без дискретной видеокарты и отвечают на повседневные вопросы достаточно быстро, чтобы заменить вкладку ChatGPT, которую вы держите открытой.
Мы протестировали восемь приложений на MacBook Air M2 (16 ГБ), среднеуровневом ноутбуке Ryzen с встроенной видеокартой и рабочей станции Fedora с 6 ГБ видеокартой NVIDIA. Каждое приложение оценивалось по скорости загрузки кванта 3B после свежей установки, качеству работы со смешанной нагрузкой (чат, код и краткие резюме документов) и удобству использования при видеозвонке в фоновом режиме.
На что обращать внимание в приложении для локального LLM
- Каталог малых моделей. Прямые загрузки Llama 3.2 (1B/3B), Qwen 3 (0.5B–8B), Gemma 3 (2B/4B), Phi-4-mini и SmolLM без поиска на Hugging Face.
- Предустановленные кванты. Кванты GGUF 4-бит и 5-бит — оптимальный выбор для машин с 8–16 ГБ памяти. Приложение должно по умолчанию выбирать что-то разумное.
- Резервный вариант только с CPU. Не у всех есть видеокарта. Приложение должно хорошо работать на встроенной графике или просто на процессоре.
- Объем памяти. Сколько оперативной памяти занимает само приложение до загрузки модели. Некоторые оболочки Electron требуют 800 МБ в режиме ожидания.
- OpenAI-совместимый API. Чтобы текстовый редактор, приложение для заметок или скрипт оболочки могли отправлять запросы одному процессу.
- Холодный запуск. Время от двойного щелчка до запущенного чата имеет значение, когда причина, по которой вы хотите локальное решение — это пропуск вкладки браузера.
Быстрое сравнение
| Приложение | Лучше всего для | Платформы | Бесплатный план | Платная | Рейтинг |
|---|---|---|---|---|---|
| Jan | Открытый клиент ChatGPT-подобный | Windows, macOS, Linux | Полностью бесплатно | Нет | 4.7 |
| Ollama | Простейший CLI + API ранвайм | Windows, macOS, Linux | Полностью бесплатно | Нет | 4.9 |
| LM Studio | Поиск модели с настоящим графическим интерфейсом | Windows, macOS, Linux | Полностью бесплатно личное | Обратитесь в продажи для работы | 4.8 |
| GPT4All | Локально + опциональный облачный резервный вариант | Windows, macOS, Linux | Полностью бесплатно | Нет | 4.5 |
| Msty | Сравнение чатов в разделенном виде между моделями | Windows, macOS, Linux | Полностью бесплатно | Aurum $99 lifetime | 4.7 |
| llamafile | Портативная модель в одном файле | Windows, macOS, Linux | Полностью бесплатно | Нет | 4.6 |
| Cortex | Ранвайм в стиле Ollama с меньшим объемом памяти | Windows, macOS, Linux | Полностью бесплатно | Нет | 4.4 |
| KoboldCpp | Писательские работы с длинным контекстом | Windows, macOS, Linux | Полностью бесплатно | Нет | 4.5 |
Приложения
1. Jan для локального LLM — лучший открытый клиент ChatGPT-подобный
Jan предоставляет приложение для рабочего стола в стиле ChatGPT, которое выглядит знакомо с момента открытия, а затем незаметно загружает Llama 3.2 3B или Qwen 3 4B в фоновом режиме. Встроены помощники, потоки, загрузка файлов и OpenAI-совместимый сервер. На MacBook Air M2 первый чат с Llama 3.2 3B начал отвечать на вопросы через три минуты после установки.
Где он подводит: Холодный запуск на Windows все еще отстает от macOS на несколько секунд. Для некоторого импорта из Hugging Face требуется ручное перетаскивание GGUF.
Цены:
- Бесплатно: полностью бесплатно, открытый исходный код под AGPL.
- Платно: нет.
Платформы: Windows, macOS, Linux.
Загрузить: jan.ai · github.com/janhq/jan
Суть: Выбор, если вы хотите опыт ChatGPT без подписки или интернета.
2. Ollama для локального LLM — лучший простейший CLI + API ранвайм
Ollama — это ранвайм, на котором строится все остальное. ollama run llama3.2:3b загружает квант, загружает его и начинает чат. OpenAI-совместимый API на порту 11434 означает, что любой редактор, приложение для заметок или скрипт, который говорит на OpenAI, может общаться с ним без изменений.
Где он подводит: Нет собственного графического интерфейса. Вы будете использовать Open WebUI или Msty для окна чата.
Цены:
- Бесплатно: полностью бесплатно, лицензия MIT.
- Платно: нет.
Платформы: Windows, macOS, Linux.
Загрузить: ollama.com · github.com/ollama/ollama
Суть: Начните с этого, даже если вы установите клиент чата. Большинство других приложений из этого списка могут указывать на Ollama.
3. LM Studio для локального LLM — лучший поиск моделей с настоящим графическим интерфейсом
LM Studio — это универсальное приложение для просмотра Hugging Face, выбора кванта и чата без использования терминала. Браузер моделей фильтрует по размеру и лицензии, что важно при попытке поместить модель в 6 ГБ оперативной памяти. Локальный сервер API — это один переключатель.
Где он подводит: Не открытый исходный код. Поддержка Linux отстает от Windows и macOS в новых функциях.
Цены:
- Бесплатно: полностью бесплатно для личного использования.
- Платно: обратитесь в отдел продаж для коммерческих развертываний.
Платформы: Windows, macOS, Linux.
Загрузить: lmstudio.ai
Суть: Самый гладкий графический интерфейс для просмотра и тестирования малых квантов рядом.
4. GPT4All для локального LLM — лучший локальный плюс опциональный облачный резервный вариант
GPT4All предоставляет приложение чата, которое запускает кванты GGUF локально и может также маршрутизировать на OpenAI или Groq, когда требуется более мощная модель. LocalDocs позволяет указать папку и получить ответы на основе фактов без отправки файлов куда-либо.
Где он подводит: Каталог моделей отстает на один шаг от LM Studio. Выгрузка GPU на Windows требует некоторых настроек.
Цены:
- Бесплатно: полностью бесплатно, открытый исходный код.
- Платно: нет.
Платформы: Windows, macOS, Linux.
Загрузить: gpt4all.io
Суть: Выберите это, когда вы хотите одно приложение, которое начинается локально и может использовать облако по требованию.
5. Msty для локального LLM — лучшее сравнение разделенного чата между моделями
Msty показывает ответы двух или трех моделей рядом. Это самый быстрый способ решить, подходит ли вам Qwen 3 4B или Gemma 3 4B для вашего стиля запроса. Он говорит на Ollama, LM Studio и облачных API, поэтому сравнение не ограничивается тем, что он размещает.
Где он подводит: Некоторые расширенные функции находятся за уровнем Aurum. Не открытый исходный код.
Цены:
- Бесплатно: полностью бесплатный чат и разделенный вид.
- Платно: Aurum $99 lifetime для стеков знаний и дополнительных функций.
Платформы: Windows, macOS, Linux.
Загрузить: msty.app
Суть: Выбор, если вы часто пробуете модели и хотите их видеть в полемике.
6. llamafile для локального LLM — лучший портативный модель в одном файле
llamafile заворачивает модель и ее ранвайм в один исполняемый файл. Поместите его на USB-накопитель, дважды щелкните на любой машине Windows, macOS или Linux, и откроется вкладка браузера с чатом. Это вклад Mozilla в Cosmopolitan libc, и он полностью устраняет шаг установки.
Где он подводит: Файлы могут быть размером 3–5 ГБ. Первый запуск на заблокированных корпоративных машинах может потребовать щелчка правой кнопкой мыши.
Цены:
- Бесплатно: полностью бесплатно, Apache 2.0.
- Платно: нет.
Платформы: Windows, macOS, Linux.
Загрузить: github.com/Mozilla-Ocho/llamafile
Суть: Правильный выбор для портативности, для демонстраций или для машины, на которую вы не можете установить программное обеспечение.
7. Cortex для локального LLM — лучший ранвайм в стиле Ollama с меньшим объемом памяти
Cortex — это ранвайм, который работает под Jan, открытый как отдельный демон. Это меньший объем памяти, чем Ollama в режиме ожидания, и по умолчанию использует llama.cpp с OpenAI-совместимым API. Загрузки моделей используют ту же экосистему GGUF.
Где он подводит: Меньшее сообщество, поэтому сторонних интеграций меньше. Документация все еще идет в ногу.
Цены:
- Бесплатно: полностью бесплатно, открытый исходный код.
- Платно: нет.
Платформы: Windows, macOS, Linux.
Загрузить: cortex.so · github.com/janhq/cortex.cpp
Суть: Выберите это, если Ollama кажется тяжелым и вы хотите более легкий демон, который все еще говорит на API OpenAI.
8. KoboldCpp для локального LLM — лучший для писательства с длинным контекстом
KoboldCpp — это форк llama.cpp, построенный вокруг художественной литературы, ролевых игр и писательства с длинным контекстом. Постоянная память персонажей, информация о мире и пользовательский интерфейс, сосредоточенный на работе, а не на вопросах и ответах, делают его отличным от других приложений в этом списке полезным способом. Он лучше, чем большинство графических интерфейсов, справляется с контекстами 32K–128K на малых моделях.
Где он подводит: Интерфейс плотный и откровенно сложный для опытного пользователя. Не приложение, которое нужно передать другу-профану.
Цены:
- Бесплатно: полностью бесплатно, AGPL.
- Платно: нет.
Платформы: Windows, macOS, Linux.
Загрузить: github.com/LostRuins/koboldcpp
Суть: Выбор, если причина, по которой вам нужна локальная модель, — это сеансы письма, которые ChatGPT ограничивал бы по скорости.
Как выбрать правильный
Если вы хотите самый простой рабочий набор: Ollama плюс клиент чата. Установите Ollama, затем выберите Jan или Open WebUI сверху.
Если вам нужно одно полированное приложение для рабочего стола: LM Studio для графического интерфейса или Jan, если открытый исходный код имеет значение.
Если вы часто пробуете модели: Msty для разделенного вида.
Если вы демонстрируете кому-то или работаете на заблокированной машине: llamafile.
Если вам нужен самый легкий демон: Cortex.
Если вы пишете длинную художественную литературу или запускаете кампании ролевых игр: KoboldCpp.
Если небольшой модели недостаточно для конкретной задачи, большинство этих приложений также маршрутизируют на облачные конечные точки. Начните локально, переходите на облако только тогда, когда локальный ответ недостаточно хорош.
Часто задаваемые вопросы
Какое лучшее приложение для локального LLM для ноутбука без видеокарты? Ollama с моделью 3B или 4B работает на CPU и встроенной графике с приемлемой скоростью. LM Studio поставляет предустановки только для CPU в своем средстве выбора моделей.
Может ли небольшой локальный LLM заменить ChatGPT? Для повседневного чата, резюмирования и коротких кодовых помощников — да. Для сложного мышления, агентских рабочих процессов и длительных исследовательских задач — нет. Большинство людей, которые попробуют оба, в конечном итоге используют локальное для ежедневных запросов и облако для сложных.
Какой размер модели работает на 8 ГБ оперативной памяти? Модель 3B в квантировании Q4 удобно помещается с запасом для самого приложения. Квант 4B работает, если вы закроете другие приложения с интенсивным использованием памяти.
Действительно ли локальные LLM приватные? Приложения в этом списке по умолчанию не загружают запросы. GPT4All и Msty предлагают опциональную облачную маршрутизацию, и это добровольно. Если полная изоляция важна, отключите сетевой доступ для приложения.
Какое лучшее бесплатное приложение для локального LLM? Ollama для ранвайма и Jan для графического интерфейса. Оба бесплатны, оба имеют открытый исходный код, оба активно поддерживаются.