
Лучшие приложения для запуска квантованных LLM на устройстве на Android в 2026 году
Q4_K_M, Q5_K_S, Q8_0. Если эти метки пока ничего не значат, то именно они причина того, что модель с семью миллиардами параметров теперь помещается в телефон на 6 ГБ. Квантование снижает веса модели с 16-битных чисел с плавающей точкой до 4-битных целых чисел, что сжимает модель чата с 14 ГБ до менее чем 5 ГБ и позволяет телефону запускать её без облачного API-платежа.
Мы протестировали семь приложений на Pixel 8 и планшете с Snapdragon 8 Gen 2. Нас интересовало: какие приложения загружают квантованные веса GGUF и MLC без промежуточного компьютера, какие работают офлайн в режиме полета и какие ведут беседу без теплового регулирования до полного замедления.
На что обратить внимание в приложении для локального запуска LLM
- Поддержка распространённых форматов квантования: GGUF (стиль llama.cpp) или MLC (скомпилированные ядра).
- Каталог моделей, который можно просматривать без вставки URL-адресов Hugging Face.
- История чата, сохраняемая локально, а не передаваемая на сервер.
- Отображение токенов в секунду, чтобы знать, когда модель слишком тяжёлая для телефона.
- Переключатели вывода CPU/GPU/NPU, так как NPU Snapdragon 8-series может удвоить пропускную способность.
- Работа в режиме полета. Если для ответа на “привет” нужен Wi-Fi, то это не локальный запуск.
Быстрое сравнение
| Приложение | Лучше всего для | Бесплатный план | Начальная цена/мес | Рейтинг |
|---|---|---|---|---|
| MLC Chat | Скомпилированные MLC ядра, лучшая пропускная способность | Да (открытый исходный код) | Бесплатно | 4.4 |
| PocketPal AI | Модели GGUF с дружественным каталогом | Да (открытый исходный код) | Бесплатно | 4.6 |
| Layla | Roleplay и чаты с длинным контекстом | Бесплатный уровень | $9.99 одноразово | 4.5 |
| Sherpa | Минимальная оболочка llama.cpp | Да (открытый исходный код) | Бесплатно | 4.2 |
| LLMFarm Companion | Синхронизация моделей между устройствами | Да | $4.99 одноразово | 4.3 |
| ChatterUI | Фронтенд для чата с несколькими моделями | Да (открытый исходный код) | Бесплатно | 4.5 |
| Enchanted | Фронтенд для домашнего сервера Ollama | Да (открытый исходный код) | Бесплатно | 4.4 |
Приложения
1. MLC Chat — лучше всего для скомпилированных MLC ядер и максимальной пропускной способности
MLC Chat поставляется с предскомпилированными моделями, оптимизированными для конкретного GPU Adreno или Mali в вашем телефоне. Именно этот этап компиляции позволяет модели Phi с тремя миллиардами параметров работать на 15+ токенов в секунду на Pixel 8, примерно в два раза больше, чем универсальный GGUF-runtime. Каталог внутри приложения короткий, но тщательно подобранный: Llama, Phi, Gemma, Mistral, RedPajama.
Где это не срабатывает: Нет поддержки произвольных файлов GGUF. Если у вас уже есть загруженная модель, вы не можете загрузить её здесь без перекомпиляции для MLC.
Цены:
- Бесплатно: лицензия Apache 2.0 с открытым исходным кодом.
- Платно: нет.
Платформы: Android 8.0 и выше.
Вывод: Выбирайте MLC Chat, когда максимальное количество токенов в секунду имеет значение и вы можете обойтись с фиксированным каталогом.
2. PocketPal AI — лучше всего для моделей GGUF с дружественным каталогом
PocketPal AI загружает любой GGUF, на который вы укажете. Встроенный поиск просматривает Hugging Face без переключения на браузер, а экран загрузки показывает уровень квантования, размер и примерную оценку токенов в секунду для вашего устройства перед тем, как вы выделите 4 ГБ на диск. История чата остаётся на устройстве.
Где это не срабатывает: Ускорение GPU отстаёт от MLC на том же телефоне. Разговоры с длинным контекстом быстро съедают ОЗУ на устройствах с 6 ГБ.
Цены:
- Бесплатно: лицензия MIT с открытым исходным кодом.
- Платно: нет.
Платформы: Android 9.0 и выше.
Вывод: Самый удобный вариант для новичков в квантовании GGUF на Android.
3. Layla — лучше всего для roleplay и чатов с длинным контекстом
Layla ориентируется на любителей roleplay и написания длинных историй. Она поставляется с шаблонами подсказок, импортом карточек персонажей и большими окнами контекста по умолчанию, настроенными на сохранение непрерывности истории на протяжении многих ходов. Запускает GGUF локально; платный уровень добавляет голосовой ввод и премиум-модели.
Где это не срабатывает: Интерфейс загромождён. Некоторые встроенные персонажи содержат взрослый контент; фильтр безопасности требует ручной настройки для семейного использования.
Цены:
- Бесплатно: базовый чат с несколькими предустановленными моделями.
- Платно: $9.99 одноразово (Pro) разблокирует голос, большие модели и облачную синхронизацию.
Платформы: Android 9.0 и выше.
Вывод: Выбирайте Layla, если вам нужна локальная модель для написания художественных произведений, которые облачная модель отказалась бы генерировать.
4. Sherpa — лучше всего для минимальной оболочки llama.cpp
Sherpa — приложение для тех, кто уже знает, что ему нужно. Укажите на файл GGUF на SD-карте, установите длину контекста и количество потоков, и готово. Никакого каталога, никакой синхронизации, никаких ненужных функций.
Где это не срабатывает: Без подсказок. Новичков могут загрузить модель, которая не поместится, и приложение упадёт.
Цены:
- Бесплатно: лицензия MIT.
- Платно: нет.
Платформы: Android 8.0 и выше.
Вывод: Для опытных пользователей, которые хотят llama.cpp-runtime без обёртки чат-приложения.
5. LLMFarm Companion — лучше всего для синхронизации моделей между устройствами
LLMFarm начался на iOS и имеет компаньон Android, который отражает тот же каталог и библиотеку подсказок. Удобно, если вы чередуете использование iPad и планшета Android и хотите одних и тех же персонажей и системных подсказок на обоих.
Где это не срабатывает: Меньше переключателей форматов, чем у PocketPal. Поддержка GPU на Adreno ещё отстаёт.
Цены:
- Бесплатно: базовый чат.
- Платно: $4.99 одноразово удаляет ограничения размера модели.
Платформы: Android 10 и выше.
Вывод: Выбирайте это, если вы уже используете LLMFarm на iOS и хотите согласованность подсказок.
6. ChatterUI — лучший мультимодельный фронтенд чата
ChatterUI рассматривает каждый бэкенд одинаково, запускаете ли вы llama.cpp на телефоне, KoboldCpp на ноутбуке или Ollama на домашнем сервере. Переходите посередине разговора с небольшой локальной модели на более мощную удалённую, не теряя смысл беседы.
Где это не срабатывает: Настройка требует много действий при первом запуске. Нет предпочтений относительно выбора модели, поэтому новичков может сбить с толку селектор.
Цены:
- Бесплатно: открытый исходный код GPLv3.
- Платно: нет.
Платформы: Android 8.0 и выше.
Загрузка: GitHub Releases
Вывод: Правильный выбор, когда телефон — только одно из нескольких мест, где вы запускаете вывод.
7. Enchanted — лучший фронтенд для домашнего сервера Ollama
Enchanted не является собой локальным движком. Это полированное чат-приложение, которое общается с экземпляром Ollama, запущенным на ноутбуке или домашнем сервере. В пути используйте локальную квантованную модель в одном из приложений выше; дома переходите в Enchanted для большей модели, которую ваш телефон не может размещать.
Где это не срабатывает: Требуется машина где-то с работающим Ollama. Требует туннеля или доступности LAN для удалённого использования.
Цены:
- Бесплатно: открытый исходный код MIT.
- Платно: нет.
Платформы: Android 9.0 и выше.
Загрузка: GitHub Releases
Вывод: Используйте его вместе с любым локальным приложением для дней, когда ваш телефон не может разместить нужную вам модель.
Как выбрать правильное
- Если вы хотите максимальное количество токенов в секунду и можете обойтись с фиксированным каталогом: выбирайте MLC Chat.
- Если вы хотите просматривать и загружать модели GGUF из Hugging Face внутри приложения: выбирайте PocketPal AI.
- Если ваша цель — написание художественной литературы и чаты с длинным контекстом: выбирайте Layla.
- Если вы уже знаете llama.cpp и хотите минимальную оболочку: выбирайте Sherpa.
- Если вы чередуете использование iOS и Android: выбирайте LLMFarm Companion.
- Если вы хотите переходить между локальными и удалёнными бэкендами посередине чата: выбирайте ChatterUI.
- Если домашний сервер Ollama — ваш основной хост моделей: используйте Enchanted вместе с одним из приведённых выше для офлайн-дней.
Акронимы кажутся менее пугающими, как только вы их используете. Q4_K_M кванты Llama 3.1 8B удобно помещаются на любом телефоне с 8 ГБ; Q8_0 Phi-3 Mini работает на удивление хорошо на 6 ГБ. Начните отсюда, смотрите на токены в секунду и подстраивайтесь вверх или вниз.
Часто задаваемые вопросы
Что именно означает Q4_K_M?
Q4 означает 4-битное квантование весов модели. K относится к k-квантам — более умной группировке, представленной llama.cpp. M — вариант для среднего уровня, который смешивает некоторые 5-битные тензоры для качества. На практике: Q4_K_M — это уровень “по умолчанию хватает”.
Сколько оперативной памяти нужно локальной модели?
Правило большого пальца: размер файла модели плюс 30% для среды выполнения и кеша контекста. Модель на 4 ГБ требует примерно 5,5 ГБ свободного пространства. Телефоны с 8 ГБ и более ОЗУ справляются с моделями на 7B параметров на Q4; телефоны с 6 ГБ придерживайтесь 3B.
Мой телефон перегреется?
Длительный вывод на телефоне среднего уровня будет термически регулироваться в течение нескольких минут. Предпочитайте новые устройства Snapdragon 8 Gen 2/3 или Tensor G4, и держите телефон подальше от мягкой поверхности во время работы.
Эти приложения отправляют мои подсказки где-то?
Локальный вывод остаётся локальным. Исключения — Enchanted и ChatterUI при настройке на разговор с удалённым бэкендом. Читайте сетевые подсказки каждого приложения при первом запуске.
С какой модели мне начать?
Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M или Gemma 2 2B — безопасные начальные точки для современного телефона Android. Переходите на Llama 3.1 8B, если устройство имеет 12 ГБ ОЗУ или больше.