MLC Chat, запускающий квантованную LLM на Android

Лучшие приложения для запуска квантованных LLM на устройстве на Android в 2026 году

Q4_K_M, Q5_K_S, Q8_0. Если эти метки пока ничего не значат, то именно они причина того, что модель с семью миллиардами параметров теперь помещается в телефон на 6 ГБ. Квантование снижает веса модели с 16-битных чисел с плавающей точкой до 4-битных целых чисел, что сжимает модель чата с 14 ГБ до менее чем 5 ГБ и позволяет телефону запускать её без облачного API-платежа.

Мы протестировали семь приложений на Pixel 8 и планшете с Snapdragon 8 Gen 2. Нас интересовало: какие приложения загружают квантованные веса GGUF и MLC без промежуточного компьютера, какие работают офлайн в режиме полета и какие ведут беседу без теплового регулирования до полного замедления.

На что обратить внимание в приложении для локального запуска LLM

Быстрое сравнение

Приложение Лучше всего для Бесплатный план Начальная цена/мес Рейтинг
MLC Chat Скомпилированные MLC ядра, лучшая пропускная способность Да (открытый исходный код) Бесплатно 4.4
PocketPal AI Модели GGUF с дружественным каталогом Да (открытый исходный код) Бесплатно 4.6
Layla Roleplay и чаты с длинным контекстом Бесплатный уровень $9.99 одноразово 4.5
Sherpa Минимальная оболочка llama.cpp Да (открытый исходный код) Бесплатно 4.2
LLMFarm Companion Синхронизация моделей между устройствами Да $4.99 одноразово 4.3
ChatterUI Фронтенд для чата с несколькими моделями Да (открытый исходный код) Бесплатно 4.5
Enchanted Фронтенд для домашнего сервера Ollama Да (открытый исходный код) Бесплатно 4.4

Приложения

1. MLC Chat — лучше всего для скомпилированных MLC ядер и максимальной пропускной способности

MLC Chat поставляется с предскомпилированными моделями, оптимизированными для конкретного GPU Adreno или Mali в вашем телефоне. Именно этот этап компиляции позволяет модели Phi с тремя миллиардами параметров работать на 15+ токенов в секунду на Pixel 8, примерно в два раза больше, чем универсальный GGUF-runtime. Каталог внутри приложения короткий, но тщательно подобранный: Llama, Phi, Gemma, Mistral, RedPajama.

Где это не срабатывает: Нет поддержки произвольных файлов GGUF. Если у вас уже есть загруженная модель, вы не можете загрузить её здесь без перекомпиляции для MLC.

Цены:

Платформы: Android 8.0 и выше.

Загрузка: Aptoide

Вывод: Выбирайте MLC Chat, когда максимальное количество токенов в секунду имеет значение и вы можете обойтись с фиксированным каталогом.

2. PocketPal AI — лучше всего для моделей GGUF с дружественным каталогом

PocketPal AI загружает любой GGUF, на который вы укажете. Встроенный поиск просматривает Hugging Face без переключения на браузер, а экран загрузки показывает уровень квантования, размер и примерную оценку токенов в секунду для вашего устройства перед тем, как вы выделите 4 ГБ на диск. История чата остаётся на устройстве.

Где это не срабатывает: Ускорение GPU отстаёт от MLC на том же телефоне. Разговоры с длинным контекстом быстро съедают ОЗУ на устройствах с 6 ГБ.

Цены:

Платформы: Android 9.0 и выше.

Загрузка: Google Play

Вывод: Самый удобный вариант для новичков в квантовании GGUF на Android.

3. Layla — лучше всего для roleplay и чатов с длинным контекстом

Layla ориентируется на любителей roleplay и написания длинных историй. Она поставляется с шаблонами подсказок, импортом карточек персонажей и большими окнами контекста по умолчанию, настроенными на сохранение непрерывности истории на протяжении многих ходов. Запускает GGUF локально; платный уровень добавляет голосовой ввод и премиум-модели.

Где это не срабатывает: Интерфейс загромождён. Некоторые встроенные персонажи содержат взрослый контент; фильтр безопасности требует ручной настройки для семейного использования.

Цены:

Платформы: Android 9.0 и выше.

Загрузка: Google Play

Вывод: Выбирайте Layla, если вам нужна локальная модель для написания художественных произведений, которые облачная модель отказалась бы генерировать.

4. Sherpa — лучше всего для минимальной оболочки llama.cpp

Sherpa — приложение для тех, кто уже знает, что ему нужно. Укажите на файл GGUF на SD-карте, установите длину контекста и количество потоков, и готово. Никакого каталога, никакой синхронизации, никаких ненужных функций.

Где это не срабатывает: Без подсказок. Новичков могут загрузить модель, которая не поместится, и приложение упадёт.

Цены:

Платформы: Android 8.0 и выше.

Загрузка: F-Droid

Вывод: Для опытных пользователей, которые хотят llama.cpp-runtime без обёртки чат-приложения.

5. LLMFarm Companion — лучше всего для синхронизации моделей между устройствами

LLMFarm начался на iOS и имеет компаньон Android, который отражает тот же каталог и библиотеку подсказок. Удобно, если вы чередуете использование iPad и планшета Android и хотите одних и тех же персонажей и системных подсказок на обоих.

Где это не срабатывает: Меньше переключателей форматов, чем у PocketPal. Поддержка GPU на Adreno ещё отстаёт.

Цены:

Платформы: Android 10 и выше.

Загрузка: Google Play

Вывод: Выбирайте это, если вы уже используете LLMFarm на iOS и хотите согласованность подсказок.

6. ChatterUI — лучший мультимодельный фронтенд чата

ChatterUI рассматривает каждый бэкенд одинаково, запускаете ли вы llama.cpp на телефоне, KoboldCpp на ноутбуке или Ollama на домашнем сервере. Переходите посередине разговора с небольшой локальной модели на более мощную удалённую, не теряя смысл беседы.

Где это не срабатывает: Настройка требует много действий при первом запуске. Нет предпочтений относительно выбора модели, поэтому новичков может сбить с толку селектор.

Цены:

Платформы: Android 8.0 и выше.

Загрузка: GitHub Releases

Вывод: Правильный выбор, когда телефон — только одно из нескольких мест, где вы запускаете вывод.

7. Enchanted — лучший фронтенд для домашнего сервера Ollama

Enchanted не является собой локальным движком. Это полированное чат-приложение, которое общается с экземпляром Ollama, запущенным на ноутбуке или домашнем сервере. В пути используйте локальную квантованную модель в одном из приложений выше; дома переходите в Enchanted для большей модели, которую ваш телефон не может размещать.

Где это не срабатывает: Требуется машина где-то с работающим Ollama. Требует туннеля или доступности LAN для удалённого использования.

Цены:

Платформы: Android 9.0 и выше.

Загрузка: GitHub Releases

Вывод: Используйте его вместе с любым локальным приложением для дней, когда ваш телефон не может разместить нужную вам модель.

Как выбрать правильное

Акронимы кажутся менее пугающими, как только вы их используете. Q4_K_M кванты Llama 3.1 8B удобно помещаются на любом телефоне с 8 ГБ; Q8_0 Phi-3 Mini работает на удивление хорошо на 6 ГБ. Начните отсюда, смотрите на токены в секунду и подстраивайтесь вверх или вниз.

Часто задаваемые вопросы

Что именно означает Q4_K_M?

Q4 означает 4-битное квантование весов модели. K относится к k-квантам — более умной группировке, представленной llama.cpp. M — вариант для среднего уровня, который смешивает некоторые 5-битные тензоры для качества. На практике: Q4_K_M — это уровень “по умолчанию хватает”.

Сколько оперативной памяти нужно локальной модели?

Правило большого пальца: размер файла модели плюс 30% для среды выполнения и кеша контекста. Модель на 4 ГБ требует примерно 5,5 ГБ свободного пространства. Телефоны с 8 ГБ и более ОЗУ справляются с моделями на 7B параметров на Q4; телефоны с 6 ГБ придерживайтесь 3B.

Мой телефон перегреется?

Длительный вывод на телефоне среднего уровня будет термически регулироваться в течение нескольких минут. Предпочитайте новые устройства Snapdragon 8 Gen 2/3 или Tensor G4, и держите телефон подальше от мягкой поверхности во время работы.

Эти приложения отправляют мои подсказки где-то?

Локальный вывод остаётся локальным. Исключения — Enchanted и ChatterUI при настройке на разговор с удалённым бэкендом. Читайте сетевые подсказки каждого приложения при первом запуске.

С какой модели мне начать?

Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M или Gemma 2 2B — безопасные начальные точки для современного телефона Android. Переходите на Llama 3.1 8B, если устройство имеет 12 ГБ ОЗУ или больше.