PocketPal AI запускает локальную языковую модель на Android

Современный смартфон флагманского уровня имеет больше оперативной памяти, чем большинство ноутбуков выпуска пятилетней давности, и никогда не покидает карман пользователя. Этого наконец-то достаточно, чтобы запускать квантованные языковые модели объемом 4B и 7B прямо на устройстве: без счетов за API, без передачи данных из телефона, без замедления, когда Wi-Fi в самолете пропадает. Мы протестировали шесть Android приложений, которые делают локальный вывод LLM работоспособным, от загрузки в один клик до гибкости уровня Termux. Вот лучшие приложения для запуска локальных LLM на Android телефонах в 2026 году.

На что обратить внимание в приложении для локального LLM

Компромиссы всегда одинаковые: качество модели против нехватки памяти, задержка против расхода батареи, простота настройки против контроля.

Быстрое сравнение

Приложение Лучше всего для Каталог моделей Макс. контекст Открытый исходный код
PocketPal AI Стартовый набор GGUF от Hugging Face 8k по умолчанию Да
MLC Chat Ускоренный вывод на GPU MLC предпостроенные 4k-8k Да
ChatterUI Ролевая игра и персоны Любой путь GGUF 16k+ Да
Layla Lite Готовый чат с персонажем Куратированный GGUF 8k Freemium
Termux Запуск llama.cpp напрямую Все Зависит от модели Да
Google AI Edge Gallery Демонстрация Gemma и Phi Каталог Google 4k Да

6 лучших приложений для локального LLM на Android в 2026

1. PocketPal AI, стартовый набор

PocketPal AI — приложение, которое рекомендуется в первую очередь. Загрузка модели — это поисковый браузер Hugging Face внутри приложения, квантование выбирается из раскрывающегося списка, а вывод использует llama.cpp под капотом. Загрузка модели Q4_K_M 3B на телефон с 12 ГБ оперативной памяти занимает около десяти секунд. Интерфейс чата поддерживает системные подсказки, редактирование сообщений и режим тестирования, который сообщает количество токенов в секунду.

Сборка 2026 года добавила режим завершения текста наряду с чатом, что полезно для рабочих процессов в стиле автодополнения, а не только пошагового вопроса и ответа.

Недостатки: Параметры по умолчанию отдают приоритет скорости над качеством на телефонах среднего уровня. Сохраненные чаты живут в файле SQLite без шифрования при хранении.

Цена:

Платформы: Android 8.0 и позже, лучше всего на чипах с 8 ГБ оперативной памяти или более.

Загрузить: AptoideGoogle Play

Итог: Установите это в первую очередь. Это стартовая площадка для локального вывода на Android.


2. MLC Chat, вариант с ускорением GPU

MLC Chat поставляется с предпостроенными моделями, скомпилированными для бэкэнда Vulkan или OpenCL телефона командой MLC-LLM. На Snapdragon 8 Gen 3 или Tensor G4 это означает заметно лучшее количество токенов в секунду, чем чистая сборка llama.cpp для CPU. Выбор модели узкий, но куратированный: сборки семейств Gemma, Phi и Llama включены.

Компромисс — это гибкость. Модели MLC переделываются разработчиками, поэтому новая загрузка с Hugging Face может занять неделю или две.

Недостатки: Без импорта пользовательских моделей. Бэкэнд GPU конкурирует с диспетчером общей памяти ОС на некоторых сборках Samsung, вызывая периодические сбои.

Цена:

Платформы: Android 8.0 и позже, GPU с Vulkan или OpenCL.

Загрузить: Google Play

Итог: Лучшая чистая скорость на устройстве, когда пользователь готов запускать только то, что предпостроено в MLC.


3. ChatterUI, фронтенд для ролевой игры и персон

ChatterUI — полнофункциональный фронтенд для локального вывода с картами персонажей в стиле SillyTavern, смахиванием сообщений, групповыми чатами и системными подсказками для каждой персоны. Он загружает любой GGUF из локального хранилища, что делает его выбором для пользователей, у которых уже есть кэшированная коллекция Hugging Face.

Выбор шаблона инструкций имеет значение здесь: несовпадение шаблона чата Mistral на сборке Llama-3 влияет на качество, и ChatterUI явно раскрывает выбор.

Недостатки: Установка самая крутая в этом списке. При первом запуске просит пользователя указать файл модели, выбрать шаблон чата и установить длину контекста перед тем, как что-либо сделать.

Цена:

Платформы: Android 8.0 и позже.

Загрузить: F-Droid

Итог: Для опытных пользователей, которые хотят SillyTavern на телефоне.


4. Layla Lite, готовый чат с персонажем

Layla Lite — это урезанная версия Layla AI с куратированным каталогом моделей и интерфейсом чата с персонажем, предназначенная для пользователей, которые хотят общаться с помощником в телефоне без выбора шаблонов чата. Загрузки заранее квантованы и названы в честь личности, а не базовой модели, что более дружественно для новичков в этом деле.

Платная версия Layla добавляет преобразование текста в речь, генерацию изображений на устройстве и входы визии.

Недостатки: Бесплатный уровень ограничивает выбор модели. Голос персоны в бесплатной сборке ограничен небольшими моделями.

Цена:

Платформы: Android 9.0 и позже.

Загрузить: Google Play

Итог: Выбор для пользователей, которые хотят чат на устройстве без конфигурации чего-либо.


5. Termux, вариант DIY

Termux — это не приложение LLM, это полная оболочка Linux, которая запускает llama.cpp, двоичные файлы Ollama и стеки вывода Python изначально. Для всех, кто уже запускает локальные модели на ноутбуке, Termux — это кратчайший путь к одному и тому же рабочему процессу на телефоне: pkg install llama-cpp, поместите GGUF в ~/models, запустите.

Парный с дополнением Termux:API для написания скриптов вывода из Tasker или ярлыка, что является ближайшим аналогом Android горячей клавиши для локальной модели.

Недостатки: Сборка Play Store устарела. Используйте релиз F-Droid или GitHub. Конфигурация — это оболочка, а не пользовательский интерфейс.

Цена:

Платформы: Android 7.0 и позже.

Загрузить: F-Droid

Итог: Для пользователей, которые предпочитают CLI, который они уже знают.


Google AI Edge Gallery — официальная витрина локального вывода Google. Он поставляется с вариантами Gemma и Phi, предварительно настроенными для LLM Inference API MediaPipe, а также с примерами потоков для чата, суммирования и понимания изображений. Это самый быстрый способ увидеть, как выглядит современная модель Gemma на телефоне без выбора сборки или квантования.

Формат галереи также служит тестом: каждая карточка модели содержит токены в секунду на устройстве, поэтому пользователь может сравнить Pixel 9 Pro со смартфоном среднего уровня Snapdragon менее чем за минуту.

Недостатки: Ограничено выбором Google. Не универсальный клиент чата.

Цена:

Платформы: Android 12 и позже.

Загрузить: F-Droid

Итог: Чистая демонстрация для оценки того, достаточно ли быстрого локального вывода на данном телефоне, прежде чем устанавливать что-либо более тяжелое.

Как выбрать правильный

Часто задаваемые вопросы

Сколько оперативной памяти нужно телефону Android для запуска языковой модели объемом 7B?
Квантованная модель 7B Q4_K_M требует около 4,5 ГБ оперативной памяти для работы с приемлемой скоростью, плюс место для операционной системы и фоновых приложений. На практике телефон с 8 ГБ работает, если пользователь закрывает фоновые вкладки; телефоны с 12 ГБ или 16 ГБ справляются без видимой нагрузки.

Разряжают ли локальные LLM приложения батарею?
Активный вывод тяжелый, похожий на видеозвонок. Неиспользуемые приложения не расходуют батарею, потому что модели выгружаются из памяти между чатами.

Могу ли я запустить локальную модель без интернета?
Да, это главное. Загрузка моделей требует интернета, но вывод полностью автономный после этого.

Какое квантование выбрать?
Q4_K_M — это значение по умолчанию, которое работает на большинстве телефонов. Q5_K_M лучше, если есть свободная оперативная память. Ниже Q4 качество резко падает, и редко стоит экономия памяти.