
Современный смартфон флагманского уровня имеет больше оперативной памяти, чем большинство ноутбуков выпуска пятилетней давности, и никогда не покидает карман пользователя. Этого наконец-то достаточно, чтобы запускать квантованные языковые модели объемом 4B и 7B прямо на устройстве: без счетов за API, без передачи данных из телефона, без замедления, когда Wi-Fi в самолете пропадает. Мы протестировали шесть Android приложений, которые делают локальный вывод LLM работоспособным, от загрузки в один клик до гибкости уровня Termux. Вот лучшие приложения для запуска локальных LLM на Android телефонах в 2026 году.
На что обратить внимание в приложении для локального LLM
Компромиссы всегда одинаковые: качество модели против нехватки памяти, задержка против расхода батареи, простота настройки против контроля.
- Каталог моделей. Модели в формате GGUF и MLC должны быть доступны одним нажатием, а не через ручную загрузку с Hugging Face.
- Квантование. Q4_K_M и Q5_K_M имеют большее значение, чем количество параметров на телефоне.
- Контекстное окно. 8k приемлемо, 32k комфортно, что-либо меньше в 2026 году кажется тесным.
- Потолок памяти. Телефон с 8 ГБ доступной оперативной памяти едва способен вместить модель 7B Q4 плюс операционную систему.
- Изоляция фонового процесса. Телефон, который OOM во время видеозвонка из-за того, что LLM отказалась выгружаться, непригоден для использования.
- Совместимость с API. Локальная конечная точка, совместимая с OpenAI, означает, что другие приложения на телефоне могут указывать на нее.
Быстрое сравнение
| Приложение | Лучше всего для | Каталог моделей | Макс. контекст | Открытый исходный код |
|---|---|---|---|---|
| PocketPal AI | Стартовый набор | GGUF от Hugging Face | 8k по умолчанию | Да |
| MLC Chat | Ускоренный вывод на GPU | MLC предпостроенные | 4k-8k | Да |
| ChatterUI | Ролевая игра и персоны | Любой путь GGUF | 16k+ | Да |
| Layla Lite | Готовый чат с персонажем | Куратированный GGUF | 8k | Freemium |
| Termux | Запуск llama.cpp напрямую | Все | Зависит от модели | Да |
| Google AI Edge Gallery | Демонстрация Gemma и Phi | Каталог Google | 4k | Да |
6 лучших приложений для локального LLM на Android в 2026
1. PocketPal AI, стартовый набор
PocketPal AI — приложение, которое рекомендуется в первую очередь. Загрузка модели — это поисковый браузер Hugging Face внутри приложения, квантование выбирается из раскрывающегося списка, а вывод использует llama.cpp под капотом. Загрузка модели Q4_K_M 3B на телефон с 12 ГБ оперативной памяти занимает около десяти секунд. Интерфейс чата поддерживает системные подсказки, редактирование сообщений и режим тестирования, который сообщает количество токенов в секунду.
Сборка 2026 года добавила режим завершения текста наряду с чатом, что полезно для рабочих процессов в стиле автодополнения, а не только пошагового вопроса и ответа.
Недостатки: Параметры по умолчанию отдают приоритет скорости над качеством на телефонах среднего уровня. Сохраненные чаты живут в файле SQLite без шифрования при хранении.
Цена:
- Бесплатно, открытый исходный код (MIT).
Платформы: Android 8.0 и позже, лучше всего на чипах с 8 ГБ оперативной памяти или более.
Итог: Установите это в первую очередь. Это стартовая площадка для локального вывода на Android.
2. MLC Chat, вариант с ускорением GPU
MLC Chat поставляется с предпостроенными моделями, скомпилированными для бэкэнда Vulkan или OpenCL телефона командой MLC-LLM. На Snapdragon 8 Gen 3 или Tensor G4 это означает заметно лучшее количество токенов в секунду, чем чистая сборка llama.cpp для CPU. Выбор модели узкий, но куратированный: сборки семейств Gemma, Phi и Llama включены.
Компромисс — это гибкость. Модели MLC переделываются разработчиками, поэтому новая загрузка с Hugging Face может занять неделю или две.
Недостатки: Без импорта пользовательских моделей. Бэкэнд GPU конкурирует с диспетчером общей памяти ОС на некоторых сборках Samsung, вызывая периодические сбои.
Цена:
- Бесплатно, открытый исходный код (Apache-2.0).
Платформы: Android 8.0 и позже, GPU с Vulkan или OpenCL.
Итог: Лучшая чистая скорость на устройстве, когда пользователь готов запускать только то, что предпостроено в MLC.
3. ChatterUI, фронтенд для ролевой игры и персон
ChatterUI — полнофункциональный фронтенд для локального вывода с картами персонажей в стиле SillyTavern, смахиванием сообщений, групповыми чатами и системными подсказками для каждой персоны. Он загружает любой GGUF из локального хранилища, что делает его выбором для пользователей, у которых уже есть кэшированная коллекция Hugging Face.
Выбор шаблона инструкций имеет значение здесь: несовпадение шаблона чата Mistral на сборке Llama-3 влияет на качество, и ChatterUI явно раскрывает выбор.
Недостатки: Установка самая крутая в этом списке. При первом запуске просит пользователя указать файл модели, выбрать шаблон чата и установить длину контекста перед тем, как что-либо сделать.
Цена:
- Бесплатно, открытый исходный код (AGPL-3.0).
Платформы: Android 8.0 и позже.
Итог: Для опытных пользователей, которые хотят SillyTavern на телефоне.
4. Layla Lite, готовый чат с персонажем
Layla Lite — это урезанная версия Layla AI с куратированным каталогом моделей и интерфейсом чата с персонажем, предназначенная для пользователей, которые хотят общаться с помощником в телефоне без выбора шаблонов чата. Загрузки заранее квантованы и названы в честь личности, а не базовой модели, что более дружественно для новичков в этом деле.
Платная версия Layla добавляет преобразование текста в речь, генерацию изображений на устройстве и входы визии.
Недостатки: Бесплатный уровень ограничивает выбор модели. Голос персоны в бесплатной сборке ограничен небольшими моделями.
Цена:
- Бесплатный уровень с небольшим куратированным каталогом.
- Платный уровень разблокирует большие модели, голос и рабочие процессы с изображениями.
Платформы: Android 9.0 и позже.
Итог: Выбор для пользователей, которые хотят чат на устройстве без конфигурации чего-либо.
5. Termux, вариант DIY
Termux — это не приложение LLM, это полная оболочка Linux, которая запускает llama.cpp, двоичные файлы Ollama и стеки вывода Python изначально. Для всех, кто уже запускает локальные модели на ноутбуке, Termux — это кратчайший путь к одному и тому же рабочему процессу на телефоне: pkg install llama-cpp, поместите GGUF в ~/models, запустите.
Парный с дополнением Termux:API для написания скриптов вывода из Tasker или ярлыка, что является ближайшим аналогом Android горячей клавиши для локальной модели.
Недостатки: Сборка Play Store устарела. Используйте релиз F-Droid или GitHub. Конфигурация — это оболочка, а не пользовательский интерфейс.
Цена:
- Бесплатно, открытый исходный код (GPL-3.0).
Платформы: Android 7.0 и позже.
Итог: Для пользователей, которые предпочитают CLI, который они уже знают.
6. Google AI Edge Gallery, демоящик Gemma
Google AI Edge Gallery — официальная витрина локального вывода Google. Он поставляется с вариантами Gemma и Phi, предварительно настроенными для LLM Inference API MediaPipe, а также с примерами потоков для чата, суммирования и понимания изображений. Это самый быстрый способ увидеть, как выглядит современная модель Gemma на телефоне без выбора сборки или квантования.
Формат галереи также служит тестом: каждая карточка модели содержит токены в секунду на устройстве, поэтому пользователь может сравнить Pixel 9 Pro со смартфоном среднего уровня Snapdragon менее чем за минуту.
Недостатки: Ограничено выбором Google. Не универсальный клиент чата.
Цена:
- Бесплатно, открытый исходный код (Apache-2.0).
Платформы: Android 12 и позже.
Итог: Чистая демонстрация для оценки того, достаточно ли быстрого локального вывода на данном телефоне, прежде чем устанавливать что-либо более тяжелое.
Как выбрать правильный
- Если это ваша первая локальная модель: PocketPal AI.
- Если скорость важнее выбора моделей: MLC Chat.
- Если вы хотите персон и долгий контекст: ChatterUI.
- Если вы хотите предзагруженного помощника без настройки: Layla Lite.
- Если вы уже запускаете llama.cpp на ноутбуке: Termux с пакетом llama.cpp.
- Если вы хотите тест перед решением: Google AI Edge Gallery.
Часто задаваемые вопросы
Сколько оперативной памяти нужно телефону Android для запуска языковой модели объемом 7B?
Квантованная модель 7B Q4_K_M требует около 4,5 ГБ оперативной памяти для работы с приемлемой скоростью, плюс место для операционной системы и фоновых приложений. На практике телефон с 8 ГБ работает, если пользователь закрывает фоновые вкладки; телефоны с 12 ГБ или 16 ГБ справляются без видимой нагрузки.
Разряжают ли локальные LLM приложения батарею?
Активный вывод тяжелый, похожий на видеозвонок. Неиспользуемые приложения не расходуют батарею, потому что модели выгружаются из памяти между чатами.
Могу ли я запустить локальную модель без интернета?
Да, это главное. Загрузка моделей требует интернета, но вывод полностью автономный после этого.
Какое квантование выбрать?
Q4_K_M — это значение по умолчанию, которое работает на большинстве телефонов. Q5_K_M лучше, если есть свободная оперативная память. Ниже Q4 качество резко падает, и редко стоит экономия памяти.