
XDA превратила старый телефон в локальный LLM сервер и запустила Gemma 4 с достаточной производительностью для реальной работы. Это отличный способ использовать старый Android, лежащий в ящике, и благодаря оптимизациям ARM в llama.cpp, Snapdragon 8 Gen 1 или новее может размещать квантизированную модель размером 3B до 7B, которая отвечает на запросы других устройств в вашей Wi-Fi сети. Семь приложений справляются с этим, некоторые — клиенты чата, которые также предоставляют OpenAI-совместимый API, некоторые — терминалы, которые позволяют запускать llama.cpp или ollama напрямую.
На что обратить внимание в локальном LLM приложении для Android
- Режим API сервера. Для “старого телефона как LLM сервера” приложение должно предоставлять HTTP конечную точку, которую могут вызывать другие устройства, в идеале совместимую с OpenAI.
- Поддержка форматов моделей. GGUF через llama.cpp — стандарт, собственный формат MLC — еще один вариант.
- Разгрузка на GPU. Vulkan или OpenCL бэкенд, использующий GPU Adreno или Mali вашего телефона, изменяет токены в секунду в 3-5 раз.
- Контроль батареи и температуры. Длительный вывод нагревает телефон. Ищите элементы управления сервисом переднего плана и дроссельное управление температурой.
- Объем RAM. Старые телефоны с 4-6 ГБ RAM не могут вместить большие модели даже при агрессивной квантизации.
- Сохранение в фоне. Приложение должно выжить агрессивное управление памятью Android на дешёвых OEM-ах.
Быстрое сравнение
| Приложение | Лучше всего для | Бесплатно | API сервер | Рейтинг |
|---|---|---|---|---|
| Termux | Полный llama.cpp или ollama в терминале | Да | Да, через llama-server | 4.7 |
| PocketPal AI | Графический чат с переключателем сервера | Да | Да, экспериментально | 4.5 |
| Layla | Полированный чат плюс ролевые игры | Да | Trial Pro API | 4.4 |
| MLC Chat | MLC-оптимизированные модели | Да | Локально только в стабильной версии | 4.3 |
| ChatterUI | Интерфейс подобно SillyTavern | Да | Да, через встроенный сервер | 4.4 |
| SmolChat | Минимальный чат-клиент | Да | Нет | 4.3 |
| llama.cpp Android | Эталонная сборка | Да | Да, через llama-server | 4.5 |
Семь приложений
1. Termux, лучший полный llama.cpp или ollama в терминале
Termux — это Linux-в-вашем-кармане инструментарий, который позволяет строить и запускать llama.cpp или ollama напрямую. pkg install cmake python git, клонируйте llama.cpp, скомпилируйте с LLAMA_VULKAN=1 и запустите llama-server привязанный к вашему IP адресу LAN. Старый телефон теперь служит OpenAI-совместимым API любому устройству в Wi-Fi.
Где он отстаёт: Не для тех, кто боится терминала. Первоначальная настройка занимает час управления пакетами.
Ценообразование:
- Бесплатно: Полный инструментарий
- Платно: Нет
Платформы: Android
Termux для хостинга локального LLM побеждает по гибкости. Все, что поддерживает llama.cpp, поддерживает Termux.
Итог: Выбор для пользователей, комфортных в терминале. Потенциал намного выше, чем любой GUI в этом списке.
2. PocketPal AI, лучший GUI с переключателем сервера
PocketPal AI — это открытый исходный код Android чат-клиент, который загружает модели GGUF с Hugging Face и запускает их на устройстве. Последние сборки добавляют экспериментальный переключатель сервера, который предоставляет ту же модель в вашей LAN через OpenAI-совместимую конечную точку.
Где он отстаёт: Переключатель сервера все еще помечен как экспериментальный и не имеет TLS.
Ценообразование:
- Бесплатно: Открытый исходный код под MIT
- Платно: Нет
Платформы: Android, iOS
Загрузить: Google Play · F-Droid
PocketPal AI для хостинга локального LLM побеждает по простоте GUI. Выберите модель с Hugging Face, нажмите загрузку, начните чатиться.
Итог: Выбор для пользователей, которые хотят GUI в первую очередь и API во вторую.
3. Layla, лучший полированный чат плюс ролевые игры
Layla — это дружественный к платежам Android чат-клиент, который запускает квантизированные модели на устройстве с гладким UI. Включены ролевые персонажи, постоянная память и голосовой режим. Уровень Pro добавляет режим API сервера, который предоставляет загруженную модель.
Где он отстаёт: Бесплатный уровень ограничивает длину контекста. Функции персонажей добавляют сложность UI.
Ценообразование:
- Бесплатно: Базовый чат
- Платно: Pro подписка для расширенного контекста и режима API
Платформы: Android
Загрузить: Google Play
Layla для хостинга локального LLM побеждает по полировке чата и инструментам ролевых игр.
Итог: Выбор для пользователей, которые хотят UI, ориентированный на чат, а не инструмент разработчика.
4. MLC Chat, лучший MLC-оптимизированные модели
MLC Chat от команды MLC поставляется с предкомпилированными моделями, настроенными для Qualcomm Adreno и MediaTek GPU. Токены в секунду лучшие в этом списке для телефонов, которые приложение официально поддерживает, ценой меньшей библиотеки моделей, чем llama.cpp.
Где он отстаёт: Режим API сервера находится в дорожке развития, еще не в стабильном выпуске.
Ценообразование:
- Бесплатно: Открытый исходный код
- Платно: Нет
Платформы: Android, iOS
MLC Chat для хостинга локального LLM побеждает по сырой скорости вывода, когда ваш телефон в поддерживаемом списке.
Итог: Выбор для пользователей, чей устройство в поддерживаемом списке MLC и хотят максимум токенов в секунду локально.
5. ChatterUI, лучший интерфейс подобно SillyTavern
ChatterUI — это Android чат-клиент, смоделированный на SillyTavern. Карточки персонажей, ветки чата и встроенный сервер, который другие устройства в вашей LAN могут вызывать как OpenAI-совместимую конечную точку.
Где он отстаёт: Формат карточки персонажа — это суть, но это делает ChatterUI тяжелее, чем PocketPal для прямого Q&A.
Ценообразование:
- Бесплатно: Открытый исходный код
- Платно: Нет
Платформы: Android
Загрузить: GitHub
ChatterUI для хостинга локального LLM побеждает, если ваш существующий чат-стек имеет форму SillyTavern.
Итог: Выбор для пользователей, которые уже используют SillyTavern.
6. SmolChat, лучший минимальный чат-клиент
SmolChat — это минималистичный Android клиент для моделей llama.cpp GGUF. Он не служит API, но его след достаточно мал, чтобы старые телефоны с 4 ГБ RAM все еще могли вместить квантизированную модель 3B.
Где он отстаёт: Локальный чат только, нет режима сервера.
Ценообразование:
- Бесплатно: Открытый исходный код
- Платно: Нет
Платформы: Android
Загрузить: GitHub
SmolChat для хостинга локального LLM побеждает как самый легкий вариант для устройств с 4 ГБ.
Итог: Выбор, когда целевой телефон действительно старый и имеет ограничение по RAM.
7. llama.cpp Android, лучший эталонный построение
llama.cpp Android — это официальная эталонная сборка от ggerganov. Не в каком-либо магазине, вы загружаете APK со стороны из выпусков GitHub. Запускает llama-server напрямую с теми же флагами, которые вы бы использовали на Linux.
Где он отстаёт: Нулевая полировка UI, и вы должны знать флаги llama.cpp перед началом.
Ценообразование:
- Бесплатно: Открытый исходный код под MIT
- Платно: Нет
Платформы: Android
Загрузить: GitHub
llama.cpp Android для хостинга локального LLM побеждает как эталонная реализация.
Итог: Выбор для пользователей, которые хотят то же самое средство, которое они запускают на ноутбуке, на Android.
Как выбрать правильный
- Комфортны в терминале, хотят максимальную гибкость: Termux
- Хотят GUI плюс переключатель API: PocketPal AI
- Хотят полировку чата с ролевыми играми: Layla
- Телефон в поддерживаемом списке MLC и хотят максимальную скорость: MLC Chat
- Уже запускают SillyTavern: ChatterUI
- Телефон имеет только 4 ГБ RAM: SmolChat
- Хотят эталонную сборку llama.cpp: llama.cpp Android
Часто задаваемые вопросы
Может ли старый Android телефон действительно запустить LLM?
Да, на Snapdragon 855 и позже, с 6 ГБ или более RAM. Ожидайте 3-5 токенов в секунду на квантизированной модели 3B на старом оборудовании и 10-20 токенов в секунду на более новых телефонах.
Какая модель лучше всего работает на Android?
Gemma 2B, Phi-3 Mini, Llama 3.2 3B и Qwen 2.5 3B все подходят удобно при квантизации Q4_K_M. Gemma 4 работает на более новых телефонах с 8 ГБ или более RAM.
Могу ли я использовать свой телефон как LLM API сервер для моего ноутбука?
Да. Termux, запущенный llama-server, привязанный к вашему IP адресу LAN, работает. Укажите чат-клиент вашего ноутбука на http://<phone-ip>:8080/v1 для OpenAI-совместимой конечной точки.
Убьет ли запуск LLM батарею моего телефона?
Длительный вывод разряжает быстро, планируйте питание от сети. Также ожидайте, что телефон будет работать тепло, поднимите его для циркуляции воздуха.
Бесплатен ли llama.cpp?
Да, лицензирован MIT. Каждое приложение в этом списке, которое его использует, либо открытый исходный код, либо платное поверх бесплатной базы llama.cpp.