Termux и другие инструменты для запуска локального LLM на Android

XDA превратила старый телефон в локальный LLM сервер и запустила Gemma 4 с достаточной производительностью для реальной работы. Это отличный способ использовать старый Android, лежащий в ящике, и благодаря оптимизациям ARM в llama.cpp, Snapdragon 8 Gen 1 или новее может размещать квантизированную модель размером 3B до 7B, которая отвечает на запросы других устройств в вашей Wi-Fi сети. Семь приложений справляются с этим, некоторые — клиенты чата, которые также предоставляют OpenAI-совместимый API, некоторые — терминалы, которые позволяют запускать llama.cpp или ollama напрямую.

На что обратить внимание в локальном LLM приложении для Android

Быстрое сравнение

Приложение Лучше всего для Бесплатно API сервер Рейтинг
Termux Полный llama.cpp или ollama в терминале Да Да, через llama-server 4.7
PocketPal AI Графический чат с переключателем сервера Да Да, экспериментально 4.5
Layla Полированный чат плюс ролевые игры Да Trial Pro API 4.4
MLC Chat MLC-оптимизированные модели Да Локально только в стабильной версии 4.3
ChatterUI Интерфейс подобно SillyTavern Да Да, через встроенный сервер 4.4
SmolChat Минимальный чат-клиент Да Нет 4.3
llama.cpp Android Эталонная сборка Да Да, через llama-server 4.5

Семь приложений

1. Termux, лучший полный llama.cpp или ollama в терминале

Termux — это Linux-в-вашем-кармане инструментарий, который позволяет строить и запускать llama.cpp или ollama напрямую. pkg install cmake python git, клонируйте llama.cpp, скомпилируйте с LLAMA_VULKAN=1 и запустите llama-server привязанный к вашему IP адресу LAN. Старый телефон теперь служит OpenAI-совместимым API любому устройству в Wi-Fi.

Где он отстаёт: Не для тех, кто боится терминала. Первоначальная настройка занимает час управления пакетами.

Ценообразование:

Платформы: Android

Загрузить: F-Droid · Aptoide

Termux для хостинга локального LLM побеждает по гибкости. Все, что поддерживает llama.cpp, поддерживает Termux.

Итог: Выбор для пользователей, комфортных в терминале. Потенциал намного выше, чем любой GUI в этом списке.

2. PocketPal AI, лучший GUI с переключателем сервера

PocketPal AI — это открытый исходный код Android чат-клиент, который загружает модели GGUF с Hugging Face и запускает их на устройстве. Последние сборки добавляют экспериментальный переключатель сервера, который предоставляет ту же модель в вашей LAN через OpenAI-совместимую конечную точку.

Где он отстаёт: Переключатель сервера все еще помечен как экспериментальный и не имеет TLS.

Ценообразование:

Платформы: Android, iOS

Загрузить: Google Play · F-Droid

PocketPal AI для хостинга локального LLM побеждает по простоте GUI. Выберите модель с Hugging Face, нажмите загрузку, начните чатиться.

Итог: Выбор для пользователей, которые хотят GUI в первую очередь и API во вторую.

3. Layla, лучший полированный чат плюс ролевые игры

Layla — это дружественный к платежам Android чат-клиент, который запускает квантизированные модели на устройстве с гладким UI. Включены ролевые персонажи, постоянная память и голосовой режим. Уровень Pro добавляет режим API сервера, который предоставляет загруженную модель.

Где он отстаёт: Бесплатный уровень ограничивает длину контекста. Функции персонажей добавляют сложность UI.

Ценообразование:

Платформы: Android

Загрузить: Google Play

Layla для хостинга локального LLM побеждает по полировке чата и инструментам ролевых игр.

Итог: Выбор для пользователей, которые хотят UI, ориентированный на чат, а не инструмент разработчика.

4. MLC Chat, лучший MLC-оптимизированные модели

MLC Chat от команды MLC поставляется с предкомпилированными моделями, настроенными для Qualcomm Adreno и MediaTek GPU. Токены в секунду лучшие в этом списке для телефонов, которые приложение официально поддерживает, ценой меньшей библиотеки моделей, чем llama.cpp.

Где он отстаёт: Режим API сервера находится в дорожке развития, еще не в стабильном выпуске.

Ценообразование:

Платформы: Android, iOS

Загрузить: GitHub · Aptoide

MLC Chat для хостинга локального LLM побеждает по сырой скорости вывода, когда ваш телефон в поддерживаемом списке.

Итог: Выбор для пользователей, чей устройство в поддерживаемом списке MLC и хотят максимум токенов в секунду локально.

5. ChatterUI, лучший интерфейс подобно SillyTavern

ChatterUI — это Android чат-клиент, смоделированный на SillyTavern. Карточки персонажей, ветки чата и встроенный сервер, который другие устройства в вашей LAN могут вызывать как OpenAI-совместимую конечную точку.

Где он отстаёт: Формат карточки персонажа — это суть, но это делает ChatterUI тяжелее, чем PocketPal для прямого Q&A.

Ценообразование:

Платформы: Android

Загрузить: GitHub

ChatterUI для хостинга локального LLM побеждает, если ваш существующий чат-стек имеет форму SillyTavern.

Итог: Выбор для пользователей, которые уже используют SillyTavern.

6. SmolChat, лучший минимальный чат-клиент

SmolChat — это минималистичный Android клиент для моделей llama.cpp GGUF. Он не служит API, но его след достаточно мал, чтобы старые телефоны с 4 ГБ RAM все еще могли вместить квантизированную модель 3B.

Где он отстаёт: Локальный чат только, нет режима сервера.

Ценообразование:

Платформы: Android

Загрузить: GitHub

SmolChat для хостинга локального LLM побеждает как самый легкий вариант для устройств с 4 ГБ.

Итог: Выбор, когда целевой телефон действительно старый и имеет ограничение по RAM.

7. llama.cpp Android, лучший эталонный построение

llama.cpp Android — это официальная эталонная сборка от ggerganov. Не в каком-либо магазине, вы загружаете APK со стороны из выпусков GitHub. Запускает llama-server напрямую с теми же флагами, которые вы бы использовали на Linux.

Где он отстаёт: Нулевая полировка UI, и вы должны знать флаги llama.cpp перед началом.

Ценообразование:

Платформы: Android

Загрузить: GitHub

llama.cpp Android для хостинга локального LLM побеждает как эталонная реализация.

Итог: Выбор для пользователей, которые хотят то же самое средство, которое они запускают на ноутбуке, на Android.

Как выбрать правильный

Часто задаваемые вопросы

Может ли старый Android телефон действительно запустить LLM?

Да, на Snapdragon 855 и позже, с 6 ГБ или более RAM. Ожидайте 3-5 токенов в секунду на квантизированной модели 3B на старом оборудовании и 10-20 токенов в секунду на более новых телефонах.

Какая модель лучше всего работает на Android?

Gemma 2B, Phi-3 Mini, Llama 3.2 3B и Qwen 2.5 3B все подходят удобно при квантизации Q4_K_M. Gemma 4 работает на более новых телефонах с 8 ГБ или более RAM.

Могу ли я использовать свой телефон как LLM API сервер для моего ноутбука?

Да. Termux, запущенный llama-server, привязанный к вашему IP адресу LAN, работает. Укажите чат-клиент вашего ноутбука на http://<phone-ip>:8080/v1 для OpenAI-совместимой конечной точки.

Убьет ли запуск LLM батарею моего телефона?

Длительный вывод разряжает быстро, планируйте питание от сети. Также ожидайте, что телефон будет работать тепло, поднимите его для циркуляции воздуха.

Бесплатен ли llama.cpp?

Да, лицензирован MIT. Каждое приложение в этом списке, которое его использует, либо открытый исходный код, либо платное поверх бесплатной базы llama.cpp.