На этой неделе в XDA описали обучение локальной LLM на её собственных ошибках. Автор собрал неправильные выходные данные модели, вручную разметил несколько десятков примеров, упаковал их в маленький набор данных и запустил лёгкую тонкую настройку. Результат — заметно более умная модель на тех проблемах, где базовая версия ошибалась. То, что раньше требовало арендованного кластера, теперь работает на ноутбуке с 12 ГБ GPU. Это семь лучших приложений для тонкой настройки локальных LLM на десктопе в 2026 году, все бесплатные и с открытым исходным кодом, отранжированные по скорости первой настройки.
На что обратить внимание в приложении для локальной тонкой настройки
- Поддержка LoRA и QLoRA. Полная тонкая настройка привязана к оборудованию. Адаптеры низкого ранга (LoRA) и 4-битные квантованные LoRA (QLoRA) — единственный реалистичный способ настроить модель 7B или 13B на потребительских GPU.
- Работает на вашем оборудовании. NVIDIA CUDA — стандарт; ROCm на AMD — второй класс. Apple Silicon (M-series) имеет свой путь через MLX. Приложение для тонкой настройки полезно только если оно работает на вашем GPU или NPU.
- Формат набора данных, который не пугает. JSON Lines с полями
instructionиoutput— современный стандарт. Если приложение требует собственный бинарный формат, возникнут проблемы. - Оценка и контрольные точки. Тонкая настройка может пойти не так. Инструмент, который делает снимки через N шагов и показывает кривые потерь, позволяет отойти от неправильного запуска до того как выходные данные будут испорчены.
- Экспорт в GGUF или MLX. После тонкой настройки модель нужно загрузить в стек вывода. GGUF для llama.cpp; MLX для Apple. Если инструмент привязывает веса к собственному формату, результат невозможно использовать.
Быстрое сравнение
| Приложение | Лучше всего для | Бэкенд | LoRA/QLoRA | Apple Silicon | Простота |
|---|---|---|---|---|---|
| Unsloth | Самая быстрая однопроцессорная LoRA | CUDA | Да | Бета | Высокая |
| Axolotl | Настраиваемые production запуски | CUDA (+ROCm) | Да | Нет | Средняя |
| LLaMA-Factory | Веб-интерфейс для тонкой настройки | CUDA (+ROCm) | Да | Бета | Высокая |
| MLX-LM | Тонкая настройка на Apple Silicon | MLX | Да | Да | Высокая |
| Torchtune | Официальная ссылка PyTorch | CUDA | Да | Ограниченно | Средняя |
| Hugging Face TRL | RLHF/DPO/PPO на основе Transformers | CUDA (+ROCm) | Да | Нет | Средняя |
| LM Studio | GUI для вывода и лёгких рабочих потоков тонкой настройки | CUDA/Metal | Загрузка адаптера | Да | Очень высокая |
1. Unsloth, лучше всего для самой быстрой однопроцессорной LoRA
Unsloth — инструмент, который превратил “настроить модель 7B на ноутбуке” из исследовательской работы в Colab ноутбук и pip install. На одном RTX 4070 с 12 ГБ VRAM запуск 7B QLoRA с контекстом 2048 завершается примерно за 30 минут на нескольких сотнях примеров. Математический трюк — это эффективный по памяти проход вперёд-назад; практическое преимущество — настройка, которая работает пока вы делаете кофе.
Где это не удаётся: Многопроцессорное обучение второго класса по сравнению с Axolotl или Torchtune. Некоторые нишевые архитектуры появляются позже, чем в справочных стеках.
Цена: Бесплатно.
Платформы: Linux (лучше), Windows (через WSL2), Apple Silicon (бета).
Скачать: unsloth.ai / github.com/unslothai/unsloth
Итоговая рекомендация: Стандартный выбор для первой настройки для любого, кто имеет однопроцессорный потребительский GPU.
2. Axolotl, лучше всего для настраиваемых production запусков
Axolotl — то, что используют команды, когда счастливого пути Unsloth недостаточно. Подход на основе конфигурационного файла делает запуски воспроизводимыми: один YAML файл описывает базовую модель, набор данных, ранг LoRA, скорость обучения, частоту оценки и цель экспорта. Многопроцессорная работа с DeepSpeed и FSDP работает. Сообщество опубликовало десятки предустановленных конфигов для обычных задач.
Где это не удаётся: Кривая обучения круче, чем у Unsloth. Первый запуск означает чтение конфига YAML и понимание того, что делает каждое поле.
Цена: Бесплатно.
Платформы: Linux, Windows через WSL2.
Скачать: github.com/axolotl-ai-cloud/axolotl
Итоговая рекомендация: Инструмент для перехода после того как первая настройка Unsloth сработала и вы хотите больше контроля.
3. LLaMA-Factory, лучше всего для рабочего потока с веб-интерфейсом
LLaMA-Factory оборачивает ту же математику, что делают Axolotl и Unsloth, за веб-интерфейсом. Загрузите базовую модель, выберите набор данных из локальной папки, отрегулируйте ползунок для ранга LoRA и запустите запуск. Кривые потерь отображаются в браузере. Для того, кто не хочет трогать терминал, это ближайший аналог дружественного приложения для тонкой настройки на десктопе.
Где это не удаётся: Веб-интерфейс не полноценная IDE. Сложные многостадийные конвейеры всё ещё требуют настоящий конфиг. Не все оптимизаторы доступны в интерфейсе.
Цена: Бесплатно.
Платформы: Linux, Windows через WSL2, macOS через Docker.
Скачать: github.com/hiyouga/LLaMA-Factory
Итоговая рекомендация: Лучший выбор если рабочий поток на основе терминала вас пугает.
4. MLX-LM, лучше всего для тонкой настройки на Apple Silicon
MLX-LM — официальный стек языковых моделей Apple, построенный на фреймворке массивов MLX. На M2 Max или M3 Max с 64 ГБ унифицированной памяти запуск 7B LoRA работает с скоростями, конкурирующими с GPU NVIDIA среднего уровня. На M2 Pro с 16 ГБ это работает для меньших моделей. MLX-LM экспортирует прямо в формат MLX для Ollama и собственных runtime вывода Apple.
Где это не удаётся: Не каждая базовая модель доступна в формате MLX; шаг конвертации из весов Hugging Face добавляет трение. Экосистема меньше, чем стек CUDA.
Цена: Бесплатно.
Платформы: Только Apple Silicon macOS.
Скачать: github.com/ml-explore/mlx-lm
Итоговая рекомендация: Правильный инструмент на Mac. Ничто другое не использует Apple Silicon так хорошо.
5. Torchtune, лучше всего для официальной ссылки PyTorch
Torchtune — собственная библиотека тонкой настройки PyTorch, управляемая командой Meta. Рецепты — читаемый Python, а не DSL конфиг, что подходит инженерам, которые хотят видеть и модифицировать цикл обучения. Поддержка полной тонкой настройки, LoRA и DPO. Многопроцессорная работа работает из коробки. Документация инженерского качества.
Где это не удаётся: Менее “батарейки включены” чем Unsloth или Axolotl. Стиль справочной реализации означает меньше ярких путей.
Цена: Бесплатно.
Платформы: Linux, Windows через WSL2, macOS с ограниченными функциями.
Скачать: github.com/pytorch/torchtune
Итоговая рекомендация: Выберите Torchtune если вы уже пишете PyTorch и хотите видеть цикл обучения.
6. Hugging Face TRL, лучше всего для RLHF, DPO и модельного вознаграждения
TRL (Transformer Reinforcement Learning) — набор инструментов для шагов тонкой настройки за рамками простой supervised тонкой настройки: DPO (direct preference optimisation), PPO (proximal policy optimisation), training на модели вознаграждения. На рабочем потоке XDA “train on failures”, DPO — это фактическая техника, которая превратила оценённые ошибки в более умную модель. TRL это то, что её запускает.
Где это не удаётся: Больше математики для понимания. RLHF/DPO может пойти не так способами, которыми не может SFT; ожидайте несколько неудачных запусков перед тем как это щёлкнет.
Цена: Бесплатно.
Платформы: Linux, Windows через WSL2.
Скачать: github.com/huggingface/trl
Итоговая рекомендация: Инструмент для второго этапа настоящего конвейера тонкой настройки “learn from your mistakes”.
7. LM Studio, лучше всего для универсального GUI на десктопе
LM Studio — не в первую очередь приложение для тонкой настройки. Это GUI на десктопе для загрузки, запуска и общения с локальными моделями на Windows, macOS и Linux. Его роль в этом списке — полировка, которую он обеспечивает вокруг рабочего потока тонкой настройки: загрузите базовую модель, загрузите адаптер LoRA, произведённый Unsloth или Axolotl, общайтесь с настроенной моделью, повторяйте. Версии 2026 добавили лёгкие обёртки удобства тонкой настройки, которые вызывают Unsloth под капотом.
Где это не удаётся: Сторона training тонкая. LM Studio — это чат и frontend вывода; используйте её для половины вывода цикла, а не половины training.
Цена: Бесплатно.
Платформы: Windows, macOS, Linux.
Скачать: lmstudio.ai
Итоговая рекомендация: Выберите LM Studio как сторону вывода цикла тонкой настройки, а не сторону training.
Как выбрать правильный
- Никогда не проводили тонкую настройку модели, имеют один NVIDIA GPU: Unsloth. Сначала следуйте QLoRA ноутбуку.
- На Mac с Apple Silicon: MLX-LM. Ничто другое не использует оборудование так хорошо.
- Хотите веб-интерфейс и не терминал: LLaMA-Factory.
- Строите воспроизводимый конвейер для команды: Axolotl с конфигами YAML в Git.
- Выполняете рабочий поток XDA “train on failures”: Unsloth для начального SFT, затем TRL для DPO на оценённых ошибках.
- Хотите видеть цикл обучения в простом PyTorch: Torchtune.
Разместите любой выбранный инструмент training с LM Studio для тестирования полученного адаптера локально перед отправкой его в стек вывода.
FAQ
Какой минимальный GPU для тонкой настройки модели 7B?
QLoRA с контекстом 2048 вмещается в 8 ГБ VRAM для самых маленьких вариантов 7B и 12 ГБ комфортно. 8 ГБ работает для более коротких контекстов и нижних рангов; 24 ГБ открывают 13B QLoRA.
Можем ли мы проводить тонкую настройку вообще без GPU?
Технически да, на CPU, но это настолько медленно, что непрактично. Облачная аренда на несколько часов часто дешевле электричества для запуска CPU тонкой настройки до завершения.
Какой формат данных эти инструменты принимают?
JSON Lines с полями instruction и output (Alpaca-style) — универсальный стандарт. Большинство инструментов также принимают формат ShareGPT и формат сообщений чата OpenAI.
Работают ли настроенные модели в Ollama, LM Studio или llama.cpp?
Да, после экспорта в GGUF (для llama.cpp и Ollama) или MLX (для стека Apple). Каждый инструмент выше экспортирует минимум в один из этих форматов.
Является ли тонкая настройка законной для закрытых весов модели?
Только для моделей, чья лицензия это позволяет. Llama 3 и 4, модели Mistral, Qwen, Gemma и каждая модель с открытым весом в этом списке позволяют тонкую настройку под их лицензиями. Закрытые модели (класс GPT-4) не имеют загружаемых весов, поэтому локальная тонкая настройка невозможна.