Unsloth выполняет тонкую настройку локальной модели Llama на десктопном GPU

На этой неделе в XDA описали обучение локальной LLM на её собственных ошибках. Автор собрал неправильные выходные данные модели, вручную разметил несколько десятков примеров, упаковал их в маленький набор данных и запустил лёгкую тонкую настройку. Результат — заметно более умная модель на тех проблемах, где базовая версия ошибалась. То, что раньше требовало арендованного кластера, теперь работает на ноутбуке с 12 ГБ GPU. Это семь лучших приложений для тонкой настройки локальных LLM на десктопе в 2026 году, все бесплатные и с открытым исходным кодом, отранжированные по скорости первой настройки.

На что обратить внимание в приложении для локальной тонкой настройки

Быстрое сравнение

Приложение Лучше всего для Бэкенд LoRA/QLoRA Apple Silicon Простота
Unsloth Самая быстрая однопроцессорная LoRA CUDA Да Бета Высокая
Axolotl Настраиваемые production запуски CUDA (+ROCm) Да Нет Средняя
LLaMA-Factory Веб-интерфейс для тонкой настройки CUDA (+ROCm) Да Бета Высокая
MLX-LM Тонкая настройка на Apple Silicon MLX Да Да Высокая
Torchtune Официальная ссылка PyTorch CUDA Да Ограниченно Средняя
Hugging Face TRL RLHF/DPO/PPO на основе Transformers CUDA (+ROCm) Да Нет Средняя
LM Studio GUI для вывода и лёгких рабочих потоков тонкой настройки CUDA/Metal Загрузка адаптера Да Очень высокая

1. Unsloth, лучше всего для самой быстрой однопроцессорной LoRA

Unsloth — инструмент, который превратил “настроить модель 7B на ноутбуке” из исследовательской работы в Colab ноутбук и pip install. На одном RTX 4070 с 12 ГБ VRAM запуск 7B QLoRA с контекстом 2048 завершается примерно за 30 минут на нескольких сотнях примеров. Математический трюк — это эффективный по памяти проход вперёд-назад; практическое преимущество — настройка, которая работает пока вы делаете кофе.

Где это не удаётся: Многопроцессорное обучение второго класса по сравнению с Axolotl или Torchtune. Некоторые нишевые архитектуры появляются позже, чем в справочных стеках.

Цена: Бесплатно.

Платформы: Linux (лучше), Windows (через WSL2), Apple Silicon (бета).

Скачать: unsloth.ai / github.com/unslothai/unsloth

Итоговая рекомендация: Стандартный выбор для первой настройки для любого, кто имеет однопроцессорный потребительский GPU.

2. Axolotl, лучше всего для настраиваемых production запусков

Axolotl — то, что используют команды, когда счастливого пути Unsloth недостаточно. Подход на основе конфигурационного файла делает запуски воспроизводимыми: один YAML файл описывает базовую модель, набор данных, ранг LoRA, скорость обучения, частоту оценки и цель экспорта. Многопроцессорная работа с DeepSpeed и FSDP работает. Сообщество опубликовало десятки предустановленных конфигов для обычных задач.

Где это не удаётся: Кривая обучения круче, чем у Unsloth. Первый запуск означает чтение конфига YAML и понимание того, что делает каждое поле.

Цена: Бесплатно.

Платформы: Linux, Windows через WSL2.

Скачать: github.com/axolotl-ai-cloud/axolotl

Итоговая рекомендация: Инструмент для перехода после того как первая настройка Unsloth сработала и вы хотите больше контроля.

3. LLaMA-Factory, лучше всего для рабочего потока с веб-интерфейсом

LLaMA-Factory оборачивает ту же математику, что делают Axolotl и Unsloth, за веб-интерфейсом. Загрузите базовую модель, выберите набор данных из локальной папки, отрегулируйте ползунок для ранга LoRA и запустите запуск. Кривые потерь отображаются в браузере. Для того, кто не хочет трогать терминал, это ближайший аналог дружественного приложения для тонкой настройки на десктопе.

Где это не удаётся: Веб-интерфейс не полноценная IDE. Сложные многостадийные конвейеры всё ещё требуют настоящий конфиг. Не все оптимизаторы доступны в интерфейсе.

Цена: Бесплатно.

Платформы: Linux, Windows через WSL2, macOS через Docker.

Скачать: github.com/hiyouga/LLaMA-Factory

Итоговая рекомендация: Лучший выбор если рабочий поток на основе терминала вас пугает.

4. MLX-LM, лучше всего для тонкой настройки на Apple Silicon

MLX-LM — официальный стек языковых моделей Apple, построенный на фреймворке массивов MLX. На M2 Max или M3 Max с 64 ГБ унифицированной памяти запуск 7B LoRA работает с скоростями, конкурирующими с GPU NVIDIA среднего уровня. На M2 Pro с 16 ГБ это работает для меньших моделей. MLX-LM экспортирует прямо в формат MLX для Ollama и собственных runtime вывода Apple.

Где это не удаётся: Не каждая базовая модель доступна в формате MLX; шаг конвертации из весов Hugging Face добавляет трение. Экосистема меньше, чем стек CUDA.

Цена: Бесплатно.

Платформы: Только Apple Silicon macOS.

Скачать: github.com/ml-explore/mlx-lm

Итоговая рекомендация: Правильный инструмент на Mac. Ничто другое не использует Apple Silicon так хорошо.

5. Torchtune, лучше всего для официальной ссылки PyTorch

Torchtune — собственная библиотека тонкой настройки PyTorch, управляемая командой Meta. Рецепты — читаемый Python, а не DSL конфиг, что подходит инженерам, которые хотят видеть и модифицировать цикл обучения. Поддержка полной тонкой настройки, LoRA и DPO. Многопроцессорная работа работает из коробки. Документация инженерского качества.

Где это не удаётся: Менее “батарейки включены” чем Unsloth или Axolotl. Стиль справочной реализации означает меньше ярких путей.

Цена: Бесплатно.

Платформы: Linux, Windows через WSL2, macOS с ограниченными функциями.

Скачать: github.com/pytorch/torchtune

Итоговая рекомендация: Выберите Torchtune если вы уже пишете PyTorch и хотите видеть цикл обучения.

6. Hugging Face TRL, лучше всего для RLHF, DPO и модельного вознаграждения

TRL (Transformer Reinforcement Learning) — набор инструментов для шагов тонкой настройки за рамками простой supervised тонкой настройки: DPO (direct preference optimisation), PPO (proximal policy optimisation), training на модели вознаграждения. На рабочем потоке XDA “train on failures”, DPO — это фактическая техника, которая превратила оценённые ошибки в более умную модель. TRL это то, что её запускает.

Где это не удаётся: Больше математики для понимания. RLHF/DPO может пойти не так способами, которыми не может SFT; ожидайте несколько неудачных запусков перед тем как это щёлкнет.

Цена: Бесплатно.

Платформы: Linux, Windows через WSL2.

Скачать: github.com/huggingface/trl

Итоговая рекомендация: Инструмент для второго этапа настоящего конвейера тонкой настройки “learn from your mistakes”.

7. LM Studio, лучше всего для универсального GUI на десктопе

LM Studio — не в первую очередь приложение для тонкой настройки. Это GUI на десктопе для загрузки, запуска и общения с локальными моделями на Windows, macOS и Linux. Его роль в этом списке — полировка, которую он обеспечивает вокруг рабочего потока тонкой настройки: загрузите базовую модель, загрузите адаптер LoRA, произведённый Unsloth или Axolotl, общайтесь с настроенной моделью, повторяйте. Версии 2026 добавили лёгкие обёртки удобства тонкой настройки, которые вызывают Unsloth под капотом.

Где это не удаётся: Сторона training тонкая. LM Studio — это чат и frontend вывода; используйте её для половины вывода цикла, а не половины training.

Цена: Бесплатно.

Платформы: Windows, macOS, Linux.

Скачать: lmstudio.ai

Итоговая рекомендация: Выберите LM Studio как сторону вывода цикла тонкой настройки, а не сторону training.

Как выбрать правильный

Разместите любой выбранный инструмент training с LM Studio для тестирования полученного адаптера локально перед отправкой его в стек вывода.

FAQ

Какой минимальный GPU для тонкой настройки модели 7B?

QLoRA с контекстом 2048 вмещается в 8 ГБ VRAM для самых маленьких вариантов 7B и 12 ГБ комфортно. 8 ГБ работает для более коротких контекстов и нижних рангов; 24 ГБ открывают 13B QLoRA.

Можем ли мы проводить тонкую настройку вообще без GPU?

Технически да, на CPU, но это настолько медленно, что непрактично. Облачная аренда на несколько часов часто дешевле электричества для запуска CPU тонкой настройки до завершения.

Какой формат данных эти инструменты принимают?

JSON Lines с полями instruction и output (Alpaca-style) — универсальный стандарт. Большинство инструментов также принимают формат ShareGPT и формат сообщений чата OpenAI.

Работают ли настроенные модели в Ollama, LM Studio или llama.cpp?

Да, после экспорта в GGUF (для llama.cpp и Ollama) или MLX (для стека Apple). Каждый инструмент выше экспортирует минимум в один из этих форматов.

Является ли тонкая настройка законной для закрытых весов модели?

Только для моделей, чья лицензия это позволяет. Llama 3 и 4, модели Mistral, Qwen, Gemma и каждая модель с открытым весом в этом списке позволяют тонкую настройку под их лицензиями. Закрытые модели (класс GPT-4) не имеют загружаемых весов, поэтому локальная тонкая настройка невозможна.