Дистилляция — вот почему самостоятельное размещение открытой LLM наконец-то практично. Модель 7B, дистиллированная из учителя 400B, теперь может справляться с инструктированием, кодированием и рассуждениями на уровне, который два года назад потребовал бы специализированного оборудования. Недавняя статья XDA о том, что означает “дистилляция”, права в своем выводе: хорошие маленькие модели существуют, и теперь вы можете их настраивать дома. Вопрос в том, какой десктопный инструмент выбрать. Мы поместили семь наиболее часто используемых приложений для настройки на рабочую станцию с одним RTX 4090 и запустили одну и ту же LoRA на дистиллированной базовой модели Llama 3.3 8B, чтобы сравнить их. Это лучшие десктопные приложения для настройки открытых LLM в 2026 году.
На что обратить внимание при выборе инструмента для настройки
Настройка отличается от развертывания. Хорошее десктопное приложение должно решить четыре задачи, которые не решает простая строка python train.py:
- Трюки с памятью (QLoRA, 4-bit, gradient checkpointing), которые помещают реальную модель на одну потребительскую видеокарту
- Загрузчик датасета, который обрабатывает общие форматы (ShareGPT, Alpaca, JSONL) без скрипта предварительной обработки
- Разумные значения по умолчанию, чтобы первый запуск не был поиском гиперпараметров
- Путь экспорта в GGUF, MLX или ONNX, так чтобы настроенная модель действительно работала где-то полезном после этого
Таблица быстрого сравнения
| Приложение | Лучше всего для | Оборудование | Бесплатный план | Начальная цена/месяц | Форматы экспорта |
|---|---|---|---|---|---|
| Unsloth | Самая быстрая настройка на одной GPU | NVIDIA, некоторые AMD | Полностью бесплатно | Бесплатно | GGUF, HF, ONNX |
| Axolotl | Конфигурационная серьезная подготовка | NVIDIA, AMD | Полностью бесплатно | Бесплатно | HF, GGUF (через помощник) |
| LLaMA-Factory | Веб-интерфейс для не-программистов | NVIDIA, AMD, Ascend | Полностью бесплатно | Бесплатно | HF, GGUF, AWQ |
| Torchtune | PyTorch-native, минимум зависимостей | NVIDIA, AMD, Apple | Полностью бесплатно | Бесплатно | HF, GGUF |
| HuggingFace TRL | Обучение с подкреплением и предпочтениями | NVIDIA | Полностью бесплатно | Бесплатно | HF |
| MLX-LM | Настройка для Apple Silicon | Apple M-series | Полностью бесплатно | Бесплатно | MLX, GGUF |
| Ludwig | Декларативное обучение в стиле AutoML | NVIDIA, CPU | Полностью бесплатно | Бесплатно | HF, ONNX |
1. Unsloth, лучше всего для самой быстрой настройки на одной GPU
Unsloth переписал ядра внимания на Triton и выжал 2x ускорения плюс 40% сокращение памяти из запусков LoRA и QLoRA. На нашем 4090, настройка Llama 3.3 8B, которая заняла 12 часов на vanilla Transformers, завершилась примерно за 5 часов на Unsloth. Библиотека интегрируется с Hugging Face TRL и Axolotl, поэтому вы можете внедрить её без переписывания вашего цикла обучения.
Где она не справляется: основная цель — видеокарты NVIDIA. Поддержка AMD прибыла, но отстает в охвате ядер; Apple Silicon не в дорожной карте.
Цена:
- Бесплатно: библиотека и каждое ядро
Платформы: Linux (предпочтительно), Windows через WSL2
Загрузка: Unsloth
Итоговая рекомендация: выбор по умолчанию для любого, у кого есть современная видеокарта NVIDIA.
2. Axolotl, лучше всего для серьезной конфигурационной подготовки
Axolotl используется фактическими магазинами моделей для подготовки серьезных выпусков с открытыми весами. Конфигурационный рабочий процесс вынуждает вас подумать о своем запуске перед его началом, именно поэтому он производит воспроизводимые артефакты. Поддержка датасета лучше в своем классе: ShareGPT, Alpaca и пользовательский JSONL работают без скриптов предварительной обработки.
Где она не справляется: кривая обучения реальна. Ожидайте тщательного изучения справочника конфигурации перед вашим первым успешным запуском.
Цена:
- Бесплатно
Платформы: Linux (Docker рекомендуется)
Загрузка: Axolotl
Итоговая рекомендация: выбор, когда выпуск идет в продакшен, а не просто экспериментирование.
3. LLaMA-Factory, лучше всего для веб-интерфейса, который вы можете передать коллеге
LLaMA-Factory поставляется с полной веб-панелью, никакого кода не требуется. Вы выбираете базовую модель, загружаете датасет с диска или Hugging Face Hub, выбираете метод (SFT, DPO, PPO, KTO) и нажимаете Start Training. Для команд, где один человек пишет скрипты комфортно, а другой нет, это инструмент, который их объединяет.
Где она не справляется: абстракция скрывает некоторые ручки. Опытные пользователи всё равно в конечном итоге вернутся к конфигурационному файлу.
Цена:
- Бесплатно
Платформы: Linux (нативно), Windows через WSL2, macOS с backend MLX
Загрузка: LLaMA-Factory
Итоговая рекомендация: выбор, когда оператор обучения не разработчик Python.
4. Torchtune, лучше всего для PyTorch-native минимальной настройки
Torchtune — официальная библиотека настройки Meta. Чистый PyTorch, мало внешних зависимостей, и четкие файлы рецептов, которые читаются как учебники. Выпуск 2026 добавил родную поддержку FSDP2 и семейства Llama 4, поэтому она движется в ногу с новыми базовыми моделями.
Где она не справляется: форматы датасета строгие. Если ваши данные не в ожидаемом формате рецептов, вы пишете проход предварительной обработки.
Цена:
- Бесплатно
Платформы: Linux (NVIDIA и AMD), macOS (Apple Silicon)
Загрузка: Torchtune
Итоговая рекомендация: выбор, когда вы хотите первоклассный PyTorch, минимум магии.
5. Hugging Face TRL, лучше всего для настройки предпочтений и RL
Hugging Face TRL — эталонная реализация для DPO, PPO, GRPO, ORPO и любого другого метода оптимизации предпочтений, который прибыл после ChatGPT. Когда ваша цель не “научить модель этой области”, а “научить модель предпочитать эти ответы”, TRL — это набор инструментов.
Где она не справляется: поддержка SFT существует, но не звезда. Для простой контролируемой настройки, Unsloth или Axolotl быстрее.
Цена:
- Бесплатно
Платформы: Linux (NVIDIA основной), Windows через WSL2
Загрузка: TRL
Итоговая рекомендация: выбор, когда цель обучения — выравнивание, а не введение знаний.
6. MLX-LM, лучше всего для настройки Apple Silicon
MLX-LM — официальная платформа Apple для обучения и логического вывода LLM на чипах серии M. На Mac Studio M3 Ultra с 128 GB, мы успешно настроили модель Qwen 2.5 32B за ночь без оборудования NVIDIA. Единая память — реальное преимущество: вы можете держать модели, которые вызвали бы OOM на потребительской видеокарте NVIDIA на 24 GB.
Где она не справляется: поддержка экосистемы вне Apple минимальна. Всё, что вы настраиваете, должно быть переэкспортировано, чтобы работать на оборудовании, не связанном с Apple.
Цена:
- Бесплатно
Платформы: macOS на Apple Silicon (M1 и позже)
Загрузка: MLX-LM
Итоговая рекомендация: выбор для владельца Mac Studio, который хочет настраивать без покупки отдельной установки.
7. Ludwig, лучше всего для декларативного запуска в стиле AutoML
Ludwig берет YAML-декларацию ваших входов, выходов и целевой метрики и выясняет цикл обучения. Это не самый быстрый вариант, но для первой настройки, когда вы еще не знаете, какие гиперпараметры имеют значение, декларативный подход Ludwig сокращает цикл.
Где она не справляется: она скрывает цикл обучения. Когда вы в конечном итоге захотите настроить сам цикл, вы быстро вырастете из Ludwig.
Цена:
- Бесплатно
Платформы: Linux (NVIDIA и CPU), macOS
Загрузка: Ludwig
Итоговая рекомендация: выбор для первой настройки, или для специалиста по данным, который предпочитает декларативный подход императивному.
Как выбрать правильный
Если у вас есть современная видеокарта NVIDIA и вы хотите скорость, начните с Unsloth. Если ваша модель идет в продакшен, переходите на Axolotl. Если оператор не программист, установите LLaMA-Factory. Выбирайте Torchtune, когда вы хотите первоклассный PyTorch без магии. Обратитесь к HuggingFace TRL, когда цель — DPO или PPO, а не SFT. Используйте MLX-LM на любом Mac с Apple Silicon. Попробуйте Ludwig для первой настройки, где вы ещё изучаете ручки.
FAQ
Нужно ли несколько GPU для настройки современной открытой LLM? Нет. QLoRA на модели 7B или 8B помещается на потребительскую видеокарту на 12 GB. Модель 13B нуждается в 24 GB. Модели 70B всё ещё нуждаются в многопроцессорности или карте класса центра обработки данных.
В чем разница между настройкой и дистилляцией? Дистилляция обучает маленькую модель имитировать выходы большой модели. Настройка учит существующую модель (любого размера) специализироваться на ваших данных. Настройка дистиллированной базовой модели — текущая сладкая точка для самостоятельного размещения на маломощном оборудовании.
Какое приложение имеет самый короткий период разрастания? LLaMA-Factory для пути первый-UI, Unsloth для пути первый-скрипт. Ludwig наиболее близок к декларативному “только конфигурация” из семи.
Можно ли настраивать на CPU? Технически да с Ludwig или Torchtune, но только для крошечных моделей (менее 1B параметров). Для всего полезного требуется GPU или Apple Silicon.
Где должна работать настроенная модель после этого? Экспортируйте в GGUF и загружайте в Ollama, LM Studio или Jan для локального логического вывода. Экспортируйте на Hugging Face для облачного обслуживания. Экспорты MLX-LM работают нативно на любом Mac с Apple Silicon.