Обучение локальной модели на её собственных ошибках — это не совсем предварительное обучение, но при правильном подходе оно учит небольшую модель не повторять ошибки, которые вас раздражали вчера. Это обещание стоит за циклом “самообучения”, над которым работает сообщество локальных LLM весь год: записывайте неправильные ответы модели, организуйте их в небольшой набор данных обратной связи, запустите лёгкую LoRA-тонкую настройку и смотрите, как падает процент ошибок. Это лучшие приложения для самообучения локальной LLM на ошибках на рабочем столе, используется ли у вас модель 7B на ноутбуке или 70B на рабочей станции.
На что обращать внимание при выборе стека самообучения
- Захват обратной связи встроен. Инструмент, который записывает подсказку, ответ и сигнал большого пальца вверх/вниз (или лучше исправленный ответ), — это начало цикла.
- Организация данных. Журнал ошибок должен превратиться в чистый набор данных инструкций перед использованием.
- Эффективная тонкая настройка. LoRA и QLoRA сокращают 24 ГБ тонкой настройки до чего-то, что может запустить одна потребительская GPU за ночь.
- Локальный вывод для оценки. Тот же инструмент, который обслуживает модель для вашего агента, должен обслуживать настроенную версию, чтобы вы могли сравнить обе.
- Программная оптимизация подсказок. Для многих режимов отказа решение заключается не в тонкой настройке, а в лучшей подсказке. Фреймворки оптимизации делают это механическим.
Быстрое сравнение
| Приложение | Лучше всего для | Платформы | Бесплатный план | Начальная цена/месяц | Рейтинг |
|---|---|---|---|---|---|
| LangChain | Объединение захвата обратной связи в рабочий процесс тонкой настройки | Windows, macOS, Linux | Полный | Бесплатно (открытый исходный код) | 4.5 |
| LM Studio | Повседневный вывод плюс экспорт данных | Windows, macOS, Linux | Полный | Бесплатно | 4.6 |
| Ollama | Обслуживание тонко настроенных моделей любому клиенту | Windows, macOS, Linux | Полный | Бесплатно (открытый исходный код) | 4.7 |
| Axolotl | Воспроизводимые LoRA-запуски, управляемые YAML | Linux (Windows через WSL, macOS через контейнер) | Полный | Бесплатно (открытый исходный код) | 4.6 |
| Unsloth | 2-5x быстрее LoRA на одной GPU | Windows, Linux | Полный | Бесплатный уровень, доступна Pro | 4.8 |
| Text Generation WebUI | Локальный интерфейс для вывода, оценки и ручной разметки | Windows, macOS, Linux | Полный | Бесплатно (открытый исходный код) | 4.4 |
| DSPy | Оптимизация подсказок и конвейеров на основе помеченных ошибок | Windows, macOS, Linux | Полный | Бесплатно (открытый исходный код) | 4.7 |
Приложения
1. LangChain — лучше всего для объединения цикла обратной связи
LangChain не является тонкой настройкой. Хорошо он делает то, что дает вам строительные блоки для захвата каждой пары подсказка-ответ от агента, маркировки ошибок и маршрутизации их в набор данных обучения. Слои Callbacks и Tracing — это именно то, что нужно цилу самообучения: стойкая запись того, что сказала модель, что пользователь сделал с ответом и как это было исправлено.
Где он падает: Поверхность API обширна и часто меняется. Образцы кода в интернете часто неправильны.
Цены:
- Бесплатно: Фреймворк.
- Платно: LangSmith — платный управляемый трассировщик, если вы хотите управляемую панель инструментов.
Платформы: Windows, macOS, Linux.
Загрузка: langchain.com — Исходный код (GitHub)
Вывод: Начните здесь с трубопровода между моделью, приложением и данными обучения.
2. LM Studio — лучше всего для повседневного вывода и экспорта данных
LM Studio — это самый простой интерфейс локального вывода на рабочем столе. Укажите его на модель Hugging Face, получите окно чата и локальный сервер, совместимый с OpenAI, и начните собирать сеансы. Недавние релизы добавили функцию экспорта сеанса, которая выгружает беседы как JSONL, что является основным материалом для набора данных обратной связи.
Где он падает: Встроенной тонкой настройки нет. LM Studio ориентирован на вывод; обучение происходит в другом месте.
Цены:
- Бесплатно: Всё.
- Платно: Нет.
Платформы: Windows, macOS, Linux.
Загрузка: lmstudio.ai
Вывод: По умолчанию для захвата и проверки выходных данных модели перед запуском тонкой настройки.
3. Ollama — лучше всего для обслуживания тонко настроенной модели впоследствии
Ollama — это скучный, надежный сервер моделей. Когда вы тонко настроили LoRA, заверните его как файл модели Ollama, и каждый клиент, который разговаривает с локальной конечной точкой OpenAI, получает вашу улучшенную версию мгновенно. Недавние релизы добавили загрузку LoRA первого класса, поэтому вы можете менять адаптеры без повторной загрузки базовых весов.
Где он падает: Нет интерфейса. Это демон, который ожидает, что другие инструменты будут сверху.
Цены:
- Бесплатно: Всё.
- Платно: Нет.
Платформы: Windows, macOS, Linux.
Загрузка: ollama.com — Исходный код (GitHub)
Вывод: Правильный выбор для размещения настроенной модели на вашей машине.
4. Axolotl — лучше всего для воспроизводимых LoRA-запусков
Axolotl — это оболочка, управляемая YAML, вокруг стека обучения Hugging Face. Укажите на набор данных, выберите базовую модель, установите ранг LoRA и скорость обучения, и вперед. Каждый запуск воспроизводим из файла конфигурации, что важно, когда вся суть самообучения заключается в измерении улучшения через итерации.
Где он падает: Linux-собственный. Работает в Windows через WSL и в macOS через контейнер, но с шероховатостями.
Цены:
- Бесплатно: Всё.
- Платно: Нет.
Платформы: В основном Linux; WSL для Windows.
Загрузка: github.com/axolotl-ai-cloud/axolotl
Вывод: Правильный выбор, если вы хотите, чтобы эксперименты были повторяемы через месяц.
5. Unsloth — лучше всего для быстрого LoRA на одной GPU
Unsloth — это библиотека тонкой настройки, которая дает 2-5x ускорение на одной потребительской GPU по сравнению со стандартным Hugging Face Trainer. Использование VRAM примерно вдвое. На 4090 это означает запуск 7B LoRA за час вместо четырех; на 3060 это означает, что запуск заканчивается вообще.
Где он падает: Некоторые архитектуры отстают от основного выпуска трансформеров. Поддержка новейших моделей появляется на версию или две позже.
Цены:
- Бесплатно: Всё на одной GPU.
- Платно: Unsloth Pro для многопроцессорности и поддержки предприятия.
Платформы: Windows, Linux.
Загрузка: unsloth.ai — Исходный код (GitHub)
Вывод: Правильный выбор, когда одна GPU рабочего стола — это всё, что у вас есть.
6. Text Generation WebUI — лучше всего для ручной разметки и оценки
Text Generation WebUI (Oobabooga) — это рабочая лошадка интерфейса для локального вывода, и она также служит окружением для разметки и оценки. Загрузите базовые и настроенные модели рядом, запустите один и тот же запрос против обоих и отметьте, какой ответ лучше. Каждый рейтинг идет в тот же журнал беседы для следующего раунда.
Где он падает: Интерфейс по умолчанию уже устарел. Установка может быть сложной в Windows без WSL.
Цены:
- Бесплатно: Всё.
- Платно: Нет.
Платформы: Windows, macOS, Linux.
Загрузка: github.com/oobabooga/text-generation-webui
Вывод: Система оценки для людей, которые любят интерфейс.
7. DSPy — лучше всего, когда проблема в подсказке, а не в весах
DSPy рассматривает подсказки как параметры. Дайте ему небольшой помеченный набор данных ошибок, определите метрику и он оптимизирует подсказку (и несколько примеров) для подгонки. Для многих режимов отказа это быстрее и дешевле, чем тонкая настройка. Оптимизированная подсказка может затем вернуться к вашему агенту продукции.
Где он падает: Кривая обучения. Абстракции (Signatures, Modules, Optimizers) мощны, но неоднозначны при первом чтении.
Цены:
- Бесплатно: Всё.
- Платно: Нет.
Платформы: Windows, macOS, Linux.
Загрузка: dspy.ai — Исходный код (GitHub)
Вывод: Попробуйте DSPy перед тонкой настройкой. Дешевые подсказки исправляют дешевые ошибки.
Как выбрать правильный
Если вы только начинаете и хотите единый стек, LM Studio для вывода плюс LangChain для захвата плюс Unsloth для запуска LoRA-тонкой настройки — это самый дешевый путь к рабочему циклу.
Если ваши ошибки в основном пробелы в рассуждениях (модель набродила, пропустила шаг), начните с DSPy. Оптимизация подсказок часто закрывает пробел за центы, а не за часы GPU.
Если ваши ошибки конкретны для домена (модель не знает вашу кодовую базу или продукт), это тонкая настройка. Используйте Axolotl или Unsloth поверх дуэта LM Studio и Ollama.
Если вы на рабочей станции с двумя или более GPU, Axolotl масштабируется дальше, чем бесплатный уровень Unsloth.
Используйте Text Generation WebUI как ваш интерфейс оценки независимо от того, что вы обучаете. Ручные A/B-тесты — это самый быстрый способ узнать, действительно ли настройка улучшила ситуацию.
Часто задаваемые вопросы
Могу ли я самообучаться локальной LLM без обучения на собственных данных? Только до определённой степени. Оптимизация подсказок с DSPy заходит дальше, чем большинство людей ожидают, но ошибки, специфичные для домена, нуждаются в данных, специфичных для домена.
Сколько данных мне нужно для полезной LoRA-тонкой настройки? Для целевого исправления нескольких сотен помеченных примеров ошибок достаточно. Инструкция-обучение общей модели требует десятков тысяч.
Что быстрее на 3060 или 4060: Unsloth или Axolotl? Unsloth, с большим отрывом на одной GPU. Axolotl лучше, когда у вас есть несколько GPU или вы хотите воспроизводимые конфиги YAML.
Я теряю способности базовой модели, когда LoRA-настраиваю? Обычно нет. LoRA замораживает базовые веса и добавляет небольшой адаптер. Вы можете выгрузить адаптер и вернуть базовую модель.
Могу ли я запустить всё это на Apple Silicon Mac? Вывод (LM Studio, Ollama, Text Generation WebUI) да. Обучение работает медленнее на Metal, чем на CUDA; некоторые архитектуры все еще нуждаются в блоке GPU Linux для практического времени обучения.