XDA запустила одну и ту же 8B модель на ноутбуке с RTX 5070 и компьютере с интегрированной графикой и обнаружила, что разница в токенах в секунду намного меньше, чем думает большинство. Вот о чем история локальных LLM в 2026 году: квантизация, Vulkan бэкенды и Metal от Apple перевели много рабочих нагрузок в диапазон, где достаточно iGPU или маленький дискретный GPU. Вам не нужен установка стоимостью $2000 для запуска полезных моделей локально.
Это руководство охватывает восемь приложений для запуска локальных LLM на интегрированной графике, протестированные на Intel Core Ultra 5 с Arc iGPU, AMD Ryzen 7 с Radeon 780M и Apple M2. Все восемь запускают модели в диапазоне 7B-14B с приемлемой скоростью (10 токенов в секунду или лучше) с правильной квантизацией. Мы выбрали простоту установки, совместимость моделей и честную производительность на оборудовании класса iGPU.
На что обратить внимание в локальном LLM-ранере для iGPU
- Несколько бэкендов. Vulkan - большой уравнитель на Windows и Linux; он позволяет iGPU AMD Radeon и Intel Arc использовать аппаратное ускорение без привязанных к поставщику наборов инструментов. Metal - эквивалент на Apple silicon.
- Поддержка GGUF. GGUF - это текущий де-факто формат квантизации. Q4_K_M или Q5_K_M дают лучший баланс скорости и качества для бюджетов VRAM класса iGPU.
- Каталог моделей, по которому не нужно охотиться. Лучшие приложения поставляются с загрузкой моделей одним щелчком из Hugging Face, поэтому вы не гоняетесь за торрентами.
- Разумные настройки по умолчанию. Пользователи iGPU выигрывают от приложений, которые предварительно настраивают длину контекста, количество потоков и процент выгрузки GPU, а не заставляют вас настраивать их вручную.
- Chat UI плюс API. Лучшие ранеры двойного назначения как OpenAI-совместимые API серверы, поэтому вы можете указать на них другие инструменты.
- Небольшой объем памяти. iGPU делит RAM с ОС. Предпочитаете приложения, которые позволяют ограничить длину контекста и выгрузить модели в режиме ожидания.
Быстрое сравнение
| Приложение | Лучше всего для | Бесплатный план | Начальная цена | Стиль UI |
|---|---|---|---|---|
| Ollama | CLI + API для локальных моделей | Да | Бесплатно (открытый исходный код) | Терминал или клиенты третьих сторон |
| LM Studio | Отполированный настольный UI | Да | Бесплатно | Нативное настольное приложение |
| GPT4All | Дружелюбный к новичкам настольный | Да | Бесплатно | Нативное настольное приложение |
| Jan | Полностью открытый ChatGPT клон | Да | Бесплатно | Нативное настольное приложение (Electron) |
| Msty | Универсальное с RAG | Да | Бесплатная база | Нативное настольное приложение |
| KoboldCpp | Ролевые игры и творческое письмо | Да | Бесплатно (открытый исходный код) | Web UI |
| Text Generation WebUI | Power-user тинкеринг | Да | Бесплатно (открытый исходный код) | Web UI |
| AnythingLLM | Локальный RAG над документами | Да | Бесплатно (открытый исходный код) | Нативное настольное приложение |
Приложения
1. Ollama, лучший CLI и API ранер
Ollama - это самое близкое к стандарту для локальных LLM. Установите его, запустите ollama run llama3.2:3b, и у вас будет рабочая модель менее чем за минуту. Под капотом он использует llama.cpp с курируемой библиотекой моделей, OpenAI-совместимый API на localhost:11434 и управление памятью для каждой модели.
Где он отстает: Нет встроенного chat UI; вы используете ollama run в терминале или спариваете с клиентом (Open WebUI, Msty или Enchanted на Mac). Библиотека моделей на ollama.com курируется, но ограничена по сравнению с прямым доступом к Hugging Face.
Цены:
- Бесплатно, открытый исходный код (MIT).
Платформы: Windows, macOS (Apple silicon и Intel), Linux.
Загрузка: ollama.com/download или через Homebrew / apt.
Вывод: Лучший бэкенд, точка. Установите его даже если вы планируете использовать другой UI сверху.
2. LM Studio, лучший отполированный настольный UI
LM Studio обертывает llama.cpp в нативное настольное приложение со встроенным браузером моделей Hugging Face, загрузкой одним щелчком, тестированием производительности для каждой модели и OpenAI-совместимым API сервером. Параметры выгрузки GPU раскрыты с разумными значениями по умолчанию для Intel Arc, AMD и Apple silicon.
Где он отстает: Закрытый исходный код (хотя бесплатно). Некоторые пользователи сообщают, что GUI потребляет больше RAM, чем сама модель, на более слабых iGPU.
Цены:
- Бесплатно для личного использования, коммерческое использование требует лицензии.
Платформы: Windows, macOS, Linux (бета).
Загрузка: lmstudio.ai
Вывод: Лучшая отправная точка для пользователей iGPU, которые предпочитают GUI. Поставляется с правильными настройками по умолчанию для потребительского оборудования.
3. GPT4All, лучше всего дружелюбный к новичкам настольный
GPT4All от Nomic - самый доступный из пакета. Установите, выберите модель на боковой панели, и она загружается и запускается. Панель LocalDocs добавляет простой RAG над папкой файлов без конфигурации.
Где он отстает: Меньший каталог моделей, чем LM Studio. Медленнее на Windows, чем Ollama или LM Studio в наших тестах.
Цены:
- Бесплатно.
Платформы: Windows, macOS, Linux.
Загрузка: nomic.ai/gpt4all
Вывод: Выбор для менее технических членов семьи. Запускает их локальную модель без касания терминала.
4. Jan, лучше всего полностью открытый ChatGPT клон
Jan - это полностью открытое настольное приложение, которое имитирует интерфейс ChatGPT. Он запускает локальные модели через связанный llama.cpp, подключается к удаленным API (OpenAI, Anthropic, Groq, Mistral) как опция и хранит каждый разговор локально.
Где он отстает: На основе Electron, поэтому объем памяти тяжелее, чем нативные приложения. Многооборотные разговоры иногда теряют контекст на iGPU из-за агрессивного сокращения контекста.
Цены:
- Бесплатно, открытый исходный код (AGPL).
Платформы: Windows, macOS, Linux.
Загрузка: jan.ai
Вывод: Самое открытое подобие ChatGPT. Лучше всего если вы хотите одно приложение для локального плюс опциональное удаленное.
5. Msty, лучше всего универсальное с RAG
Msty комбинирует локальные модели, удаленные API, RAG над документами и разделенные разговоры в одном приложении. Его функция “Knowledge Stacks” индексирует папки PDF, Word документов и текстовых файлов, поэтому вы можете общаться с ними без настройки базы данных векторов.
Где он отстает: Закрытый исходный код. Бесплатный тариф ограничивает некоторые продвинутые функции RAG.
Цены:
- Бесплатная база.
- Pro добавляет синхронизацию облаков, продвинутый RAG и приоритетную поддержку (цены на их сайте).
Платформы: Windows, macOS, Linux.
Загрузка: msty.app
Вывод: Выбор если вы хотите chat с документами без проводки отдельного векторного хранилища.
6. KoboldCpp, лучше всего для ролевых игр и творческого письма
KoboldCpp начался как форк llama.cpp, направленный на писание в дальний формат и ролевые игры. Он имеет web UI с мировой информацией, памятью персонажа и книгами лора, которые другие ранеры не поверхностно. Бэкенд поддерживает Vulkan для iGPU.
Где он отстает: UI плотная со слайдерами, которые что-то значат только для power-users. Не совсем предназначена для рабочих процессов помощника chat.
Цены:
- Бесплатно, открытый исходный код (AGPL).
Платформы: Windows, macOS, Linux.
Загрузка: KoboldCpp GitHub releases.
Вывод: Нишевый выбор для писателей и ролеплееров, которые хотят постоянных персонажей.
7. Text Generation WebUI, лучше всего power-user тинкеринг
Text Generation WebUI (oobabooga) - это площадка для тинкеров. Он поддерживает llama.cpp, ExLlama, Transformers и больше бэкендов, раскрывает каждый параметр генерации и интегрируется с LoRA и тонкой настройкой.
Где он отстает: Установка не для новичков; ожидайте 30-минутную установку с Python venv возиться. Web UI функциональный, но не спроектирован.
Цены:
- Бесплатно, открытый исходный код (AGPL).
Платформы: Windows, macOS, Linux через Python.
Загрузка: oobabooga/text-generation-webui GitHub.
Вывод: Правильный выбор когда вы знаете, что хотите настроить и не можете добраться до этого в более хорошем приложении.
8. AnythingLLM, лучше всего локальный RAG над документами
AnythingLLM - это специализированное RAG приложение, которое спаривает локальный (или удаленный) LLM с хранилищем документов. Укажите на папку или бросьте файлы, и она индексирует их в локальную базу данных векторов. Мультиюзерские рабочие пространства разделяют контексты для различных проектов.
Где он отстает: Фокусируется на RAG; чистый chat возможен, но это не суть. Установка включает выбор модели внедрения отдельно от модели chat, что запутает новичков.
Цены:
- Бесплатно, открытый исходный код (MIT).
Платформы: Windows, macOS, Linux, плюс развертывание Docker для самохостинга.
Загрузка: anythingllm.com или Mintplex-Labs/anything-llm GitHub.
Вывод: Выбор если причина, по которой вы хотите локальный AI - это запрос вашей собственной коллекции документов приватно.
Как выбрать правильный
- Если вы хотите самую быструю рабочую локальную модель без хлопот: Ollama.
- Если вы хотите нативный GUI и разумные значения по умолчанию: LM Studio.
- Если вы полностью новичок в локальных LLM: GPT4All.
- Если вы хотите полностью открытый ChatGPT ощущение: Jan.
- Если вы хотите общаться со своими PDF: AnythingLLM или Msty.
- Если вы пишете фантастику или ролевые игры: KoboldCpp.
- Если вы хотите настроить каждый параметр: Text Generation WebUI.
Лучшая спарированная установка для большинства пользователей iGPU: Ollama как бэкенд + LM Studio или Open WebUI как клиент. Это дает вам самый быстрый бэкенд с самым дружелюбным интерфейсом.
FAQ
Какое лучшее приложение локального LLM для Intel Arc iGPU?
LM Studio и Ollama оба используют Vulkan и хорошо работают на Intel Arc iGPU (Xe, Xe2, Xe-LPG). Выбор модели имеет большее значение, чем выбор приложения; Q4_K_M квантизации 7B-8B моделей - это сладкое пятно.
Я могу запустить локальные LLM на Ryzen APU без дискретного GPU?
Да. Ryzen 7000 и 8000 серии Radeon 780M / 890M iGPU запускают 7B модели на 10-20 токенов в секунду в Q4 квантизации через Vulkan. Увеличьте выделение системной RAM для графики в BIOS если вы хотите загрузить большие контексты.
Какое лучшее локальное LLM для MacBook с M2 или M3?
Apple silicon запускает Llama 3.1 8B, Qwen 3 8B и Mistral 7B на 20-40 токенов в секунду на M2. LM Studio и Ollama оба используют Metal автоматически. На 16GB объединенной памяти придерживайтесь Q4_K_M или Q5_K_M.
Я должен знать Python для запуска локальных моделей?
Нет. Ollama, LM Studio, GPT4All, Jan и Msty - все это установки одним щелчком без Python. Text Generation WebUI - исключение.
Какое приложение локального LLM полностью открыто с исходным кодом?
Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI и AnythingLLM - все открыты с исходным кодом. LM Studio и Msty бесплатны, но закрыты с исходным кодом.
Сколько RAM мне нужно для локальных LLM?
Для 7B-8B моделей в Q4 квантизации, 16GB общей системной RAM рабочая и 32GB комфортная. iGPU делит системную RAM, поэтому планируйте соответственно. Для 13B-14B моделей, планируйте минимум 32GB.