Ollama

XDA запустила одну и ту же 8B модель на ноутбуке с RTX 5070 и компьютере с интегрированной графикой и обнаружила, что разница в токенах в секунду намного меньше, чем думает большинство. Вот о чем история локальных LLM в 2026 году: квантизация, Vulkan бэкенды и Metal от Apple перевели много рабочих нагрузок в диапазон, где достаточно iGPU или маленький дискретный GPU. Вам не нужен установка стоимостью $2000 для запуска полезных моделей локально.

Это руководство охватывает восемь приложений для запуска локальных LLM на интегрированной графике, протестированные на Intel Core Ultra 5 с Arc iGPU, AMD Ryzen 7 с Radeon 780M и Apple M2. Все восемь запускают модели в диапазоне 7B-14B с приемлемой скоростью (10 токенов в секунду или лучше) с правильной квантизацией. Мы выбрали простоту установки, совместимость моделей и честную производительность на оборудовании класса iGPU.

На что обратить внимание в локальном LLM-ранере для iGPU

Быстрое сравнение

Приложение Лучше всего для Бесплатный план Начальная цена Стиль UI
Ollama CLI + API для локальных моделей Да Бесплатно (открытый исходный код) Терминал или клиенты третьих сторон
LM Studio Отполированный настольный UI Да Бесплатно Нативное настольное приложение
GPT4All Дружелюбный к новичкам настольный Да Бесплатно Нативное настольное приложение
Jan Полностью открытый ChatGPT клон Да Бесплатно Нативное настольное приложение (Electron)
Msty Универсальное с RAG Да Бесплатная база Нативное настольное приложение
KoboldCpp Ролевые игры и творческое письмо Да Бесплатно (открытый исходный код) Web UI
Text Generation WebUI Power-user тинкеринг Да Бесплатно (открытый исходный код) Web UI
AnythingLLM Локальный RAG над документами Да Бесплатно (открытый исходный код) Нативное настольное приложение

Приложения

1. Ollama, лучший CLI и API ранер

Ollama - это самое близкое к стандарту для локальных LLM. Установите его, запустите ollama run llama3.2:3b, и у вас будет рабочая модель менее чем за минуту. Под капотом он использует llama.cpp с курируемой библиотекой моделей, OpenAI-совместимый API на localhost:11434 и управление памятью для каждой модели.

Где он отстает: Нет встроенного chat UI; вы используете ollama run в терминале или спариваете с клиентом (Open WebUI, Msty или Enchanted на Mac). Библиотека моделей на ollama.com курируется, но ограничена по сравнению с прямым доступом к Hugging Face.

Цены:

Платформы: Windows, macOS (Apple silicon и Intel), Linux.

Загрузка: ollama.com/download или через Homebrew / apt.

Вывод: Лучший бэкенд, точка. Установите его даже если вы планируете использовать другой UI сверху.

2. LM Studio, лучший отполированный настольный UI

LM Studio обертывает llama.cpp в нативное настольное приложение со встроенным браузером моделей Hugging Face, загрузкой одним щелчком, тестированием производительности для каждой модели и OpenAI-совместимым API сервером. Параметры выгрузки GPU раскрыты с разумными значениями по умолчанию для Intel Arc, AMD и Apple silicon.

Где он отстает: Закрытый исходный код (хотя бесплатно). Некоторые пользователи сообщают, что GUI потребляет больше RAM, чем сама модель, на более слабых iGPU.

Цены:

Платформы: Windows, macOS, Linux (бета).

Загрузка: lmstudio.ai

Вывод: Лучшая отправная точка для пользователей iGPU, которые предпочитают GUI. Поставляется с правильными настройками по умолчанию для потребительского оборудования.

3. GPT4All, лучше всего дружелюбный к новичкам настольный

GPT4All от Nomic - самый доступный из пакета. Установите, выберите модель на боковой панели, и она загружается и запускается. Панель LocalDocs добавляет простой RAG над папкой файлов без конфигурации.

Где он отстает: Меньший каталог моделей, чем LM Studio. Медленнее на Windows, чем Ollama или LM Studio в наших тестах.

Цены:

Платформы: Windows, macOS, Linux.

Загрузка: nomic.ai/gpt4all

Вывод: Выбор для менее технических членов семьи. Запускает их локальную модель без касания терминала.

4. Jan, лучше всего полностью открытый ChatGPT клон

Jan - это полностью открытое настольное приложение, которое имитирует интерфейс ChatGPT. Он запускает локальные модели через связанный llama.cpp, подключается к удаленным API (OpenAI, Anthropic, Groq, Mistral) как опция и хранит каждый разговор локально.

Где он отстает: На основе Electron, поэтому объем памяти тяжелее, чем нативные приложения. Многооборотные разговоры иногда теряют контекст на iGPU из-за агрессивного сокращения контекста.

Цены:

Платформы: Windows, macOS, Linux.

Загрузка: jan.ai

Вывод: Самое открытое подобие ChatGPT. Лучше всего если вы хотите одно приложение для локального плюс опциональное удаленное.

5. Msty, лучше всего универсальное с RAG

Msty комбинирует локальные модели, удаленные API, RAG над документами и разделенные разговоры в одном приложении. Его функция “Knowledge Stacks” индексирует папки PDF, Word документов и текстовых файлов, поэтому вы можете общаться с ними без настройки базы данных векторов.

Где он отстает: Закрытый исходный код. Бесплатный тариф ограничивает некоторые продвинутые функции RAG.

Цены:

Платформы: Windows, macOS, Linux.

Загрузка: msty.app

Вывод: Выбор если вы хотите chat с документами без проводки отдельного векторного хранилища.

6. KoboldCpp, лучше всего для ролевых игр и творческого письма

KoboldCpp начался как форк llama.cpp, направленный на писание в дальний формат и ролевые игры. Он имеет web UI с мировой информацией, памятью персонажа и книгами лора, которые другие ранеры не поверхностно. Бэкенд поддерживает Vulkan для iGPU.

Где он отстает: UI плотная со слайдерами, которые что-то значат только для power-users. Не совсем предназначена для рабочих процессов помощника chat.

Цены:

Платформы: Windows, macOS, Linux.

Загрузка: KoboldCpp GitHub releases.

Вывод: Нишевый выбор для писателей и ролеплееров, которые хотят постоянных персонажей.

7. Text Generation WebUI, лучше всего power-user тинкеринг

Text Generation WebUI (oobabooga) - это площадка для тинкеров. Он поддерживает llama.cpp, ExLlama, Transformers и больше бэкендов, раскрывает каждый параметр генерации и интегрируется с LoRA и тонкой настройкой.

Где он отстает: Установка не для новичков; ожидайте 30-минутную установку с Python venv возиться. Web UI функциональный, но не спроектирован.

Цены:

Платформы: Windows, macOS, Linux через Python.

Загрузка: oobabooga/text-generation-webui GitHub.

Вывод: Правильный выбор когда вы знаете, что хотите настроить и не можете добраться до этого в более хорошем приложении.

8. AnythingLLM, лучше всего локальный RAG над документами

AnythingLLM - это специализированное RAG приложение, которое спаривает локальный (или удаленный) LLM с хранилищем документов. Укажите на папку или бросьте файлы, и она индексирует их в локальную базу данных векторов. Мультиюзерские рабочие пространства разделяют контексты для различных проектов.

Где он отстает: Фокусируется на RAG; чистый chat возможен, но это не суть. Установка включает выбор модели внедрения отдельно от модели chat, что запутает новичков.

Цены:

Платформы: Windows, macOS, Linux, плюс развертывание Docker для самохостинга.

Загрузка: anythingllm.com или Mintplex-Labs/anything-llm GitHub.

Вывод: Выбор если причина, по которой вы хотите локальный AI - это запрос вашей собственной коллекции документов приватно.

Как выбрать правильный

Лучшая спарированная установка для большинства пользователей iGPU: Ollama как бэкенд + LM Studio или Open WebUI как клиент. Это дает вам самый быстрый бэкенд с самым дружелюбным интерфейсом.

FAQ

Какое лучшее приложение локального LLM для Intel Arc iGPU?

LM Studio и Ollama оба используют Vulkan и хорошо работают на Intel Arc iGPU (Xe, Xe2, Xe-LPG). Выбор модели имеет большее значение, чем выбор приложения; Q4_K_M квантизации 7B-8B моделей - это сладкое пятно.

Я могу запустить локальные LLM на Ryzen APU без дискретного GPU?

Да. Ryzen 7000 и 8000 серии Radeon 780M / 890M iGPU запускают 7B модели на 10-20 токенов в секунду в Q4 квантизации через Vulkan. Увеличьте выделение системной RAM для графики в BIOS если вы хотите загрузить большие контексты.

Какое лучшее локальное LLM для MacBook с M2 или M3?

Apple silicon запускает Llama 3.1 8B, Qwen 3 8B и Mistral 7B на 20-40 токенов в секунду на M2. LM Studio и Ollama оба используют Metal автоматически. На 16GB объединенной памяти придерживайтесь Q4_K_M или Q5_K_M.

Я должен знать Python для запуска локальных моделей?

Нет. Ollama, LM Studio, GPT4All, Jan и Msty - все это установки одним щелчком без Python. Text Generation WebUI - исключение.

Какое приложение локального LLM полностью открыто с исходным кодом?

Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI и AnythingLLM - все открыты с исходным кодом. LM Studio и Msty бесплатны, но закрыты с исходным кодом.

Сколько RAM мне нужно для локальных LLM?

Для 7B-8B моделей в Q4 квантизации, 16GB общей системной RAM рабочая и 32GB комфортная. iGPU делит системную RAM, поэтому планируйте соответственно. Для 13B-14B моделей, планируйте минимум 32GB.