Семейство открытых весов Google Gemma

Семейство Gemma от Google — это хороший компромисс для ноутбуков. Контрольная точка 4B комфортно помещается в 8GB VRAM, лицензия достаточно пермиссивна для внутренних инструментов, а Ollama загружает веса одной командой. Это также не единственная маленькая модель с открытым весом, которая хорошо работает на скромном десктопе. С тех пор как вышла Gemma 3, мы тестировали шесть других семейств на том же ноутбуке с 16GB и десктопе с 24GB, и несколько из них превосходят Gemma в задачах, которые для нас важны. Ниже представлены альтернативы Gemma, которые мы оставили установленными.

Быстрое сравнение

Семейство моделей Лучше всего для Бесплатный план Лицензия Выдающаяся особенность
Llama 3 (Meta) Обычный чат, использование инструментов Да, веса на Hugging Face Лицензия сообщества Meta Самое широкое покрытие инструментов и квантиз​ации
Qwen 3 (Alibaba) Многоязычное рассуждение Да Apache 2.0 Встроенный режим мышления, который можно переключать
Phi-4 (Microsoft) Ноутбуки с 8GB Да MIT Лучше всего рассуждение малых моделей на гигабайт
Mistral 7B / Nemo Код и быстрый чат Да Apache 2.0 Функциональные вызовы прямо из коробки
DeepSeek V3 / R1 distills Математика, код, цепочки мышления Да MIT (distills) Явные теги <think>
IBM Granite 3.3 Безопасные для предприятия черновики Да Apache 2.0 Сильное структурированное извлечение
SmolLM 3 Raspberry Pi и старые ноутбуки Да Apache 2.0 Модель 3B, работающая под 4GB RAM

Почему люди ищут альтернативы Gemma

Gemma 3 способна, но несколько реальных недостатков толкают нас к другим семействам моделей:

Альтернативы

Llama 3 (Meta) — лучше всего для самой широкой экосистемы

Llama 3 — модель по умолчанию для большинства людей, которые размещают свой собственный AI, и причина скучна: каждый запускающий приложение его поддерживает, каждый формат квантизации нацелен на него в первую очередь, и каждое сообщество fine-tune пишет для него. Модель 8B работает на том же ноутбуке с 16GB, где помещается Gemma 4B, с немного большим запасом RAM, а модель 70B масштабируется до рабочих GPU.

Где это отстает: лицензия сообщества Meta имеет ограничения на использование, которых нет в Apache 2.0. Многоязычное качество отстает от Qwen 3.

Цены:

Миграция с Gemma: ollama pull llama3.1:8b и замените имя модели в конфиге Open WebUI или LM Studio. Подсказки переносятся чистой. Шаблоны чатов отличаются, поэтому пересмотрите системные подсказки один раз.

Загрузка: ollama.com/library/llama3.1

Итог: выбирайте Llama 3, когда ширина инструментов важнее, чем сырые бенчмарки. Пропустите это, если вам нужна Apache 2.0.

Qwen 3 (Alibaba) — лучше всего как универсальный выбор

Qwen 3 стала самой безопасной рекомендацией общего назначения для локального использования. Семейство охватывает контрольные точки 0.6B до 32B, плюс вариант MoE 30B и 235B, так что вы можете выбрать по VRAM и переключаться между контрольными точками без изменения стиля подсказки. Качество рассуждений по математике и коду превосходит Gemma при одинаковом количестве параметров, и есть надлежащий режим мышления, который вы можете включить во время вывода.

Где это отстает: пункты лицензии Alibaba относительно пороговых значений количества пользователей затрудняют некоторых предприятий. Варианты MoE нуждаются в запускающем приложении, поддерживающем mixture-of-experts, что не каждое настольное приложение обрабатывает благодушно.

Цены:

Миграция с Gemma: идентичный поток Ollama. Если вы используете встроенные эвристики системной подсказки Gemma, Qwen принимает те же инструкции. Включите режим мышления с /set think в CLI.

Загрузка: ollama.com/library/qwen3

Итог: модель, которую мы рекомендуем тем, кто спросит “что мне запустить локально” без дополнительного контекста.

Phi-4 (Microsoft) — лучше всего для слабого оборудования

Phi-4 и его собрат Phi-4-mini нацелены на маленькие машины. Модель 14B показывает хорошие результаты на бенчмарках рассуждений, а Phi-4-mini с 3.8B работает на 8GB RAM без вообще GPU. Microsoft лицензирует все под MIT, так что это подходит в коммерческие проекты без бумаг.

Где это отстает: обычный чат ощущается более сухим, чем Llama или Qwen, и творческое письмо слабо. Не модель для использования в маркетинговом копировании или рассказывании историй.

Цены:

Миграция с Gemma: прямая замена. Контекстное окно Phi-4-mini меньше (128k на полной модели, 32k на mini), поэтому сначала проверьте подсказки длинных документов.

Загрузка: ollama.com/library/phi4

Итог: выбирайте Phi-4-mini для старых ноутбуков и Phi-4, когда качество рассуждений важнее личности.

Mistral 7B и Mistral Nemo — лучше всего для кода и функциональных вызовов

Mistral 7B остается острым, а новая модель Nemo 12B, которую Mistral построила с NVIDIA, — это семейство, к которому мы обращаемся, когда хотим быстрое заполнение кода и надежные функциональные вызовы. Использование инструментов Nemo сработало с первой попытки в каждом настольном запускающем приложении, которое мы тестировали. Apache 2.0, без условий.

Где это отстает: базовые модели менее разговорчивы, чем Llama 3, и результаты могут ощущаться лаконичными. Более новые крупные модели Mistral закрыты за их коммерческим API.

Цены:

Миграция с Gemma: Ollama pull, отрегулируйте шаблон чата на формат [INST] Mistral. Если вы используете Gemma для агентов tool-calling, Nemo будет ощущаться как обновление с первого запуска.

Загрузка: mistral.ai

Итог: альтернатива, когда поддержка инструментов Gemma вас разочаровала.

DeepSeek V3 и R1 distills — лучше всего для рассуждения

DeepSeek поставляет два семейства, достойные внимания: V3, сильная модель MoE общего назначения, и R1 distills, которые fine-tune базы Llama и Qwen в машины мышления. R1 distills раскрывают свою цепочку мышления внутри тегов <think>, что означает то, что писатель XDA назвал “локальной LLM, которая действительно думает перед ответом”. На математических текстовых задачах и многошаговых изменениях кода R1 distills часто превосходят Gemma 3 27B при работе в меньшей VRAM.

Где это отстает: режим мышления потребляет токены, что замедляет задержку первого токена и съедает контекст. Модель MoE V3 тяжела для большинства десктопов.

Цены:

Миграция с Gemma: pull deepseek-r1:14b и подсказывайте точно так же, как вы бы Gemma. Фильтруйте теги <think> из вашего UI, если конечные пользователи не должны их видеть.

Загрузка: ollama.com/library/deepseek-r1

Итог: выбор, ориентированный на рассуждение.

IBM Granite 3.3 — лучше всего для структурированного извлечения

IBM Granite тихая, неблестящая и очень хорошо справляется с корпоративной работой, на которой на самом деле используются большинство локальных LLM: извлечение полей из документов, черновики писем, классификация тикетов. Лицензия Apache 2.0, инструменты Watsonx на корпоративной стороне, и модель 8B работает рядом с Gemma на том же оборудовании.

Где это отстает: разговорный тон жесткий. Творческие задачи ощущаются как юридический меморандум.

Цены:

Миграция с Gemma: прямая замена. Если вы используете Gemma с оберткой подсказки JSON-режима, Granite более надежно её соблюдает.

Загрузка: ollama.com/library/granite3.3

Итог: скучный правильный ответ для конвейеров извлечения и классификации.

SmolLM 3 — лучше всего для старых ноутбуков и однплатных компьютеров

SmolLM 3 от Hugging Face — это модель 3B, предназначенная для работы на крошечном оборудовании. Она помещается под 4GB RAM, загружается на Raspberry Pi 5 и проводит связный разговор. Она не будет превосходить Gemma 4B по рассуждениям, но будет продолжать работу на машине, где Gemma переходил бы на диск.

Где это отстает: дата обрезания знаний старше, и долгоконтекстный отзыв слабее.

Цены:

Миграция с Gemma: pull через Ollama или запуск через llama.cpp напрямую. Ожидайте переделки любой подсказки, которая предполагает специфическую дату обрезания знаний Gemma.

Загрузка: huggingface.co/HuggingFaceTB/SmolLM3-3B

Итог: отступление, когда машина не может справиться с чем-нибудь большим.

Как выбрать

Сначала выбирайте по памяти, затем по задаче.

FAQ

Какая хорошая альтернатива Gemma для ноутбука с 16GB? Qwen 3 8B или Phi-4-mini оба подходят, и оба превосходят Gemma 3 4B на общих рассуждениях. Qwen 3 выигрывает на многоязычной работе, Phi выигрывает на математике.

Является ли DeepSeek R1 лучше, чем Gemma для кодирования? Для многошаговых задач отладки и рефакторинга R1 distill на 14B обычно превосходит Gemma 3 27B, главным образом потому, что цепочка мышления помогает ей ловить упущенные крайние случаи.

Могу ли я запустить Llama 3 рядом с Gemma в Ollama? Да. Ollama переключает модели по требованию. Pull обе, переключайтесь по имени в CLI или в Open WebUI.

Какая легкая локальная LLM имеет самую пермиссивную лицензию? Qwen 3, Mistral 7B, IBM Granite и SmolLM 3 все поставляются под Apache 2.0. Phi-4 и DeepSeek R1 distills это MIT.

Есть ли альтернатива Gemma со встроенным режимом мышления? Qwen 3 имеет явный переключатель мышления, и R1 distills DeepSeek оборачивают рассуждение в теги <think>. Gemma 3 ничего из этого не раскрывает.