Отчёт XDA о том, что среднего класса GPU хватит для оплаты стека платных AI подписок, попадает в точку. RTX 4070 Ti или Radeon RX 7900 XT запускают модели с 13B и 34B параметрами на скорости, которая превосходит то, что большинство облачных сервисов берут за одну подписку. Но выбор модели, квантизации и среды выполнения для оборудования, которое уже есть, требует реальных цифр, а не предположений.
Семь приложений ниже охватывают два типа бенчмарков. Первые три — это встроенные в среду выполнения бенчмарки, которые сообщают токены в секунду и время до первого токена для реальных рабочих нагрузок. Остальные — наборы бенчмарков от третьих сторон, которые дают воспроизводимые оценки для сравнения оборудования. Каждое приложение работает на Windows и Linux; два также работают на macOS с Apple Silicon.
На что обратить внимание в бенчмарке GPU AI
Не каждый AI бенчмарк рассказывает вам то, что вам нужно знать. Проверьте эти пять вещей:
- Отчёты о токенах в секунду при различных длинах контекста (128, 2048, 8192)
- Раздельное измерение обработки промежуточных данных (prefill) и генерации
- Поддержка квантизации, которую вы планируете использовать (Q4_K_M, Q8, FP16)
- Мониторинг использования VRAM и системной памяти во время запуска
- Результаты в общедоступном формате, чтобы цифры были сравнимы между установками
Что-либо, что сообщает только одно число пропускной способности в одном контексте, не полезно для реального определения размера оборудования.
Быстрое сравнение
| Приложение | Лучше всего подходит для | Бесплатный план | Начальная цена | Выделяющаяся функция |
|---|---|---|---|---|
| llama-bench | Воспроизводимая пропускная способность LLM | Да | Бесплатно | Входит в состав llama.cpp |
| LM Studio | GUI бенчмарки + покупка моделей | Да | Бесплатно | Встроенный каталог моделей |
| Ollama benchmark | Одна команда для стресс-теста LLM | Да | Бесплатно | Запускается с любой загруженной моделью |
| UL Procyon AI | Стандартный бенчмарк производителя | Триал | Платная лицензия | Пути ONNX + DirectML |
| Geekbench AI | Кроссплатформенная AI оценка | Да | Бесплатный уровень | iOS, Android, Windows, macOS |
| MLPerf Client | Эталонный бенчмарк от MLCommons | Да | Бесплатно | Глубокое профилирование оборудования |
| koboldcpp benchmark | Эмуляция нагрузки roleplay/chat | Да | Бесплатно | Реалистично имитирует сеансы чата |
Приложения
1. llama-bench — лучшая воспроизводимая пропускная способность LLM
llama-bench входит в состав llama.cpp и является ближайшим аналогом стандартной линейки в мире локальных LLM. Укажите ему файл GGUF, скажите размер контекста и размер батча, и он сообщит токены prompts в секунду, токены generation в секунду и время до первого токена. Он работает на любом бэкенде CUDA, ROCm, Metal или CPU, поэтому один инструмент дает сравнимые цифры на вашем Nvidia rig, Radeon build и MacBook.
Недостатки: Только командная строка. Нет GUI. Некоторые опции (BLAS, размер батча) требуют чтения документации.
Цены:
- Бесплатно: Open-source под MIT.
- Платный вариант: Нет.
Платформы: Windows, macOS, Linux.
Скачать: llama.cpp на GitHub
Итог: Стандартный бенчмарк при сравнении квантизаций или моделей. Изучите его флаги один раз.
2. LM Studio — лучший GUI бенчмарк с покупкой моделей
LM Studio — это настольное приложение, которое обертывает llama.cpp с графическим интерфейсом для загрузки, запуска и теперь бенчмарка моделей. Встроенная вкладка бенчмарка тестирует любую загруженную модель в стандартной рабочей нагрузке и сообщает метрики таким образом, что неспециалисты могут прочитать. Он также показывает оставшееся место VRAM, что помогает определить размер следующей модели.
Недостатки: Закрытый исходный код. Каталог моделей пересекается с HuggingFace и не полный.
Цены:
- Бесплатно: Полное приложение.
- Платный вариант: Нет.
Платформы: Windows, macOS (Apple Silicon), Linux.
Скачать: LM Studio
Итог: Самый дружелюбный способ провести бенчмарк свежей модели без касания терминала.
3. Ollama benchmark — лучший одноcomandный стресс-тест LLM
Ollama имеет флаг run --verbose, который производит синхронизацию по токенам. В сочетании с поддерживаемыми сообществом скриптами он работает как инструмент бенчмарка. Поскольку Ollama загружает модели по имени, запуск одного и того же бенчмарка на втором компьютере требует двух команд.
Недостатки: Не полный набор бенчмарков. Сосредоточен на скорости завершения; менее полезен для рабочих нагрузок с большим количеством prompts.
Цены:
- Бесплатно: Open-source под MIT.
- Платный вариант: Нет.
Платформы: Windows, macOS, Linux.
Скачать: Ollama
Итог: Установите Ollama для ежедневного использования моделей; используйте --verbose, когда вам нужна быстрая отчет о пропускной способности.
4. UL Procyon AI — лучший стандартный бенчмарк производителя
UL Procyon AI Computer Vision Benchmark — это то же самое UL, которое публикует 3DMark и PCMark. Он запускает стандартные модели ONNX (MobileNet, ResNet, Inception) через бэкенды TensorRT, DirectML, OpenVINO и CoreML и производит оценку. Производители цитируют числа Procyon в обзорах, поэтому оценка напрямую сравнима по отрасли.
Недостатки: Сосредоточен на рабочих нагрузках компьютерного зрения; менее полезен для пропускной способности LLM. Платная лицензия для коммерческого использования.
Цены:
- Бесплатно: Пробная оценка раскрывает базовые числа.
- Платный вариант: Лицензия разблокирует полный запуск.
Платформы: Windows.
Скачать: UL Procyon AI
Итог: Купите это, если вы принимаете решения о покупке, используя бенчмарки производителей. Пропустите, если вас волнует только скорость LLM.
5. Geekbench AI — лучшая кроссплатформенная AI оценка
Geekbench AI производит три цифры на запуск: FP32, FP16 и квантованный INT8. Он работает на Windows, macOS, Linux, iOS и Android, поэтому сравнение ноутбука и телефона для одной и той же рабочей нагрузки находится на расстоянии одного бенчмарка. Общедоступная база данных результатов позволяет вам сравнить ваш запуск с тысячами других.
Недостатки: Не специфичен для LLM. Три оценки сворачивают много нюансов.
Цены:
- Бесплатно: Пробный запуск.
- Платный вариант: Полная лицензия разблокирует запуски в пакетной обработке и экспорт истории.
Платформы: Windows, macOS, Linux, iOS, Android.
Скачать: Geekbench AI
Итог: Цифра «по умолчанию» для “насколько мое AI-способное оборудование стоит”.
6. MLPerf Client — лучший эталонный бенчмарк MLCommons
MLPerf Client — это поддерживаемый MLCommons эталонный бенчмарк для AI на клиентском оборудовании. Он запускает предустановленную рабочую нагрузку LLM (в настоящее время Llama 2 7B, переходящую на более новые модели) и сообщает задержку, пропускную способность и регрессию качества по сравнению с эталонной реализацией. Поскольку MLCommons публикует результаты прозрачно, сравнение установок простое.
Недостатки: Настройка сложнее, чем у альтернатив. Не предназначен для конечных пользователей.
Цены:
- Бесплатно: Open-source.
- Платный вариант: Нет.
Платформы: Windows, Linux (native), macOS (сборки сообщества).
Скачать: MLPerf Client на GitHub
Итог: Авторитетный бенчмарк. Стоит потраченных усилий на настройку, если вы планируете опубликовать сравнение оборудования.
7. koboldcpp benchmark — лучшая эмуляция нагрузки roleplay и chat
koboldcpp — это ветвь llama.cpp, сосредоточенная на roleplay и длинном контексте chat. Его режим бенчмарка имитирует реальный сеанс чата с прокручивающимся контекстом, что является более честным тестом того, как будет ощущаться домашний LLM сервер день за днем. Цифры включают стоимость обмена контекстом и поведение переполнения системной памяти, что llama-bench упускает.
Недостатки: Сосредоточен на рабочих нагрузках chat/RP; пропускает метрики, ориентированные на код. Интерфейс выглядит загруженным на первый взгляд.
Цены:
- Бесплатно: Open-source.
- Платный вариант: Нет.
Платформы: Windows, macOS, Linux.
Скачать: koboldcpp на GitHub
Итог: Наиболее репрезентативный бенчмарк для всех, чей реальный сценарий использования — это чат, а не код.
Как выбрать правильный
Начните с llama-bench для воспроизводимых цифр по квантизациям. Добавьте встроенную вкладку бенчмарка LM Studio, если вы предпочитаете GUI. Используйте флаг verbose Ollama для быстрой проверки здравомыслия на компьютере, где вы уже запускаете модели. Добавьте Geekbench AI, когда вам нужна одна портативная оценка. Сохраните UL Procyon или MLPerf Client для формального сравнения оборудования, где имеет значение легитимность третьей стороны. Используйте бенчмарк koboldcpp, когда ваша ежедневная рабочая нагрузка — это чат, а не выполнение кода.
Пропустите спецификации “AI TOPS” производителей как замену; цифры являются пиковыми-теоретическими и редко отражают реальную пропускную способность вывода на квантизациях, которые вы используете.
Часто задаваемые вопросы
Какой GPU дает лучшую скорость локального LLM сегодня? Для потребительских карт RTX 4090, 4080 Super и 5080 лидируют на Nvidia; RX 7900 XTX лидирует на AMD. Apple M3 Max и M4 Max закрывают разрыв для моделей, которые подходят в унифицированную память.
Сколько токенов в секунду мне на самом деле нужно? Чат в реальном времени выглядит хорошо выше 20 t/s на выводе модели. Что-то выше 40 t/s неотличимо от быстрого API SaaS.
Помогает ли больше VRAM или вычисления побеждают? Для LLM VRAM — это более сложное ограничение. Размещение полной модели в VRAM без переполнения в системную память важнее, чем чистое вычисление выше определенного порога.
Сравним ли бенчмарк в Windows с бенчмарком на Linux? Для тестов на основе CUDA в основном да. Различия в драйверах добавляют несколько процентов дисперсии. Для DirectML vs ROCm разница намного больше, и цифры Linux обычно выше.
Какой вариант бенчмарка самый дешевый? llama-bench и Ollama оба стоят ничего. Оба работают на любом потребительском GPU.
Помогают ли они мне выбрать между LM Studio и Ollama? Да. Сделайте бенчмарк одной и той же модели в обоих и сравните токены в секунду и скорость обработки prompts. Ollama обычно выигрывает на скорости обмена моделями; GUI LM Studio помогает при экспериментах.