Приложения для локального бенчмарка GPU AI на ПК

Отчёт XDA о том, что среднего класса GPU хватит для оплаты стека платных AI подписок, попадает в точку. RTX 4070 Ti или Radeon RX 7900 XT запускают модели с 13B и 34B параметрами на скорости, которая превосходит то, что большинство облачных сервисов берут за одну подписку. Но выбор модели, квантизации и среды выполнения для оборудования, которое уже есть, требует реальных цифр, а не предположений.

Семь приложений ниже охватывают два типа бенчмарков. Первые три — это встроенные в среду выполнения бенчмарки, которые сообщают токены в секунду и время до первого токена для реальных рабочих нагрузок. Остальные — наборы бенчмарков от третьих сторон, которые дают воспроизводимые оценки для сравнения оборудования. Каждое приложение работает на Windows и Linux; два также работают на macOS с Apple Silicon.

На что обратить внимание в бенчмарке GPU AI

Не каждый AI бенчмарк рассказывает вам то, что вам нужно знать. Проверьте эти пять вещей:

Что-либо, что сообщает только одно число пропускной способности в одном контексте, не полезно для реального определения размера оборудования.

Быстрое сравнение

Приложение Лучше всего подходит для Бесплатный план Начальная цена Выделяющаяся функция
llama-bench Воспроизводимая пропускная способность LLM Да Бесплатно Входит в состав llama.cpp
LM Studio GUI бенчмарки + покупка моделей Да Бесплатно Встроенный каталог моделей
Ollama benchmark Одна команда для стресс-теста LLM Да Бесплатно Запускается с любой загруженной моделью
UL Procyon AI Стандартный бенчмарк производителя Триал Платная лицензия Пути ONNX + DirectML
Geekbench AI Кроссплатформенная AI оценка Да Бесплатный уровень iOS, Android, Windows, macOS
MLPerf Client Эталонный бенчмарк от MLCommons Да Бесплатно Глубокое профилирование оборудования
koboldcpp benchmark Эмуляция нагрузки roleplay/chat Да Бесплатно Реалистично имитирует сеансы чата

Приложения

1. llama-bench — лучшая воспроизводимая пропускная способность LLM

llama-bench входит в состав llama.cpp и является ближайшим аналогом стандартной линейки в мире локальных LLM. Укажите ему файл GGUF, скажите размер контекста и размер батча, и он сообщит токены prompts в секунду, токены generation в секунду и время до первого токена. Он работает на любом бэкенде CUDA, ROCm, Metal или CPU, поэтому один инструмент дает сравнимые цифры на вашем Nvidia rig, Radeon build и MacBook.

Недостатки: Только командная строка. Нет GUI. Некоторые опции (BLAS, размер батча) требуют чтения документации.

Цены:

Платформы: Windows, macOS, Linux.

Скачать: llama.cpp на GitHub

Итог: Стандартный бенчмарк при сравнении квантизаций или моделей. Изучите его флаги один раз.

2. LM Studio — лучший GUI бенчмарк с покупкой моделей

LM Studio — это настольное приложение, которое обертывает llama.cpp с графическим интерфейсом для загрузки, запуска и теперь бенчмарка моделей. Встроенная вкладка бенчмарка тестирует любую загруженную модель в стандартной рабочей нагрузке и сообщает метрики таким образом, что неспециалисты могут прочитать. Он также показывает оставшееся место VRAM, что помогает определить размер следующей модели.

Недостатки: Закрытый исходный код. Каталог моделей пересекается с HuggingFace и не полный.

Цены:

Платформы: Windows, macOS (Apple Silicon), Linux.

Скачать: LM Studio

Итог: Самый дружелюбный способ провести бенчмарк свежей модели без касания терминала.

3. Ollama benchmark — лучший одноcomandный стресс-тест LLM

Ollama имеет флаг run --verbose, который производит синхронизацию по токенам. В сочетании с поддерживаемыми сообществом скриптами он работает как инструмент бенчмарка. Поскольку Ollama загружает модели по имени, запуск одного и того же бенчмарка на втором компьютере требует двух команд.

Недостатки: Не полный набор бенчмарков. Сосредоточен на скорости завершения; менее полезен для рабочих нагрузок с большим количеством prompts.

Цены:

Платформы: Windows, macOS, Linux.

Скачать: Ollama

Итог: Установите Ollama для ежедневного использования моделей; используйте --verbose, когда вам нужна быстрая отчет о пропускной способности.

4. UL Procyon AI — лучший стандартный бенчмарк производителя

UL Procyon AI Computer Vision Benchmark — это то же самое UL, которое публикует 3DMark и PCMark. Он запускает стандартные модели ONNX (MobileNet, ResNet, Inception) через бэкенды TensorRT, DirectML, OpenVINO и CoreML и производит оценку. Производители цитируют числа Procyon в обзорах, поэтому оценка напрямую сравнима по отрасли.

Недостатки: Сосредоточен на рабочих нагрузках компьютерного зрения; менее полезен для пропускной способности LLM. Платная лицензия для коммерческого использования.

Цены:

Платформы: Windows.

Скачать: UL Procyon AI

Итог: Купите это, если вы принимаете решения о покупке, используя бенчмарки производителей. Пропустите, если вас волнует только скорость LLM.

5. Geekbench AI — лучшая кроссплатформенная AI оценка

Geekbench AI производит три цифры на запуск: FP32, FP16 и квантованный INT8. Он работает на Windows, macOS, Linux, iOS и Android, поэтому сравнение ноутбука и телефона для одной и той же рабочей нагрузки находится на расстоянии одного бенчмарка. Общедоступная база данных результатов позволяет вам сравнить ваш запуск с тысячами других.

Недостатки: Не специфичен для LLM. Три оценки сворачивают много нюансов.

Цены:

Платформы: Windows, macOS, Linux, iOS, Android.

Скачать: Geekbench AI

Итог: Цифра «по умолчанию» для “насколько мое AI-способное оборудование стоит”.

6. MLPerf Client — лучший эталонный бенчмарк MLCommons

MLPerf Client — это поддерживаемый MLCommons эталонный бенчмарк для AI на клиентском оборудовании. Он запускает предустановленную рабочую нагрузку LLM (в настоящее время Llama 2 7B, переходящую на более новые модели) и сообщает задержку, пропускную способность и регрессию качества по сравнению с эталонной реализацией. Поскольку MLCommons публикует результаты прозрачно, сравнение установок простое.

Недостатки: Настройка сложнее, чем у альтернатив. Не предназначен для конечных пользователей.

Цены:

Платформы: Windows, Linux (native), macOS (сборки сообщества).

Скачать: MLPerf Client на GitHub

Итог: Авторитетный бенчмарк. Стоит потраченных усилий на настройку, если вы планируете опубликовать сравнение оборудования.

7. koboldcpp benchmark — лучшая эмуляция нагрузки roleplay и chat

koboldcpp — это ветвь llama.cpp, сосредоточенная на roleplay и длинном контексте chat. Его режим бенчмарка имитирует реальный сеанс чата с прокручивающимся контекстом, что является более честным тестом того, как будет ощущаться домашний LLM сервер день за днем. Цифры включают стоимость обмена контекстом и поведение переполнения системной памяти, что llama-bench упускает.

Недостатки: Сосредоточен на рабочих нагрузках chat/RP; пропускает метрики, ориентированные на код. Интерфейс выглядит загруженным на первый взгляд.

Цены:

Платформы: Windows, macOS, Linux.

Скачать: koboldcpp на GitHub

Итог: Наиболее репрезентативный бенчмарк для всех, чей реальный сценарий использования — это чат, а не код.

Как выбрать правильный

Начните с llama-bench для воспроизводимых цифр по квантизациям. Добавьте встроенную вкладку бенчмарка LM Studio, если вы предпочитаете GUI. Используйте флаг verbose Ollama для быстрой проверки здравомыслия на компьютере, где вы уже запускаете модели. Добавьте Geekbench AI, когда вам нужна одна портативная оценка. Сохраните UL Procyon или MLPerf Client для формального сравнения оборудования, где имеет значение легитимность третьей стороны. Используйте бенчмарк koboldcpp, когда ваша ежедневная рабочая нагрузка — это чат, а не выполнение кода.

Пропустите спецификации “AI TOPS” производителей как замену; цифры являются пиковыми-теоретическими и редко отражают реальную пропускную способность вывода на квантизациях, которые вы используете.

Часто задаваемые вопросы

Какой GPU дает лучшую скорость локального LLM сегодня? Для потребительских карт RTX 4090, 4080 Super и 5080 лидируют на Nvidia; RX 7900 XTX лидирует на AMD. Apple M3 Max и M4 Max закрывают разрыв для моделей, которые подходят в унифицированную память.

Сколько токенов в секунду мне на самом деле нужно? Чат в реальном времени выглядит хорошо выше 20 t/s на выводе модели. Что-то выше 40 t/s неотличимо от быстрого API SaaS.

Помогает ли больше VRAM или вычисления побеждают? Для LLM VRAM — это более сложное ограничение. Размещение полной модели в VRAM без переполнения в системную память важнее, чем чистое вычисление выше определенного порога.

Сравним ли бенчмарк в Windows с бенчмарком на Linux? Для тестов на основе CUDA в основном да. Различия в драйверах добавляют несколько процентов дисперсии. Для DirectML vs ROCm разница намного больше, и цифры Linux обычно выше.

Какой вариант бенчмарка самый дешевый? llama-bench и Ollama оба стоят ничего. Оба работают на любом потребительском GPU.

Помогают ли они мне выбрать между LM Studio и Ollama? Да. Сделайте бенчмарк одной и той же модели в обоих и сравните токены в секунду и скорость обработки prompts. Ollama обычно выигрывает на скорости обмена моделями; GUI LM Studio помогает при экспериментах.