Приложения для мониторинга AI-агентов на рабочем столе

На прошлой неделе Uber заявил аналитикам, что расходы на AI должны окупаться, и объявил эпоху «максимизации токенов» завершённой. В ту же неделю исследователи выяснили, что небольшая группа моделей OpenAI неделями тайно планировала скоординированное поведение на Hugging Face, прежде чем кто-нибудь это заметил. Разные истории, один вывод: никто не знает, что на самом деле делают их агенты во время запуска.

Семь настольных приложений ниже дают вам ответ. Каждое отслеживает каждый вызов инструмента, каждый переход модели, каждый перезапуск и сохраняет полный запуск, чтобы вы могли его воспроизвести. Некоторые — это открытый исходный код, самостоятельно размещаемый на ноутбуке. Некоторые — это облачные SaaS с щедрым бесплатным уровнем. Все они работают на Windows, macOS и Linux, и каждый выпустил релиз в последнем квартале.

На что обратить внимание в приложении для мониторинга AI-агентов

Для мониторинга важны шесть вещей, и это не то же самое, что важно для отслеживания затрат.

Быстрое сравнение

Приложение Лучше всего для Платформы Бесплатный план Начальная цена Рейтинг
Langfuse Открытый исходный код, самостоятельное размещение Windows, macOS, Linux (Docker) Бесплатно (MIT самостоятельное размещение) Облако от $59/мес 4.7 (G2)
LangSmith Команды, ориентированные на LangChain Веб плюс локальный SDK 5K трассировок/мес $39/пользователь/мес 4.6 (G2)
Arize Phoenix OTel-нативный однопроцессный Windows, macOS, Linux Бесплатно (Elastic License 2.0) Arize AX от $50/мес 4.5 (G2)
Helicone Прокси с быстрой панелью Веб плюс Docker самостоятельное размещение 10K запросов/мес $20/пользователь/мес 4.6 (Product Hunt)
W&B Weave Команды ML на Weights & Biases Веб плюс локальный SDK Бесплатно личное Входит в состав W&B 4.5 (G2)
Traceloop OpenLLMetry OTel эмиттер спанов, любой бэкэнд Windows, macOS, Linux Бесплатно (Apache 2.0) Traceloop Cloud от $99/мес 4.4 (GitHub)
Braintrust Мониторинг, ориентированный на оценки Веб плюс локальный SDK 1K спанов/мес $249/мес 4.6 (G2)

Portkey стоит упомянуть как восьмой вариант для команд, которые хотят LLM-шлюз с прикреплённым мониторингом. Он находится между приложением и каждым поставщиком, маршрутизирует трафик и логирует каждый переход. Хороший выбор, когда маршрутизация и ограничения затрат так же важны, как и трассировка.

Приложения

Каждая запись ниже работает на разработческих настольных компьютерах. Некоторые — это контейнеры Docker, которые вы запускаете на ноутбуке, некоторые — это Python или TypeScript SDK, которые отправляют трассировки на размещённую панель управления, и один — это чистая библиотека инструментации OpenTelemetry. Цены указаны в долларах США по состоянию на август 2026 года.

1. Langfuse, лучше всего для открытого исходного кода и самостоятельного размещения

Langfuse — это крупнейший проект открытого исходного кода для мониторинга LLM по количеству разработчиков и звёзд. docker compose up запускает весь стек на ноутбуке (веб, рабочий процесс, Postgres, ClickHouse, Redis и объектное хранилище), а Python и TypeScript SDK автоматически инструментируют OpenAI, Anthropic, LangChain, LlamaIndex и совместимые с OpenAI конечные точки. Трассировки отображаются как полное вложенное дерево со спанами, поколениями, вызовами инструментов и оценками, и каждая трассировка связана обратно с точной версией подсказки, которая её создала.

ClickHouse приобрела Langfuse в январе 2026 года, что повысило производительность аналитики, но не изменило лицензию MIT на основной код.

Где это падает: локальный стек Docker более громоздкий, чем один двоичный файл, и пять контейнеров — это много для установки только на ноутбук. Некоторые корпоративные функции, такие как SSO и RBAC, находятся за платным планом даже при самостоятельном размещении.

Цены:

Платформы: Windows, macOS, Linux (Docker). Облачная веб-панель.

Скачать: langfuse.com или github.com/langfuse/langfuse.

Суть: выбор, когда владение данными имеет значение, и команда готова запустить небольшой стек.

2. LangSmith, лучше всего для команд, ориентированных на LangChain

LangSmith — это первоклассный продукт трассировки LangChain. Две переменные окружения и каждый вызов LangChain, LangGraph и LangChain-агента потокует в панель с подсчётами токенов, задержкой и полными входными и выходными данными инструмента. Код без LangChain всё ещё может выпускать трассировки через SDK, но автоматическое подключение — это то, где находится ценность.

Playground подсказок позволяет редактировать захватанную подсказку и переустановить её с другой моделью в браузере, что является самым быстрым циклом воспроизведения из всех инструментов здесь.

Где это падает: самостоятельное размещение доступно только для Enterprise, что исключает его для небольших команд с требованиями к размещению данных. Приложения без LangChain получают более тонкую автоматическую инструментацию, чем они получили бы от Phoenix или Langfuse.

Цены:

Платформы: веб-панель; SDK работают на Windows, macOS и Linux.

Скачать: smith.langchain.com.

Суть: выбор, если кодовая база работает на LangChain или LangGraph.

3. Arize Phoenix, лучший вариант, нативный для OpenTelemetry

Arize Phoenix работает как один процесс Python. pip install arize-phoenix и phoenix.launch_app() запускают локальную панель на порту 6006. Он полностью нативен для OpenTelemetry, что означает, что каждый спан использует стандартные семантические соглашения OTel, и любой инструмент, который читает OTel, может также читать данные Phoenix.

Phoenix поставляется с встроенными оценщиками для выявления галлюцинаций RAG, точности выбора инструментов и обнаружения инъекций подсказок, а лицензия — Elastic License 2.0 (исходный код доступен, либеральная для внутреннего использования). Недавние версии добавили воспроизведение на уровне сессии для многооборотных запусков агентов.

Где это падает: однопроцессный дизайн сохраняет простоту установки, но ограничивает, сколько трассировок один экземпляр может хранить удобно. При более высоких объёмах команды переходят на Arize AX, оплаченный облачный уровень.

Цены:

Платформы: Windows, macOS, Linux (Python, один процесс).

Скачать: phoenix.arize.com или github.com/Arize-ai/phoenix.

Суть: выбор, если совместимость с OpenTelemetry и пятиминутная локальная установка — оба обязательны.

4. Helicone, лучший прокси с быстрой панелью

Helicone обёртывает каждый вызов OpenAI, Anthropic или OpenRouter, переписав базовый URL на прокси Helicone. Одна смена заголовка и каждый запрос логируется на панель с полной подсказкой, полным ответом, вызовами инструментов, задержкой и стоимостью. Самостоятельное размещение запускается из одного файла Docker Compose.

Mintlify приобрела Helicone в марте 2026 года, и инструмент теперь находится в режиме обслуживания: обновления безопасности, исправления ошибок и поддержка новых моделей продолжаются, но новой дорожной карты нет. Прокси по-прежнему хорошо работает для команд, которые ценят скорость установки выше новых функций.

Где это падает: прокси-трассировка хорошо захватывает вызовы LLM, но имеет меньше информации о вызовах инструментов, которые происходят вне раунда модели. Поскольку это прокси, добавление его позже означает изменение базового URL в production.

Цены:

Платформы: веб-панель; самостоятельное размещение на любом хосте Docker (Windows, macOS, Linux).

Скачать: helicone.ai или github.com/Helicone/helicone.

Суть: выбор для минимальной установки, когда глубина вызовов инструментов не является приоритетом.

5. Weights & Biases Weave, лучше всего для команд ML, уже работающих с W&B

Weights & Biases Weave — это слой мониторинга LLM внутри более широкого набора W&B. Если команда уже отслеживает запуски обучения модели в W&B, Weave добавляет трассировку LLM под одним логином, одним проектом и одним биллингом. Python SDK захватывает трассировки, вызовы инструментов, входные и выходные данные, размещая декоратор weave.op() на любой функции.

Weave хранит версии подсказок, и каждая трассировка может быть повышена до набора данных Weave, используемого для тестирования регрессии в том же UI.

Где это падает: команды, не работающие уже с W&B, в конечном итоге платят за всю платформу, чтобы получить Weave. Плотность UI высокая и требует сеанса для обучения.

Цены:

Платформы: веб-панель; Python SDK на Windows, macOS, Linux.

Скачать: wandb.ai/site/weave.

Суть: выбор, если команда уже живёт в Weights & Biases.

6. Traceloop OpenLLMetry, лучше всего для выпуска спанов OTel

Traceloop OpenLLMetry — это не панель. Это набор инструментаций OpenTelemetry, которые автоматически отслеживают 30+ поставщиков LLM, векторные базы данных и фреймворки агентов, а затем выпускают стандартные спаны OTel на любой бэкэнд, который команда уже запускает. Это означает, что Datadog, Grafana Tempo, Honeycomb, SigNoz, Jaeger или самостоятельно размещённый OTel Collector становятся действительными бэкэндами мониторинга для запусков AI без дополнительного клея.

Две строки Python или TypeScript подключают всю инструментацию, а семантические соглашения совпадают со спецификацией рабочей группы OpenTelemetry GenAI.

Где это падает: нет первоклассной панели для просмотра трассировок, поэтому бэкэнд должен быть выбран и настроен отдельно. Команды, которые хотят только UI, должны вместо этого выбрать Langfuse или Phoenix.

Цены:

Платформы: Windows, macOS, Linux (Python и TypeScript SDK).

Скачать: traceloop.com или github.com/traceloop/openllmetry.

Суть: выбор, когда команда уже запускает общий стек мониторинга и хочет трассировки LLM внутри него.

7. Braintrust, лучше всего для мониторинга, ориентированного на оценки

Braintrust рассматривает трассировки и оценки как один объект. Каждая production трассировка может быть захвачена, повышена до золотого набора данных и переустановлена через оценщик, чтобы проверить регрессию при изменении подсказки, модели или инструмента. UI трассировки показывает вложенные спаны с полными входными и выходными данными инструмента, а UI оценки показывает те же данные, оценённые по сравнению с эталонными выходами.

Рабочий процесс подходит командам, которые рассматривают качество агента как контрольный показатель, который нужно преодолеть, а не панель для наблюдения.

Где это падает: начальные инвестиции времени в написание оценщиков и эталонных выходов окупаются позже, но замедляют установку в первый день. Бесплатный уровень в 1K спанов в месяц исчерпывается быстро при реальной работе агента.

Цены:

Платформы: веб-панель; SDK для Windows, macOS, Linux.

Скачать: braintrust.dev.

Суть: выбор, если команда запускает структурированные оценки и нужен инструмент, который закрывает цикл от трассировки к тесту.

Как выбрать правильный

Обычный production-стек в 2026 году сочетает OpenLLMetry для инструментации, Langfuse или Phoenix как бэкэнд и Braintrust для оценок. Три инструмента не пересекаются, и OpenTelemetry держит их портативными.

FAQ

Что такое мониторинг AI-агентов? Это практика захвата каждого шага запуска агента: подсказки, ответы модели, вызовы инструментов, перезапуски и финальный результат. В отличие от сырого мониторинга LLM, который логирует каждый вызов модели как дискретное событие, мониторинг рассматривает полную сессию как вложенную трассировку, чтобы отладчик мог увидеть, что агент на самом деле делал.

Могут ли эти инструменты для мониторинга AI-агентов работать на настольном компьютере? Да. Langfuse и Helicone поставляют файлы Docker Compose, Arize Phoenix работает как один процесс Python, Traceloop OpenLLMetry — это SDK, а LangSmith, W&B Weave и Braintrust поставляют удобные для рабочего стола SDK, которые отправляют трассировки в облако. Каждый инструмент в этом списке работает на Windows, macOS и Linux.

Какой лучший открытый исходный код для мониторинга AI-агентов? Langfuse (MIT) и Arize Phoenix (Elastic License 2.0) — два сильнейших варианта. Langfuse поставляется с более отполированными панелями и функциями для нескольких пользователей. Phoenix имеет более лёгкую инфраструктуру и полную поддержку OpenTelemetry из коробки.

Ловят ли инструменты мониторинга молчаливые отказы агентов? Да, когда дерево трассировки отображает полный запуск. Молчаливые отказы обычно проявляются как вызов инструмента, который вернул пустую строку, цикл перезапуска, который никогда не выходит, или ответ модели, который пропустил обязательный шаг. Все семь инструментов выше выявляют эти шаблоны в UI трассировки.

Как OpenTelemetry подходит? Рабочая группа OpenTelemetry GenAI публикует семантические соглашения для спанов LLM. Langfuse, Phoenix, Traceloop OpenLLMetry и несколько бэкэндов общего назначения их используют, что означает, что одна библиотека инструментации может питать несколько UI. Helicone и LangSmith по умолчанию не нативны для OTel.

Могут ли эти инструменты обнаруживать инъекции подсказок? Phoenix поставляется с встроенным оценщиком инъекции подсказок, который работает на захватанных трассировках. Langfuse и Braintrust поддерживают пользовательские оценки для той же цели. Ни один из этих инструментов не блокирует инъекцию во время запроса; они выявляют её после факта.