Microsoft ThinkingBox: оценка AI-агентов по оставленным записям


Microsoft ThinkingBox представляет собой инновационную платформу, которая оценивает AI-агентов не по генерируемым предложениям, а по записям, которые они оставляют после выполнения задач. Эта система теперь доступна через Hugging Face и предоставляет возможность оценивать эффективность AI-агентов в различных сценариях.

Как работает ThinkingBox

ThinkingBox использует подход, при котором агент проходит через изолированные сессии инструментов MCP (Multi-Channel Processing), а затем оценивается на основе состояния терминала и побочных эффектов, которые он оставляет после выполнения задачи. Это позволяет выявить несоответствия между тем, что агент сообщает, и тем, что фактически происходит в базе данных. Например, если клиент обращается с проблемой доставки кухонного прибора, AI-агент может выполнить несколько действий, таких как проверка статуса заказа и открытие тикета. Однако, если он не решает основную проблему, оставляя статус тикета в состоянии "в ожидании", это указывает на недостаточную эффективность агента. ThinkingBox фиксирует такие несоответствия и оценивает их.

Оценка AI-агентов

В рамках исследования было проведено 507 рабочих процессов, каждый из которых запускался 20 раз с использованием различных моделей LLM (Large Language Models). Оценка проводилась по нескольким ключевым метрикам:
  • pass@1: доля всех попыток, которые завершились успешно.
  • pass@20: доля задач, которые были решены хотя бы раз за 20 попыток.
  • observed 20/20: количество задач, которые успешно прошли все 20 попыток.
  • Эти метрики помогают понять, насколько надежен агент в выполнении задач. Например, модель Claude Opus 5.5 продемонстрировала общий результат в 67.16%, что делает её лидером среди протестированных моделей.

    Проблемы с надежностью

    Важно отметить, что один успешный результат не гарантирует надежности. Агент, который корректно обрабатывает возврат один раз, может ошибиться в следующих попытках. Поэтому каждый сценарий тестируется 20 раз, чтобы оценить, насколько последовательно агент выполняет задачи.

    Стоимость консистентности

    При оценке моделей также учитывается стоимость успешной попытки. Это позволяет понять, сколько стоит каждая успешная задача, что особенно важно для компаний, использующих AI-агентов в реальных условиях. Например, модель GPT-5.4 имеет стоимость $0.131 за успешную задачу, что делает её одной из самых экономически эффективных.

    Подписи неудач

    Анализ неудач показал, что около 80% из них связаны с неправильным использованием инструментов, а не с ошибками в логике. Это указывает на необходимость улучшения обработки ошибок и управления инструментами, чтобы повысить общую эффективность AI-агентов.

    Как запустить собственные тесты

    ThinkingBox теперь доступен на Hugging Face, и любой желающий может запустить собственные тесты. Для этого необходимо установить OpenEnv и ThinkingBox, а затем запустить тестовые сценарии, чтобы оценить производительность выбранной модели.

    Заключение

    Работа с ThinkingBox открывает новые горизонты для оценки AI-агентов. Вместо того чтобы полагаться на поверхностные метрики, такие как качество генерируемых предложений, ThinkingBox предлагает глубокий анализ, основанный на фактических изменениях в базе данных. Это позволяет разработчикам и компаниям лучше понимать, как их AI-агенты справляются с реальными задачами и где есть возможности для улучшения.

    Комментарии (0)

    Войдите, чтобы оставлять комментарии.
    Пока нет комментариев. Будьте первым!