Как улучшить надежность агентов на основе ИИ: новая методология для повышения согласованности


Современные агенты на основе искусственного интеллекта, такие как ReAct, демонстрируют впечатляющие результаты в тестах, но часто сталкиваются с проблемой непредсказуемости. На репетициях они могут успешно выполнять задачи, но в реальных условиях, во время живых демонстраций, результаты могут значительно отличаться. Это создает серьезные проблемы, особенно в критически важных областях, таких как финансовые транзакции или проверка контрактов. Например, агент, использующий GPT-4.1, показал средний успех в 77.4% случаев, но только 53% задач были выполнены успешно во всех пяти повторениях. Это создает разрыв в 24.4% между средним показателем и показателем согласованности.

Проблема непостоянства

Стандартные метрики, такие как Mean@k, часто скрывают эту вариативность, предоставляя только средние значения. Однако для реальных пользователей важнее знать, будет ли агент также успешен при повторном запросе. Для этого необходима метрика Pass^k, которая учитывает процент задач, выполненных успешно во всех k запусках. Pass^k всегда меньше или равно Mean@k, что подчеркивает, что средние показатели могут вводить в заблуждение.

Почему агенты могут ошибаться

Каждый раз, когда агент принимает решение, это основано на вероятностном распределении. Если распределение резкое, то агент будет последовательно принимать одно и то же решение. Однако если распределение плоское, то результаты могут варьироваться, что приводит к непредсказуемости. Это объясняет, почему даже при использовании фиксированных параметров, таких как температура 0.0, результаты могут меняться от запуска к запуску.

Новый подход: анализ согласованности

Чтобы решить эту проблему, была разработана новая методология, основанная на инструменте под названием Consistency Analyzer. Этот инструмент позволяет анализировать записанные траектории агента и выявлять точки, где решения могут меняться. Процесс состоит из двух этапов: 1. Обнаружение: Consistency Analyzer пересматривает каждое решение агента, измеряя, насколько сильно его выводы могут варьироваться. Это достигается путем повторного запроса нескольких завершений (по умолчанию k=5) для каждой точки принятия решения. 2. Генерация: Каждое отмеченное решение становится кандидатом на создание руководства по согласованности, которое затем интегрируется в существующую систему ALTK-Evolve.

Результаты: сокращение разрыва

Проведенные тесты на наборе данных AppWorld показали, что использование новых руководств по согласованности позволило сократить разрыв между средними показателями и показателями согласованности почти вдвое. Процент задач, выполненных успешно во всех запусках, увеличился с 53.0% до 69.0%, в то время как средний показатель повысился с 77.4% до 81.0%. Это означает, что почти треть ранее непостоянных задач теперь выполняется успешно на каждом запуске.

Применение и рекомендации

Для разработчиков агентов важно сообщать о показателе Pass^k наряду со средними показателями. Это поможет выявить надежных агентов и избежать ситуации, когда удача маскирует недостатки. Кроме того, использование Consistency Analyzer не требует повторного запуска задач и может быть применено в реальных условиях, что делает его удобным инструментом для повышения надежности.

Заключение

Методология ALTK-Evolve и Consistency Analyzer открывают новые горизонты для повышения надежности агентов на основе ИИ. Эти инструменты позволяют не только улучшить согласованность, но и сохранить средние показатели, что делает их ценными для различных приложений в реальном времени. Открытый исходный код и технические отчеты доступны для тех, кто хочет углубиться в детали и применить эти методы в своих проектах.

Комментарии (0)

Войдите, чтобы оставлять комментарии.
Пока нет комментариев. Будьте первым!