
В современных предприятиях важно, чтобы агенты искусственного интеллекта работали эффективно в специфических условиях их окружения. Задачи, которые ставятся перед такими агентами, формируются на основе используемых систем, соблюдаемых правил и состояния данных. Даже если модель обладает широкими возможностями, она может испытывать трудности в определенной среде, например, из-за неэффективного выполнения рабочего процесса, неправильного использования инструментов или несоблюдения ограничений. Эти слабые места требуют улучшения, однако преобразование их в обучающие данные представляет собой сложную задачу.
Проблема создания обучающих данных
Одиночный провал модели может дать полезную информацию, но для обучения модели необходимо множество новых задач, которые проверяют одну и ту же способность в различных ситуациях. Эти задачи должны быть выполнимыми в данной среде, напоминать реальные запросы пользователей и иметь надежный способ проверки успешности выполнения. В ServiceNow CoreAI была разработана система AutoSynthData, которая превращает эти пробелы в возможностях в обучающие данные. Она использует ошибки целевой модели и успехи более сильной модели-наставника для определения того, чему следует научить целевую модель, а затем генерирует и проверяет новые задачи, которые развивают эти способности.
Определение среды агента
Агентская среда определяет мир, в котором работает агент: состояние, которое он может наблюдать и изменять, инструменты и API, которые он может вызывать, и переходы состояния, возникающие в результате его действий. Задача формируется в рамках этой среды. Мы используем следующую абстракцию: задача = (спецификация системы, пользовательский запрос, проверяющий механизм).
Спецификация системы
Спецификация системы определяет ограничения, в рамках которых работает агент, включая инструкции системы, политики окружения и, при необходимости, специфическую инициализацию задач, такую как состояние базы данных или набор статей знаний. Спецификация должна быть совместима с инструментами, состоянием и поддерживаемыми действиями среды.
Пользовательский запрос
Пользовательский запрос определяет, что пользователь хочет, чтобы агент выполнил, вместе с любыми ограничениями на уровне пользователя. Сгенерированная задача должна удовлетворять трем свойствам:
Выполнимость: должна существовать хотя бы одна траектория в текущей среде, которая удовлетворяет пользовательскому запросу и соблюдает спецификацию системы.
Реализм: запрос должен напоминать то, что пользователь мог бы реально спросить в целевой среде.
Сложность: задача должна выявлять слабость текущего агента.
Проверяющий механизм
Проверяющий механизм определяет, успешно ли завершена задача. Он должен удовлетворять трем свойствам:
Последовательность: он должен согласовываться с пользовательским запросом, спецификацией системы и состоянием среды.
Звучность: он должен отвергать траектории, которые не удовлетворяют задаче или нарушают соответствующие ограничения.
Полнота: он должен принимать действительные решения, а не кодировать одну конкретную эталонную траекторию.
Обзор работы AutoSynthData
AutoSynthData генерирует обучающие задачи, состоящие из спецификации системы, пользовательского запроса и проверяющего механизма. Сгенерированные задачи основаны на среде и выбраны для предоставления полезного обучающего сигнала для текущей модели. Сначала AutoSynthData оценивает целевую модель в среде с помощью диагностических задач и выявляет паттерны в задачах, которые она не может выполнить. Более сильная модель-наставник помогает охарактеризовать, какие из этих задач решаемы и как выглядит успешное поведение.
Генерация и масштабирование задач
Выявление пробела в возможностях показывает, чему нужно научить модель, но для обучения требуется множество разнообразных задач, которые развивают эту способность. AutoSynthData использует спецификацию для генерации таких задач. Например, если целевая модель испытывает трудности с задачами, требующими определенного рабочего процесса, генератор создает новые задачи, варьируя сущности, начальное состояние среды, состав рабочего процесса и т.д. Более сильная модель-наставник затем демонстрирует успешную траекторию для каждой задачи.
Реализация и проверка качества
Для поддержки обеих фаз AutoSynthData разделяет управление генерацией от выполнения в специфической среде. Общий контроллер координирует генерацию, контроль качества, охват и построение набора данных, в то время как адаптер обрабатывает выполнение в среде, управление задачами и состоянием, проверку ссылок и т.д. Качество синтетических данных зависит от проверок, применяемых к каждому кандидату: задача должна быть выполнимой, решение должно работать, а проверяющий механизм должен различать успех и неудачу.
Эксперименты в EnterpriseOps Gym
Мы использовали EnterpriseOps Gym для тестирования, улучшает ли этот подход модель в задачах в состоянии предприятия. Мы генерировали обучающие задачи в средах Hybrid и ITSM, дообучали целевую модель на принятых образцах и оценивали полученные контрольные точки. В результате экспериментов в Hybrid среде, синтетическая модель улучшила средний показатель Pass@1 на 7.2 процентных пункта, что составляет 35% относительного улучшения. В ITSM среде синтетическая модель повысила средний показатель Pass@1 с 18.77% до 27.18%.
Заключение
AutoSynthData использует ошибки модели для выбора того, что генерировать, проверяет новые задачи в среде и делает их доступными для последующего обучения. Результаты в EnterpriseOps Gym показывают ценность этого подхода в контролируемых условиях. По мере изменения модели тот же процесс может сосредоточиться на оставшихся пробелах.
Комментарии (0)