Новая эра оценки ИИ: сотрудничество EvalEval и UK AI Security Institute


Союз EvalEval с радостью сообщает о том, что UK AI Security Institute (AISI) начинает использовать инфраструктуру EvalEval для открытого обмена результатами оценок, что поддерживает более воспроизводимую и проверяемую оценочную науку. Это сотрудничество началось на совместном семинаре, проведенном в рамках NeurIPS 2025, и отзывы от AISI помогли сформировать схему Every Eval Ever (EEE). Новый этап сотрудничества реализует эту общую инфраструктуру на практике.

Значение воспроизводимости в оценке

С ускорением внедрения ИИ, оценки становятся все более важными источниками доказательств о производительности моделей и систем. Однако результаты часто публикуются в различных форматах и на разных платформах, зачастую без достаточной информации для их воспроизведения. Повторное проведение оценок может быть экономически нецелесообразным. Миссия EvalEval заключается в улучшении этой экосистемы через общую схему отчетности Every Eval Ever и открытую платформу Evaluation Cards, которая объединяет результаты оценок и необходимую информацию для их интерпретации в единую структуру.

Инфраструктура для улучшения оценки

Сотрудничество AISI и EvalEval направлено на диагностику пробелов в отчетности об оценках и создание общей инфраструктуры для их устранения. AISI работает над тем, чтобы сделать оценку более эффективной через OptStop, более статистически строгой через HiBayES и более стандартизированной в таких областях, как анализ транскриптов и elicitation возможностей.

Что делится AISI

Прозрачность на уровне транскриптов важна не только для воспроизводимости, но и для анализа и диагностики. В новом этапе сотрудничества AISI делает общедоступными методы и результаты оценок через Evaluation Cards, где это уместно. Выпуск включает в себя проверенные результаты, контекст и информацию о конфигурации для пяти бенчмарков, использованных в основном эксперименте:
  • HealthBench
  • FrontierMath
  • Humanity's Last Exam
  • SWE-Bench
  • Terminal-Bench 2.0
  • Эти результаты охватывают шесть передовых моделей: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 и GPT-5.4. Также в выпуск включены результаты двух связанных кибер-оценок — Cyber CTFs и The Last Ones, которые используют частично пересекающийся набор моделей.

    Влияние вычислений на производительность

    Данные сопровождают статью AISI "Как вычисления на этапе вывода формируют оценку передовых LLM", которая исследует, как производительность по бенчмаркам зависит от вычислений на этапе вывода и протокола оценки. Производительность на Humanity's Last Exam изменяется в зависимости от протокола оценки и вычислений на этапе вывода. Каждая кривая показывает накопленную долю решенных задач в пределах определенного количества токенов, используя первое зафиксированное успешное решение для каждой задачи. Когда модели получали обратную связь о правильности от оракула после каждой попытки, они продолжали решать дополнительные задачи по мере увеличения использования токенов.

    Открытые результаты для исследователей

    Когда результаты открыто публикуются с информацией о настройках, исследователи и практики могут более внимательно изучать отдельные исследования и сравнивать результаты в более широкой экосистеме. В то время как другие отчеты могут не содержать этих деталей, такие выпуски, как AISI, предоставляют проверенные контрольные точки для интерпретации оценок в контексте, помогая исследователям понять, как выбор настроек может повлиять на заявленную производительность. С увеличением числа оценщиков, принимающих EEE, такие открытые сравнения могут поддерживать более широкие и надежные мета-исследования.

    Призыв к сотрудничеству

    Мы рады этому принятию и с нетерпением ждем дальнейшей стандартизации и обмена оценками с AISI и другими организациями по оценке ИИ.
  • Разработчики моделей: публикуйте проверенные результаты оценок.
  • Разработчики оценок: публикуйте бенчмарки и данные о запусках, используя схему Every Eval Ever.
  • Исследователи в области оценки, управления и политики: изучайте Evaluation Cards по бенчмарку или модели, или используйте их для анализа состояния отчетности об оценках в целом.
  • О Coalition EvalEval

    Союз EvalEval — это исследовательское сообщество, разрабатывающее научно обоснованные исследования и надежную инфраструктуру для экосистемы оценки. Его цель — улучшить оценочную науку, решить проблему отсутствия консенсуса по документированию применимости и полезности оценок, а также расширить охват влияния, которое имеет значение для научных исследований и анализа политики. Ключевые проекты коалиции включают Every Eval Ever, общую схему и репозиторий для результатов оценок, и Evaluation Cards, которые объединяют метаданные бенчмарков, данные о запусках оценок и метаданные моделей в интерпретируемые записи. Вместе они упрощают понимание того, когда, казалось бы, схожие оценки были получены в условиях, имеющих значительные различия.

    О UK AI Security Institute

    UK AI Security Institute — это исследовательская организация в рамках Министерства науки, инноваций и технологий Великобритании. Его миссия заключается в том, чтобы обеспечить правительства научным пониманием рисков, связанных с передовым ИИ. AISI проводит исследования и строит инфраструктуру для понимания возможностей и последствий передового ИИ, разработки и тестирования мер по их смягчению и информирования политики.

    Комментарии (0)

    Войдите, чтобы оставлять комментарии.
    Пока нет комментариев. Будьте первым!