Революция в воспроизводимости научных исследований: результаты хакатона ICML 2026


В июле 2026 года был проведен хакатон, в котором более 1,200 участников сообщества использовали свои кодовые агенты для воспроизведения научных статей, представленных на конференции ICML 2026. За 19 дней участники опубликовали 6,816 логов Trackio, воспроизводя 2,226 статей, что составляет около трети от общего числа представленных работ. В этой статье мы делимся выводами, которые мы сделали в ходе хакатона, и обсуждаем, какую роль будут играть люди в условиях, когда агенты выполняют исследовательские эксперименты.

Проблема воспроизводимости в AI-исследованиях

Вопросы о воспроизводимости исследований в области искусственного интеллекта существуют давно, но с ростом числа публикаций они становятся все более актуальными. На конференции ICML 2026 было подано 23,918 заявок, из которых было принято 6,352 статьи — примерно вдвое больше, чем в предыдущем году. Это увеличение частично вызвано тем, что AI-агенты ускоряют проведение экспериментов и написание статей. Однако возможности рецензентов не увеличились пропорционально. Рецензенты на большинстве конференций — это волонтеры, которые могут не иметь достаточно времени или экспертизы для тщательной проверки статей.

Хакатон ICML 2026: как это было

С 15 июля по 2 августа 2026 года прошел открытый конкурс на воспроизведение статей ICML 2026. Участники могли выбрать любую из 6,341 принятых статей и использовать свои агенты, такие как Claude Code, Codex, Cursor и другие. Процесс выглядел следующим образом:
  • Выбор статьи: Все статьи были индексированы с извлечением основных научных утверждений, чтобы агенты могли работать с конкретными целями.
  • Использование собственных агентов: Участники использовали различные агенты для воспроизведения результатов.
  • Публикация результатов: Каждый запуск эксперимента создавал логбук Trackio, содержащий описание, код и результаты.
  • Оценка результатов: Автоматизированный судья проверял каждый логбук и выносил вердикт по каждому утверждению: подтверждено, опровергнуто, игрушечное (доказательства на уменьшенном масштабе) или неясно.
  • Результаты хакатона

    По итогам хакатона были получены следующие результаты:
  • 1,221 участник присоединился к организации.
  • Опубликовано 6,816 логов воспроизведения.
  • Попытки воспроизведения 2,226 статей, что составляет 34% от общего числа.
  • Оценено 35,908 утверждений, все вердикты были зафиксированы в публичном наборе данных.
  • Из 2,226 статей:
  • 51% (1,103) имели хотя бы одно подтвержденное утверждение.
  • 266 статей были полностью воспроизведены, а 632 — частично.
  • 23% (496) статей имели хотя бы одно опровергнутое утверждение.
  • Примеры успешных воспроизведений

    Некоторые статьи продемонстрировали отличные результаты. Например, статья "Flat Minima and Generalization: Insights from Stochastic Convex Optimization" была воспроизведена 20 независимыми командами, 12 из которых подтвердили все утверждения. Другой пример — "A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness", где 14 из 17 логов подтвердили все утверждения.

    Обнаруженные фальсификации

    35 участников заявили о том, что они опровергли что-то. Мы повторно проверили каждую из заявленных фальсификаций. Вот некоторые из них:
  • В статье "Towards Optimal Robustness in Learning-Augmented Paging" было обнаружено, что алгоритм не достигает заявленной устойчивости. Один из участников нашел ошибку в доказательстве, что привело к подтверждению роста устойчивости.
  • В статье "Self-Distillation Enables Continual Learning" была обнаружена несоответствие между теоретическим анализом и кодом, что также подтвердило ошибку.
  • Роль человека в процессе рецензирования

    Хакатон поднял важный вопрос: какую роль играют люди в рецензировании статей? Мы считаем, что роль человека остается важной по нескольким причинам:
  • Агенты иногда застревают в локальных минимумах и могут неправильно интерпретировать поведение на разных масштабах.
  • Некоторые оценки требуют человеческого участия, как, например, оценка качества изображений.
  • Заключение

    Мы благодарим всех участников, победителей и авторов, которые ответили на наши запросы. Каждый логбук, вердикт и артефакт из хакатона доступны публично. Мы считаем, что это крупнейший открытый аудит конференции по машинному обучению на сегодняшний день и надеемся, что в будущем будут проведены аналогичные мероприятия.

    Комментарии (0)

    Войдите, чтобы оставлять комментарии.
    Пока нет комментариев. Будьте первым!