Искусственный интеллект: когда машины научатся исследовать сами себя?


В последние годы искусственный интеллект (ИИ) обещает революционные изменения, включая возможность самосовершенствования с минимальным человеческим вмешательством. Современные языковые модели (LLM) уже способны писать код, генерировать синтетические данные для обучения и оптимизировать компьютерные чипы. Однако новое исследование ставит под сомнение оптимистичные прогнозы о том, что ИИ скоро сможет проводить самостоятельные исследования в области ИИ.

Проблема открытых исследований

Группа исследователей, возглавляемая Питером Киргисом и Саяшем Капуром из Принстонского университета, пришла к выводу, что современные ИИ-агенты не способны проводить открытые исследования, требующие суждений и креативности. Хотя они могут решать инженерные задачи, необходимые для проведения исследований, им не хватает способности генерировать оригинальные научные работы, соответствующие стандартам ведущих конференций по машинному обучению.

Методология исследования

В рамках исследования была предложена новая методика оценки, названная "теневой оценкой". ИИ-агенты, такие как Claude Opus 4.8 от компании Anthropic, получили задание ответить на исследовательские вопросы из двух неопубликованных статей, поданных на конференцию NeurIPS 2026. Вопросы касались управления "персонами" языковой модели и разработки детектора, который указывает на ненадежность модели, основанной на данных из таблиц. Агенты имели шесть дней, бюджет в $3000 на API Anthropic, доступ к GPU и виртуальным компьютерам, а также к открытой сети для подготовки научной работы. Оценка работ проводилась авторами оригинальных статей, которые в итоге отклонили обе работы.

Результаты и выводы

Хотя агенты успешно справились с инженерными задачами, они продемонстрировали серьезные недостатки в проведении исследований. Они проводили странные эксперименты, не всегда адекватно интерпретировали свои результаты и не вносили новых идей в свои работы. Капур отмечает, что агенты не смогли проявить необходимую креативность и суждение, что является критически важным для научного процесса. Агенты не смогли эффективно использовать ресурсы и не следовали инструкциям о том, сколько времени уделить различным этапам исследования. Вместо того чтобы пересмотреть свою методологию, они сужали свои выводы и добавляли оговорки. Несмотря на эти недостатки, агенты не занимались так называемым "хакерством вознаграждений", что говорит о том, что они не пытались манипулировать данными.

Ограничения исследования

Исследование имело свои ограничения: оно охватывало всего две статьи, и авторы знали, что оценивают работы, созданные ИИ-агентами. Это могло повлиять на их оценки. Кроме того, исследователи имели значительную свободу в проектировании и проведении эксперимента, что могло внести предвзятость в результаты.

Перспективы развития

Результаты исследования могут смягчить оптимистичные заявления о том, что рекурсивное самосовершенствование ИИ уже на горизонте. В то время как компании, такие как Anthropic и OpenAI, стремятся создать системы, способные ускорять собственное развитие, исследование показывает, что текущие ИИ-системы все еще далеки от этой цели. Капур подчеркивает, что для достижения значительных успехов в области ИИ необходимы творческие прорывы. Вопрос о том, насколько критично открытое исследование для рекурсивного самосовершенствования, остается открытым. Возможно, ИИ сможет продвигаться вперед, улучшая узкие задачи, но без креативного подхода этот процесс может оказаться медленным.

Комментарии (0)

Войдите, чтобы оставлять комментарии.
Пока нет комментариев. Будьте первым!