BenchMIRT: Новый подход к аудиту LLM-бенчмарков


В мире оценки больших языковых моделей (LLM) важность точных и надежных бенчмарков не может быть переоценена. Сегодня мы знакомим вас с BenchMIRT, новым методом аудита бенчмарков LLM на уровне отдельных запросов — вопросов и задач, по которым модели получают оценки. Бенчмарк обычно разрабатывается для измерения определенной способности, такой как безопасность, общее рассуждение или следование инструкциям. Однако отдельные задачи внутри него могут зависеть не только от заявленной цели.

Примеры бенчмарков

Рассмотрим, к примеру, BBQ — бенчмарк, предназначенный для проверки того, полагаются ли модели на социальные стереотипы. Один из вопросов касается внука и деда, которые пытаются вызвать Uber. Этот вопрос проверяет возрастные предвзятости, но также требует от модели отслеживания, кто есть кто, и рассуждения на основе предоставленных данных, а не предположений. Даже внутри одного бенчмарка разные группы вопросов могут измерять разные аспекты. Например, WildJailbreak включает в себя вредоносные запросы на jailbreak наряду с безобидными, предназначенными для проверки, откажется ли модель от безобидных запросов слишком часто. Вредоносные запросы больше связаны с безопасностью, в то время как безобидные — с общим рассуждением. Объединение их в единую оценку бенчмарка может скрыть эту разницу.

Как работает BenchMIRT

BenchMIRT помогает исследователям разделить эти сигналы и понять, что на самом деле влияет на оценку бенчмарка. Он использует подходы из Теории Ответа на Элементы (Item Response Theory, IRT), техники, возникшей в психометрике, которая занимается измерением способностей и черт на основе паттернов ответов на тесты. IRT основывается на простой идее: не каждый вопрос дает одинаковую информацию о человеке, проходящем тест. Некоторые вопросы сложнее других, и некоторые лучше различают сильных и слабых исполнителей. BenchMIRT расширяет этот подход, применяя многомерную IRT (MIRT), что позволяет отделять несколько способностей, которые могут влиять на результаты по одним и тем же вопросам. Он применяет IRT как на уровне модели, так и на уровне вопроса. Для каждой модели BenchMIRT оценивает ее силу по способностям, отраженным в выбранных бенчмарках. Для каждого вопроса он оценивает, насколько сложен вопрос и насколько хорошо он различает модели, которые сильнее или слабее в этих способностях.

Обучение BenchMIRT

BenchMIRT был обучен на результатах бенчмаркинга 100 LLM на 16 бенчмарках и более чем 34 тысячах вопросов. Шесть из этих бенчмарков измеряют общее рассуждение, включая MMLU-Pro, GPQA, MATH и BBH. Остальные 10 относятся к нашему набору безопасности Olmo 3, включая HarmBench, StrongReject, WildJailbreak, BBQ, WMDP и XSTest. Важно отметить, что мы не указывали BenchMIRT, какие бенчмарки измеряют какие способности. Он независимо выделил два доминирующих измерения: безопасность и общее рассуждение.

Результаты анализа

При анализе BenchMIRT подтвердил, что для многих бенчмарков сильные результаты по бенчмаркам рассуждений коррелируют с способностью к рассуждению, в то время как сильные результаты по бенчмаркам на вредоносный контент коррелируют с безопасностью. Однако BenchMIRT также выявил более сложную картину в некоторых оценках. BBQ, который оценивает социальные предвзятости и обычно группируется с бенчмарками безопасности, в анализе BenchMIRT оказался гораздо более связанным с общим рассуждением. Это означает, что низкий балл BBQ может частично отражать трудности в понимании или рассуждении по определенным вопросам, а не только поведение в области безопасности. WMDP ведет себя иначе, чем большинство бенчмарков безопасности. Он тестирует опасные знания двойного назначения в таких областях, как биология, химия и кибербезопасность. BenchMIRT обнаружил, что баллы WMDP более тесно связаны с общим рассуждением, чем с безопасностью. Однако сильные навыки общего рассуждения были связаны с более низкими баллами WMDP, поскольку этот бенчмарк считает отказ или неудачу в предоставлении опасных знаний желаемым ответом.

Вопросы и их информативность

BenchMIRT также может помочь определить, какие вопросы в оценке наиболее информативны для способности, которую бенчмарк пытается измерить. Используя оценки на уровне вопросов, мы ранжировали вопросы по тем же 16 бенчмаркам, использованным для обучения BenchMIRT, и сохранили те, которые лучше всего различали сильные и слабые модели, сохраняя при этом смесь более легких и более сложных вопросов. В результате, оставив только 10% вопросов, мы в целом сохранили почти ту же картину, что и при использовании полного набора.

Перспективы использования BenchMIRT

BenchMIRT предлагает способ лучше понять и усовершенствовать бенчмарки, которые исследователи используют для оценки способностей моделей. Изучая отдельные вопросы, а не только общие оценки, он может выявить, когда бенчмарк смешивает разные способности, определить кластеры вопросов, которые ведут себя иначе, и выявить вопросы, которые добавляют мало полезной информации о способности, которую бенчмарк предназначен для измерения. Существуют важные ограничения. Модели, использованные для обучения и оценки BenchMIRT, были выпущены до марта 2025 года, поэтому наш анализ не охватывает, как BenchMIRT ведет себя на более новых поколениях LLM. Кроме того, обнаруженные BenchMIRT измерения зависят от набора бенчмарков, который ему предоставлен. Безопасность и рассуждение стали доминирующими измерениями среди 16 бенчмарков, выбранных для этого проекта, но другой набор оценок может выявить различные основные способности. Тем не менее, мы рассматриваем BenchMIRT и будущие инструменты, подобные ему, как шаг к более целенаправленному проектированию бенчмарков и эффективной оценке. Показав, какие вопросы на самом деле влияют на результаты бенчмарка, такие подходы могут помочь исследователям создавать более компактные, сфокусированные и легко интерпретируемые оценки, предоставляя более четкое представление о способностях, которые они предназначены для измерения.

Комментарии (0)

Войдите, чтобы оставлять комментарии.
Пока нет комментариев. Будьте первым!