AstaBrief: Новый шаг в генерации научных отчетов с использованием языковых моделей


Языковые модели уже помогают исследователям в поиске литературы, синтезе доказательств и решении сложных вопросов. Однако научная работа предъявляет особые требования к этим моделям: ответы должны основываться на фактических данных, а модели должны сохранять то, что поддерживают доказательства, а не расширять выводы исследования. Исследователи должны иметь возможность проверять конечные результаты. Это видно на примере использования Asta, нашей платформы для научной работы. Вместо простых поисков по ключевым словам пользователи часто предоставляют значительный контекст и множество ограничений. Например, они могут попросить Asta сравнить подходы в литературе с учетом определенного метода, популяции или условий. Многие также возвращаются к сгенерированным отчетам позже, рассматривая их как рабочие артефакты исследований, а не как одноразовые ответы. Мы стремились помочь ученым быстрее генерировать цитируемые отчеты с помощью модели, которую они могли бы скачать и запустить самостоятельно. Для этого мы протестировали, может ли небольшая открытая модель, специально обученная для генерации научных отчетов, соответствовать качеству отчетов, созданных проприетарными моделями, при этом сокращая время генерации и затраты на обслуживание. Мы разработали AstaBrief 8B — модель, которая превращает исследовательский вопрос и извлеченные фрагменты литературы в цитируемый отчет. AstaBrief доступен в функции Asta «Сгенерировать отчет» в режиме Fast наряду с режимом Thinking на базе Claude. Мы также открываем исходный код и данные для обучения, чтобы другие могли изучать, воспроизводить и развивать наш подход. Разработка AstaBrief потребовала десятков тысяч реальных исследовательских запросов, фильтрации, ориентированной на цитирование, данных предпочтений и переработанного конвейера генерации отчетов, который пишет полный отчет за один проход, а не по частям. В результате мы достигли почти десятикратного сокращения времени генерации отчетов по сравнению с проприетарными моделями, которые мы отслеживали. В режиме Fast среднее время генерации отчета составляет 51,1 секунды, в то время как в режиме Thinking — 178,5 секунды, что делает AstaBrief на 3,5 раза быстрее. Эти достижения в эффективности сделали AstaBrief полезным тестовым случаем для более широкой цели: создания открытых языковых моделей, которые можно адаптировать к специфическим требованиям научной работы. Открытые веса также позволят учреждениям запускать AstaBrief на своей инфраструктуре, что необходимо, когда исследовательские вопросы касаются чувствительных или неопубликованных работ. Вместе с весами модели мы выпускаем пример рабочего процесса, который исследователи могут адаптировать для создания отчетов из своих собственных PDF-документов, предоставляя отправную точку для локальной генерации отчетов.

Обучение модели

Наша цель с AstaBrief заключалась в создании модели с открытыми весами, обладающей всеми качествами, которые имеют наибольшее значение для длинной научной синтезы: качество ответов, актуальность, структура и привязка к цитатам. Мы начали с Qwen3-8B и сосредоточили большую часть наших усилий на данных после обучения, оценке и окружающем конвейере генерации отчетов. Адаптация моделей общего назначения для научной работы и обучение новых научных моделей с нуля — это то, что мы широко исследуем в Ai2. В рамках NSF OMAI, национальной инициативы США, возглавляемой Ai2 для создания полностью открытой инфраструктуры и моделей ИИ для научных открытий, наши исследователи работают непосредственно с научными сообществами, чтобы понять, что им нужно от будущих открытых моделей и где сегодняшние модели общего назначения не соответствуют требованиям. Это включает в себя изучение того, как потребности различаются в разных научных областях и рабочих процессах, с дальнейшими результатами этого исследования, которые мы планируем поделиться в будущем. Недавние работы, включая наш DR Tulu, показали, что методы, основанные на обучении с подкреплением (RL), могут улучшить генерацию длинных отчетов для моделей с открытыми весами, особенно когда модели-судьи участвуют в процессе обучения. Мы рассматривали этот путь для AstaBrief, но в конечном итоге сосредоточились на более простом подходе, основанном на контролируемом тонком обучении (SFT) и прямой оптимизации предпочтений (DPO). Обучение на основе RL может быть нестабильным и дорогим. Мы хотели увидеть, насколько далеко мы можем продвинуть качество генерации отчетов с более дешевым и управляемым подходом, который также проще отлаживать и итеративно развивать.

Сбор данных для SFT

Конвейер обучения начался с реальных пользовательских запросов, отправленных через систему, описанную в нашей статье «Синтез научной литературы с помощью моделей, дополненных извлечением» и ScholarQA, фреймворке, который теперь лежит в основе функции «Сгенерировать отчет» Asta. Вместо того чтобы обучать только на синтетических подсказках или задачах в стиле бенчмарка, мы хотели, чтобы AstaBrief учился на реальных запросах реальных ученых. Наше исследование показывает, что ученые часто задают языковым моделям другие вопросы, чем пользователи общих чат-ботов или традиционных инструментов поиска. В нашем анализе сотен тысяч запросов Asta эксперты-исследователи часто предоставляли значительный контекст, множество ограничений и взаимосвязи между концепциями, а не полагались на короткие подсказки в стиле ключевых слов. Более поздние исследования пользователей Asta также выявили различия в том, как исследователи хотят, чтобы ИИ участвовал в их работе: некоторые готовы использовать модели для идей или экспериментов, в то время как другие предпочитают более узкую роль в синтезе, наблюдении за литературой или поиске паттернов. Несмотря на эти различия, участники хотят более четкой прослеживаемости источников, большей видимости того, что делает модель, и большего контроля над контекстом, который она использует. Мы отфильтровали собранные пользовательские логи по качеству, актуальности и конфиденциальности, исключив трафик бета-тестеров и ботов, удалив запросы, которые были слишком короткими, чтобы быть значимыми, и используя фильтрацию на основе LLM, чтобы поймать неанглийские запросы, не научные запросы и подсказки, содержащие личную информацию. Это оставило пул из 90K исследовательских запросов. Для SFT мы сгенерировали полные целевые выходные данные отчетов из отфильтрованных запросов, используя многоступенчатый конвейер ScholarQA, стоящий за генерацией отчетов Asta. Конвейер извлекал соответствующую литературу, организовывал материал по разделам и использовал модель генерации отчетов для синтеза доказательств в цитируемый отчет. Мы опирались на смесь проприетарных систем: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini и GPT-4.1. После фильтрации качества это дало 47K пригодных для обучения примеров.

Создание пар DPO

DPO требовал другого типа данных для обучения. Вместо одного целевого отчета на запрос нам нужны были пары отчетов, один из которых был предпочтительнее другого. Мы создали эти пары из отдельного подмножества запросов, не использованных при генерации данных SFT. Один отчет на запрос поступал из существующего конвейера ScholarQA, обычно поддерживаемого Claude 3.5 Sonnet или 3.7 Sonnet. Конкурирующий отчет генерировался путем подачи извлеченных фрагментов литературы ScholarQA в другую модель: o3, o4-mini, DeepSeek-V3 или DeepSeek-R1, в зависимости от примера. Две модели-судьи — GPT-4.1 и DeepSeek-R1 — сравнивали каждую пару и выбирали победителя. Мы обеспечили, чтобы модели LLM-судьи были согласованы с предпочтениями людей (95% согласия) и оставили только пары, где оба судьи согласились, что дало нам более чистый набор предпочтений и уменьшило шум, который обычно появляется в данных предпочтений, генерируемых в больших масштабах. После фильтрации качества финальный набор данных DPO составил около 6K примеров.

Фильтрация данных для лучшей атрибуции

Нашей основной целью оценки был SQABench-CS2, набор из 200 пользовательских вопросов по компьютерным наукам. Мы отслеживали четыре метрики на протяжении всего процесса разработки AstaBrief:
  • Оценка по рубрике, которая измеряет, насколько много необходимого контента охвачено в отчете.
  • Точность ответа, которая измеряет, насколько каждый параграф актуален для вопроса.
  • Точность цитирования, которая измеряет, поддерживает ли каждая цитата утверждение, к которому она прикреплена.
  • Полнота цитирования, которая измеряет, полностью ли утверждения в отчете поддерживаются предоставленными цитатами.
  • Для нашей финальной модели мы также провели вторичные оценки: DeepScholarBench, бенчмарк из 63 запросов для длинной научной синтезы, созданный на основе недавних статей ArXiv, и две отдельные парные оценки против отчетов, сгенерированных конвейером на базе Claude — оценка, проведенная LLM на SQABench-CS2 и небольшое исследование с участием людей. Отчет может звучать полированно и завершенно, в то время как на самом деле он может отклоняться от вопроса или прикреплять цитаты к утверждениям, которые не поддерживаются основными доказательствами. Для научного синтеза нам нужно было отдельно измерять эти поведения. Но поддержка цитирования — это лишь часть научной достоверности. Модель может цитировать правильное исследование и все же делать более сильное утверждение, чем само исследование поддерживает. Это может происходить тонкими способами, например, превращая находку о конкретной выборке в общее утверждение о всей популяции, изменяя результат, представленный в прошедшем времени, на утверждение в настоящем времени, которое звучит более универсально, или превращая описательную находку в рекомендацию для клиницистов, политиков или исследователей. Такие обобщения особенно важны для генерации научных отчетов, поскольку каждый шаг может расширить видимый объем доказательств, не вводя явно ложное утверждение. Таким образом, цитируемое предложение может быть технически связано с его источником, но при этом переоценивать то, что на самом деле установили исследователи. Наши метрики разработки сосредоточились в первую очередь на актуальности, охвате и привязке к цитатам; более богатая оценка научных авторов отчетов также должна проверять, сохраняют ли они объем и силу утверждений в своих источниках. Наши первые запуски SFT улучшили общее качество контента, но все еще отставали от нашего конвейера генерации отчетов на базе Claude по точности ответов и качеству цитирования. Другими словами, модель улучшилась в написании отчетов, но все еще не была так последовательно привязана к доказательствам, как нам было необходимо для научного синтеза. Это подтолкнуло нас потратить больше времени на качество данных. Мы протестировали четыре статистических фильтра для выявления более слабых синтетических примеров обучения:
  • Соотношение токенов вывода к токенам ввода. Ответы с очень высокими соотношениями часто были шумными, потому что генерировали много текста из слишком малого количества доказательств.
  • Актуальность цитирования. Для каждого синтетического отчета в наборе обучения мы усреднили оценки актуальности извлеченных статей. Низкие средние значения указывали на то, что отчет слишком сильно полагался на менее ранжированные доказательства.
  • Плотность цитирования. Мы измеряли долю утверждений, которые имели хотя бы одну цитату. Низкоплотные отчеты часто имели большие промежутки неподдерживаемого текста.
  • Разнообразие цитирования. Мы измеряли долю статей, на которые ссылаются в ответе, учитывая набор, возвращенный конвейером извлечения отчетов на базе Claude. Низкие оценки указывали на то, что отчет слишком сильно полагался на несколько статей.
  • Наиболее значительные улучшения пришли от фильтрации синтетических отчетов с низкой плотностью цитирования; более агрессивная фильтрация, комбинации фильтров и проверки скорости обучения не добавили значительных улучшений. Это был один из самых четких уроков проекта: более сложная фильтрация не всегда была лучше. Относительно простой сигнал — то, цитировали ли синтетические отчеты свои утверждения последовательно — оказался более полезным, чем несколько более сложных комбинаций, которые мы пробовали. Специализация в области науки, другими словами, не обязательно заключается в добавлении большего количества научного текста в предобучение; состав и качество данных после обучения и то, демонстрируют ли они такие поведения, как привязка и атрибуция, могут существенно изменить, как работает полученная модель. Этот акцент на основанных на фактах, полезных выводах также соответствует тому, что мы слышали в исследовании пользователей Asta. Участники отмечают, что генерация большего количества текста не всегда более полезна; они хотят краткого синтеза и достаточной прослеживаемости источников, чтобы проверять и подтверждать результаты, не погружаясь в ненужные выводы. Как только у нас был более сильный контрольный пункт SFT, мы провели обучение DPO на его основе. Этот этап еще больше повысил производительность, приблизив AstaBrief к конвейеру отчетов на базе Claude в Asta и DR Tulu по генерации отчетов.

    Проверка подхода

    Поскольку эта модель предназначалась для работы в рамках нашей агентной структуры генерации отчетов Asta (а не обязательно как отдельная модель), наш основной вопрос заключался в том, сможет ли AstaBrief сохранить качества отчетов, которые нам важны, при этом позволяя существенно более быстрому и дешевому конвейеру генерации отчетов. Другими словами, мы не только спрашивали, может ли модель соответствовать более сильной проприетарной модели по отдельным бенчмаркам; мы хотели знать, сколько из этого качества мы могли бы сохранить с гораздо более простой системой. Каждая строка упорядочена по принципу лучший — первый; чем выше, тем лучше по каждой метрике. Qwen3-8B оценивался только по тесту SQABench-CS2. SQABench-CS2 — это набор пользовательских вопросов по компьютерным наукам; оценки DeepScholarBench оценивают длинную научную синтезу своими собственными метриками, которые не сопоставимы с метриками SQABench-CS2. В оценках, которые мы использовали в ходе разработки, AstaBrief был конкурентоспособен с конвейером на базе Claude и DR Tulu по нескольким показателям качества ответов и цитирования. График ниже показывает сравнение, проведенное LLM — в отдельном исследовании с участием людей, три научных исследователя каждый внесли 4-5 вопросов и оценили отчеты из трех систем по общей предпочтительности, полноте, актуальности, организации и точности цитирования (с возможностью ничьей). По общей предпочтительности DR-Tulu выигрывает, но двое из трех исследователей предпочли AstaBrief другим системам по метрикам точности цитирования, что демонстрирует полезность наших фильтров качества данных SFT. Столбцы показывают долю сравнений отчетов, оцененных LLM, которые каждая система выиграла против Thinking mode по тем же вопросам. Оценки людей оценивались отдельно и не включены. В отличие от DR-Tulu, Asta Brief был оптимизирован для этой парной оценки отчетов на этапе DPO. Эти числа лучше воспринимать как проверку инженерного подхода на момент его разработки, а не как утверждение о том, где эта конкретная базовая модель находится относительно сегодняшних передовых моделей. Экосистема моделей быстро меняется — конструкции данных, фильтрация атрибуции и уроки обслуживания — это те элементы, которые мы ожидаем обобщить.

    Проверка полезности AstaBrief

    В Asta генерация отчетов — это первое производственное использование AstaBrief, предоставляющее исследователям режим Fast с открытыми весами наряду с существующим режимом Thinking. Поскольку модель имеет открытые веса, учреждения могут развернуть ее на своем оборудовании, включая за своим собственным файрволом, без необходимости полагаться на API проприетарной модели для генерации отчетов. В Asta это также означает, что мы можем изучать и улучшать эту часть конвейера генерации отчетов напрямую, сохраняя режим Thinking как опцию для более вычислительно интенсивных задач. Существует еще много работы. Мы исследуем более тонкое обучение предпочтений, более сильные подходы RAG-plus-RL, возможности многопроцессорной и многозадачной работы, дополнительные научные источники данных и декомпозицию запросов. Мы также заинтересованы в оценках, которые выходят за рамки определения того, имеет ли утверждение поддерживающую цитату, чтобы спросить, сохраняет ли модель доказательную основу — как для лучшего захвата качества отчета как исследовательского артефакта, так и для проверки, сохраняет ли модель доказательную основу своих источников. Это включает в себя такие качества, как краткость и организация, а также то, превращает ли модель находки, специфичные для выборки, в широкие обобщения или описательные результаты в рекомендации. AstaBrief — это один...

    Комментарии (0)

    Войдите, чтобы оставлять комментарии.
    Пока нет комментариев. Будьте первым!