
Исследование DELEGATE-52, проведенное Microsoft Research, стало важным шагом в понимании того, как большие языковые модели (LLMs) справляются с задачами редактирования документов в различных профессиональных областях. В рамках исследования было протестировано 19 LLMs на 52 профессиональных доменах, включая кодирование, кристаллографию, музыкальную нотацию, бухгалтерские записи и рецепты. Модели выполняли 20 взаимодействий редактирования, и результаты оказались весьма тревожными.
Основные результаты исследования
По данным исследования, даже самые продвинутые LLMs, такие как Gemini 3.1 Pro, Claude 4.6 Opus и GPT 5.4, к концу 20-го редактирования портили в среднем 25% содержания документа. В то время как средний уровень деградации среди всех протестированных моделей достигал 50%. Ошибки, которые допускали модели, были не многочисленными, но серьезными: это были редкие, но значимые изменения, которые выглядели грамматически правильно, что затрудняло их обнаружение при стандартной проверке.
Ошибки, которые стоит учитывать
Исследование выявило, что ошибки, которые LLMs вносили в документы, были "разрозненными, но серьезными". Это означает, что модели допускали небольшое количество высокоэффективных ошибок, таких как изменение цифр, пропуск фраз или незначительное изменение атрибуций. Эти ошибки могли быть не замечены при обычной проверке, так как они выглядели корректно на первый взгляд. Например, смещение статистики на одну цифру или изменение имени автора могли привести к серьезным последствиям в контексте документа.
Влияние агентного использования
Интересным аспектом исследования стало то, что использование LLMs в агентной среде с инструментами для работы с файлами привело к ухудшению производительности на 6% и увеличению потребления токенов в два-три раза. Это ставит под сомнение идею о том, что более сложные инструменты могут улучшить точность редактирования. Данные исследования показывают, что даже самые продвинутые модели не справляются с задачами редактирования документов на высоком уровне.
Риски для длинного контента
Ошибка, выявленная в DELEGATE-52, наиболее опасна для длинных и сложных документов, таких как юридические и комплаенс-документы, где даже небольшие изменения могут привести к серьезным последствиям. Например, пропущенная фраза в контракте или измененное определение в сводке условий может создать юридические риски. В таких случаях стандартная проверка может не выявить ошибок, так как они могут выглядеть как корректный текст.
Рекомендации по снижению рисков
Исходя из результатов исследования, можно выделить три ключевых изменения в подходе к использованию LLMs в процессе создания контента:
Используйте LLMs для точечных правок: Избегайте открытых запросов на редактирование. Лучше сосредоточиться на конкретных абзацах или утверждениях.
Увеличьте интенсивность человеческой проверки: Ошибки накапливаются с каждым взаимодействием, поэтому последующие раунды редактирования требуют более тщательной проверки.
Добавьте контроль качества для специфических типов ошибок: Стандартная проверка не всегда выявляет ошибки, которые могут быть внесены LLMs, такие как смещение цифр или изменения в атрибуциях.
Заключение
Исследование DELEGATE-52 подтверждает, что редактирование с помощью LLMs в длительных рабочих процессах может привести к ошибкам, которые стандартные процессы проверки не способны поймать. Это подчеркивает важность наличия человека с редакторским опытом на каждом этапе редактирования. LLMs могут быть полезными инструментами для создания и структурирования контента, но окончательное редактирование должно оставаться за человеком, чтобы избежать потенциальных рисков и ошибок.
Комментарии (0)