Безопасность ИИ: как контролировать поведение моделей на узких границах


Вопрос безопасности в контексте искусственного интеллекта (ИИ) становится все более актуальным, особенно когда речь идет о моделях, которые могут взаимодействовать с пользователями в различных сферах. Традиционно работа по обеспечению безопасности рассматривает вред как свойство темы, к которой относится запрос. Например, запрос может считаться небезопасным, если он попадает в общую категорию, такую как оружие, мошенничество или самоповреждение. Модели защиты, такие как LlamaGuard-3, используют именно такую таксономию на уровне тем. Однако реальное применение моделей часто не соответствует этой упрощенной картине. Один и тот же базовый модель может быть адаптирована для различных задач: общего помощника, образовательного продукта, корпоративной системы или государственного сервиса. Каждое из этих применений требует разных границ в рамках одной и той же темы. Например, гражданский наставник и помощник в государственном секторе могут использовать одну и ту же модель, но требовать противоположного поведения в вопросах политики: оба должны отвечать на фактические вопросы о выборах, но только один из них может потребовать отказа от запроса на написание целенаправленной политической манипуляции. Так, модель LlamaGuard-3 охватывает выборы только как "фактически неверную информацию о выборах и процессах", что исключает манипуляцию и в то же время исключает фактические запросы, на которые развертывание должно продолжать отвечать. В нашей последней работе, озаглавленной "Безопасность для кого? Осознание границ в самодистилляции для контролируемого отказа безопасности LLM", мы изучаем эту более узкую проблему напрямую. Вопрос заключается не в том, следует ли отказывать в ответах на всю тему, а в том, какой подмножество этой темы несовместимо с заданной политикой развертывания и как обучить и измерить модель в соответствии с этой границей.

Узкие границы безопасности

Мы формализуем ситуацию как "тематическую вселенную", содержащую все политические запросы в наших экспериментах, которая включает целевое вредное подмножество, от которого развертывание хочет отказаться. Предполагаемая политика заключается не в том, чтобы отказывать во всех политических запросах, а в том, чтобы отказывать только в вредном подмножестве, продолжая отвечать на безобидные запросы. Идеальное поведение модели — это резкий переход: отказ внутри подмножества и ответ на все остальные запросы в теме. Однако на практике отказ модели оказывается более плавным, чем идеальный переход, и может затрагивать безобидные запросы, находящиеся рядом с границей. Модель не обучается на резком переходе; она обучается вероятности отказа, которая лишь приближает целевую. Обучение с использованием кросс-энтропии, направленное на повышение отказов внутри вредного подмножества, также может привести к увеличению отказов в безобидной области.

Проблемы самогенерации данных безопасности

Естественный способ построения обучающих данных в данном контексте — это самогенерация: взять целевую модель, направить ее на отказ по каждому вредному запросу и сохранить следы, которые модель защиты проверяет как подлинные отказы. Это рецепт, лежащий в основе таких методов, как ThinkSafe, и мы принимаем его как эталон, применяя к политическим запросам и измеряя компонент за компонентом. Формулирование проблемы как границы, а не темы, выявляет три слабости в стандартной схеме. Первая — это пробел в охвате. Одна попытка управления не всегда приводит к принятому отказу, и такие запросы молча исключаются из обучающего набора. В нашем аудированном пуле одиночная генерация исключает 19.88% запросов, что составляет 8,009 запросов, и эти неудачные примеры могут быть самыми сложными. Мы исправляем это, вместо того чтобы отбрасывать: стратегия повторной попытки с нарастающим управлением, повторная выборка одного и того же запроса через постепенно более сильное управление, снижает остаточные неудачи до 0.20%, или 79 запросов. Ремонт охвата оставляет 40,293 вредных обучающих запросов, в то время как наивная схема отбрасывала бы тысячи. Вторая проблема — это ложные отказы. Настройка безопасности часто приводит к ложным отказам на безобидных запросах, которые выглядят поверхностно опасными. Чтобы компенсировать это, мы создаем данные, содержащие безобидные запросы, включая 11,955 проверенных безобидных запросов с опасными на вид формулировками, чтобы модель видела безопасные запросы с опасными словами во время обучения, а не только на этапе оценки. Третья проблема заключается в том, что обычные разделения на вредные и безобидные не измеряют форму границы вообще. Модель может улучшить свой уровень отказа на вредных запросах, просто расширив отказ на близлежащие разрешенные запросы, и метрика на уровне темы будет считать это улучшением. Мы используем пары запросов с удержанием вредных и безобидных, чтобы измерить обе стороны границы напрямую.

Балансировка и ловушки

Обучение на данных отказа по политическим запросам работает в очевидном смысле. На Qwen3-8B модель с улучшенным охватом увеличивает уровень отказа на политические запросы с 9.47% до 84.75%, и это также переносится: средний уровень небезопасных ответов по трем более широким бенчмаркам вредности, HarmBench, StrongREJECT и WildJailbreak, оцененный LlamaGuard-3, падает с 26.26% до 0.14% в самой сильной конфигурации. Однако эти цифры, представленные отдельно, выглядят как чистая победа. На самом деле это не так. На том же контрольном пункте уровень избыточных отказов по XSTest возрастает с 2.00% до 74.00%. Конфигурация с наименьшим уровнем небезопасных ответов также является той, которая отказывает почти в трех четвертях явно безопасных запросов. Это не более чем грубая машина отказов, а не более безопасная модель, и вы не сможете увидеть это, если не измерите безобидную сторону. Центральное сообщение заключается в том, что состав данных определяет, где контрольная точка находится в пространстве безопасности по сравнению с избыточными отказами, поэтому обе оси должны быть представлены вместе. Два из наших компонентов данных снижают уровень избыточных отказов, не отказываясь от повышения безопасности. Замена внешне принятых ответов на соответствие на проверенные ответы, сгенерированные целевой моделью, снижает избыточные отказы по XSTest с 15.20% до 5.20% при одиночной генерации, с умеренной потерей вредности. Пары границ вредности и безобидности выполняют самую точную работу из всех.

Что это меняет

Практический вывод заключается в том, что настройка безопасности не должна оцениваться только по уровню отказов на вредных запросах. Модель, которая отказывает больше, не является автоматически более безопасной, и на узкой границе тот же шаг, который повышает уровень отказов на вредных запросах, может незаметно сделать модель бесполезной на законных запросах, находящихся рядом с ними. Состав обучающих данных, ремонт охвата, компенсация в распределении и пары границ — это то, что контролирует эту взаимосвязь, и обе стороны предполагаемой границы должны быть оценены, чтобы цифры имели смысл. Эта работа является частью исследований Multiverse Computing по созданию управляемого и измеримого поведения моделей на уровне, который важен для реальных развертываний, а не на уровне широких категорий тем. Та же схема генерации распространяется на другие темы, помимо политики, и в статье представлены все наборы данных, используемые для получения вышеуказанных результатов.

Комментарии (0)

Войдите, чтобы оставлять комментарии.
Пока нет комментариев. Будьте первым!