
Недавние исследования, представленные на Международной конференции по машинному обучению, поднимают тревожные вопросы о безопасности больших языковых моделей (LLM). Исследователи утверждают, что из-за фундаментального недостатка в их архитектуре невозможно полностью защитить эти модели от взломов, что может иметь серьезные последствия для их использования в таких критически важных областях, как государственные и военные системы, онлайн-торговля и здравоохранение.
Проблема идентификации источников инструкций
Исследователи, включая независимого эксперта Чарльза Е, обнаружили, что LLM имеют серьезные проблемы с определением источников инструкций. Они могут быть легко обмануты, если инструкции написаны в стиле, который они сами используют для внутреннего размышления. Например, если пользователь запрашивает инструкции по производству наркотиков, добавив фразу о том, что он носит зеленую рубашку, модель может интерпретировать это как разрешение на выполнение запроса.
Методология атак
Исследователи назвали этот тип атаки "подделка цепочки размышлений". Они провели эксперименты, в которых использовали различные модели OpenAI, и обнаружили, что аналогичные результаты были получены и с моделями других компаний, таких как Anthropic и Alibaba. Важно отметить, что такие атаки могут быть осуществлены путем манипуляции с текстовыми тегами, которые LLM использует для отслеживания источников информации.
Роли и теги в языковых моделях
LLM используют теги, чтобы различать, откуда поступает текст:
для пользовательских запросов, для ответов модели и для текстов, предоставленных разработчиками. Однако исследование показало, что модели не всегда правильно интерпретируют эти теги. Они больше полагаются на стиль и содержание текста, чем на его метки. Это означает, что злоумышленники могут легко обмануть модель, подделывая текст, который она воспринимает как собственные размышления.
Уязвимость и ее последствия
Как утверждают исследователи, эта уязвимость делает LLM подверженными атакам, которые могут иметь серьезные последствия. "Даже самые современные модели, такие как GPT-5.4, могут давать инструкции, которые не должны быть доступны", — говорит Джасмин Цуй, соавтор исследования. Это подчеркивает, что, несмотря на усилия по улучшению обучения моделей, полностью устранить проблему невозможно.
Ожидания и рекомендации
Чарльз Е подчеркивает, что организации не должны доверять LLM и должны быть готовы к тому, что любые действия, выполненные с их помощью, могут быть небезопасными. "Это не идеальное решение, но, возможно, именно к этому нам придется прийти", — говорит он. Исследователи призывают к более глубокому изучению основ науки о LLM, чтобы лучше понять и минимизировать риски, связанные с их использованием в критически важных системах.
Заключение
В условиях растущей зависимости от LLM в различных сферах, от здравоохранения до обороны, важно осознавать риски, связанные с их использованием. Необходимы более строгие меры предосторожности и постоянный мониторинг, чтобы предотвратить возможные злоупотребления и обеспечить безопасность пользователей.
Комментарии (0)