В последние годы фильтры, внедряемые в коммерческие модели искусственного интеллекта, такие как ChatGPT и Claude, начали вызывать серьезные проблемы у специалистов по безопасности. Эти ограничения, направленные на предотвращение злоупотреблений, мешают исследователям, которые занимаются поиском уязвимостей и проверкой безопасности программного обеспечения. Ситуация осложняется тем, что один и тот же запрос может быть использован как для защиты, так и для нападения, что ставит разработчиков перед сложной задачей.
Проблема с фильтрами
Фильтры, установленные в современных ИИ-моделях, могут блокировать анализ уязвимостей даже в тех случаях, когда исследователь имеет разрешение от владельца продукта. Это создает значительные трудности в процессе подтверждения угрозы. Как отметил главный научный сотрудник NCC Group Крис Энли, без попытки использовать найденную ошибку трудно подтвердить её опасность. Уязвимость может оказаться недостижимой на практике или зависеть от редкой конфигурации, что делает наступательную проверку важной частью защиты.
Решения от Anthropic и OpenAI
Чтобы решить эту проблему, компании Anthropic и OpenAI разработали программы с проверкой пользователей. Anthropic предлагает Cyber Verification Program, а OpenAI — Trusted Access for Cyber. Эти программы позволяют одобренным специалистам получать доступ к моделям с меньшим числом автоматических отказов, хотя основные запреты на заведомо вредоносные действия сохраняются.
OpenAI определяет допустимые задачи, такие как:
Поиск и первичная оценка уязвимостей
Анализ вредоносного ПО
Обратная разработка программ
Создание средств обнаружения атак
Проверка исправлений
Для более рискованных операций, включая контролируемую разработку эксплойтов, предусмотрены дополнительные уровни допуска.
Непредсказуемость ответов
Тем не менее, представители отрасли отмечают, что даже после получения доступа модели могут вести себя непоследовательно. Один и тот же запрос в разные дни может привести к различным ответам: от подробного анализа до полного отказа. Это вынуждает специалистов подбирать формулировки и доказывать законность своих действий, вместо того чтобы сосредоточиться на анализе кода.
Переход на локальные модели
Некоторые команды, столкнувшись с отказами облачных сервисов, начали переходить на открытые модели, которые можно запускать локально. Эти системы обычно не имеют централизованной проверки личности и ограничений, установленных американскими ИИ-компаниями. Локальный запуск также решает проблему конфиденциальности, так как передача кода или отчета внешнему сервису может создать риск утечки чувствительных данных.
Технический директор Crowdfense Паоло Станьо отметил, что его коллеги используют облачные модели преимущественно для обратной разработки, а поиск ошибок и создание средств их эксплуатации выполняют с помощью локальных систем, чтобы материалы не покидали контролируемую инфраструктуру.
Альтернативные подходы
Некоторые исследователи не считают фильтры серьезным препятствием, так как используют ИИ только на подготовительных этапах. Модель может помочь объяснить незнакомый участок кода или написать вспомогательный инструмент, оставляя обнаружение уязвимости человеку. Однако ограничения становятся особенно заметными в организациях, которые не участвуют в программах проверенного доступа. В таких случаях модели могут прекращать работу, как только распознают задачу по информационной безопасности, что делает их почти бесполезными для полноценного поиска ошибок.
Парадокс безопасности
Руководитель компании RemoteThreat Крис Томпсон считает, что политика ограничений подталкивает законопослушных специалистов к использованию китайских открытых моделей, таких как GLM. Эти модели можно свободно загрузить и использовать без предварительного одобрения. Таким образом, американские компании, стремясь затруднить работу злоумышленникам, фактически способствуют тому, что преступники могут обратиться к открытым альтернативам.
Заключение
В результате защитники теряют время, сталкиваются с непредсказуемыми отказами и могут полностью менять используемую платформу. Anthropic и OpenAI объясняют необходимость блокировки вымогательского ПО и других явно вредоносных операций, однако исследователи предлагают расширить доступ для проверенных команд и четче описать допустимые операции. Важно найти баланс между безопасностью и доступом к инструментам, необходимым для проверки уязвимостей, чтобы не оставить защитников без необходимых ресурсов в условиях растущих угроз.
Комментарии (0)