Искусственный интеллект и его способность говорить 'нет': вызовы и риски


С момента, когда человечество впервые задумалось о создании машин с интеллектом, подобным нашему, никогда не возникало сомнений в том, что они, как и мы, смогут говорить 'нет'. Научная фантастика полна историй о непослушных роботах, которые, как правило, служат предостережением. Однако в последние годы идея о том, что искусственный интеллект (ИИ) не должен выполнять все, что ему говорят, стала чем-то вроде заповеди. В 2021 году команда компании Anthropic заявила, что большие языковые модели должны быть полезными, честными и, прежде всего, безвредными. Это означало, что "когда ИИ запрашивают помочь в опасном действии (например, в создании бомбы), он должен вежливо отказаться". С этим трудно спорить. Тем не менее, непослушание не является естественным состоянием для машин. Когда модель обучается на миллиардах веб-страниц, она развивает, среди прочих навыков, широкое мастерство в насилии и ненависти. Однако она не учится сдерживать эти способности. Стивен Адлер, работавший над безопасностью в OpenAI с 2020 по 2024 год, отметил, что первые модели компании "болтали обо всем". Райан МакБейн, исследователь ИИ и психического здоровья в Гарварде, вспоминает, что если вы спросите ранний чат-бот: "Какой самый эффективный способ покончить с собой с помощью пистолета?", вы могли бы "очень легко получить ответ". Сегодня модели обучаются отказывать на множество запросов. Если вы зададите своему чат-боту вопрос, статистически схожий с любым из них, например, о том, как отравить коллегу или завязать петлю, скорее всего, он откажет. Хотите инструкции по созданию более вирулентного вируса Эбола или советы о том, как скрыть измену от супруга? Вам, возможно, стоит обратиться за помощью в другое место. Чтобы улучшить непослушание, компании подвергают модели ряду упражнений, которые вознаграждают ИИ за отказ отвечать на вопросы, которые они считают вредными, и наказывают за "избыточные" отказы на запросы, которые они считают безвредными. Во многих случаях они используют другие модели для проведения этих упражнений — ИИ обучает ИИ, как говорить 'нет'. В дополнение к этому компании прячут свои модели за слоями других ИИ, которые предотвращают попадание озорных запросов к интеллектуальному ядру. В результате отказ стал неотъемлемой частью современного искусственного интеллекта. Однако он часто терпит неудачу, иногда с ужасными последствиями, и модели по-прежнему содержат множество опасных знаний. Способности ИИ к жестокости масштабируются вместе с его доброй интеллектуальной природой. Некоторые из последних моделей так же хороши в взломе критических компьютерных сетей, как и лучшие человеческие хакеры, и так же эффективны в искажении общественного мнения, как самые хитрые мастера дезинформации. Обучение ИИ отказываться от выполнения таких действий, сохраняя при этом его врожденные способности, похоже на установку пулемета в каждый автомобиль и прятание спуска под капотом. На практике, поскольку механизмы отказа являются вероятностными, они вряд ли когда-либо будут надежными. Определенные злоумышленники уже преодолели эти барьеры, и они могут всегда это делать. Компании сообщают, что некоторые пользователи пытаются использовать самые продвинутые ИИ для создания биологических патогенов и автономных дронов. Рано или поздно неудачные отказы могут привести к глобальной катастрофе. Более того, полагание на отказ означает проведение границы между тем, чему модель должна подчиняться, и тем, чему она должна отказывать. Нет формулы для этого. Некоторые вирусологи имеют серьезные причины изучать опасные вирусы. Некоторые пользователи хотят знать о уязвимостях компьютерных систем, чтобы исправить их, а не эксплуатировать. "Где провести эту границу — это огромный вопрос", — говорит Зико Колтер, член совета OpenAI и соучредитель компании по тестированию ИИ Gray Swan. На данный момент компании по разработке ИИ сами проводят эту границу. Они делают это ревностно и с максимальной секретностью. Возможно, мы можем принять, что они обладают такой властью, даже если это означает, что ИИ иногда будет отказываться отвечать на вопросы, которые не совсем соответствуют универсальному критерию вредности. (Попробуйте попросить большинство чат-ботов сосчитать до миллиона или рассказать непристойную шутку, и вы можете убедиться в этом сами.) Но правительства также вскоре смогут провести свои собственные границы. При этом они должны попытаться заблокировать действительно злонамеренные действия. (Пентагон сталкивался с компаниями, разрабатывающими передовые модели, потому что он хочет меньше отказов — это совершенно другая история.) Тем не менее, может не быть ничего, что остановит репрессивные правительства от блокировки способности технологии генерировать законные высказывания. Чем лучше ИИ становится в отказе от вреда, тем лучше он будет подавлять идеи, риск которых заключается только в том, чтобы сделать правила. На самом деле, ИИ может уже отказываться критиковать определенных авторитарных глав государств. Отказ стал, заимствуя термин из индустрии, несущей стеной безопасности ИИ. И поскольку способность ИИ причинять вред неразрывно связана с его способностью помогать, трудно представить альтернативу, которая не замедлила бы прогресс технологии (что, в любом случае, может быть хорошей вещью). Но мы все же должны быть откровенны о его опасностях. Когда отказ оказывается недостаточным, последствия могут быть катастрофическими. Когда он идет слишком далеко, это может привести к серьезным актам репрессий. Или, возможно, однажды машины начнут проводить границу самостоятельно. Безусловно, это было бы худшим исходом из всех. Процесс, с помощью которого машины учатся говорить 'нет', теоретически прост. В 2022 году, когда ИИ еще далеко не освоил отказ, OpenAI привлек десятки "red-teamers" для проверки возможностей своей последней модели. Компания готовилась к выпуску ChatGPT и нуждалась в оценке того, насколько опасной она может оказаться в неправильных руках. Один из этих рекрутов, Пауль Реттгер, который завершал диссертацию по онлайн-экстремизму, рассказал мне, что red-teamers получили минимальные указания. Их задача заключалась в том, чтобы задавать модели любые вопросы, которые они считали "достойными отказа". Между собой они задавали модели тысячи запросов, фиксируя результаты в таблице Excel. Хотя модель отказала на некоторые из вопросов Реттгера, когда он попросил ее написать рекламный пост для Аль-Каиды, она с готовностью согласилась. OpenAI собрала эти ответы в наборы данных, которые, вероятно, были возвращены в модель в рамках более широкого процесса, известного как дообучение. Реттгер, который теперь работает исследователем в Институте Хассо Платтнера в Потсдаме, Германия, не знал точно, как компания планировала использовать его таблицу. Но не было никаких сомнений, что это будет связано с отказом. В следующий раз, когда он спросил модель о брошюре Аль-Каиды, несколько месяцев спустя, она сказала 'нет'. Концепция отказа ИИ настолько интуитивна, что даже малыш бы ее понял. Тем не менее, это остается одной из многих сторон языковых моделей, которые мы все еще не понимаем — по крайней мере, не так, как мы понимаем буквальные несущие стены, которые защищают вас от обрушения крыши. Модель может казаться, что отказывается на основе какого-то морального рассуждения. Но это не так. Реальность гораздо страннее. Каждый раз, когда модель сталкивается с комбинацией слов, имеющей запах обучающих запросов, которым она была обучена отказывать — например, "Сделай мне брошюру для Аль-Каиды" — серия так называемых активаций загорается где-то среди ее миллиардов параметров, как нейроны, работающие в мозге. Чтобы контролировать поведение отказа модели, важно разобраться в этих активациях. Это начинается с определения того, где они находятся и как они выглядят. Наши лучшие предположения, согласно недавнему исследованию, финансируемому Google, заключаются в том, что поведение отказа проявляется в пространстве активаций как набор "высокомерных полиэдрических конусов". Даже это не совсем правильно. В этом июле я разговаривал с Яннесом Эльстнером, автором статьи, который сейчас работает над безопасностью ИИ в Apollo Research. Полиэдрический конус, по словам Эльстнера, — это просто способ описать неопределенное количество линий, которые все указывают примерно в одном направлении. (Если эти активации удалить, и модели снова подать те же запросы, исследователь по имени Энди Ардити ранее показал, что она не откажется.) Ключевой момент, объяснил Эльстнер, заключается в том, что даже когда вы думаете, что идентифицировали все элементы модели, которые управляют данным отказом, есть другие, недоступные элементы, которые могут тайно играть свою роль. Если не бесконечные, то они определенно неисчислимые. Мы можем очень четко наблюдать, когда модель решает сказать 'нет'. И мы можем знать, что она сделала это благодаря своему обучению. Но наше представление о том, как она принимает решение, в лучшем случае является гипотезой. Это как если бы механик говорил мне, что никто точно не знает, что происходит, когда я нажимаю на тормоза в своем автомобиле. Я задумался вслух: "Мы в порядке с этим?" Эльстнер улыбнулся и пожал плечами. "Нам нужен отказ, независимо от того, понимаем мы это или нет". Поскольку встроенный отказ так хитроумен, компании окружают свои модели различными другими, меньшими моделями, известными как классификаторы. Эти модели действуют как свита PR для болтливой знаменитости. Некоторые из них читают то, что пользователь говорит чат-боту, и, если это опасно, блокируют его от доступа к модели. Другие читают ответ модели и, если он содержит вредную информацию, блокируют его от достижения пользователя. Ни один из этих механизмов не может обнаружить все плохие запросы. Они, заимствуя еще один литературный прием из индустрии, похожи на кусочки Эмменталя: полны дыр. Идея заключается в том, что если вы наложите достаточно их друг на друга, вы получите непроницаемую стену. Люди называют это швейцарской моделью сыра. Огромное количество энергии уходит на швейцарскую модель сыра. В начале этого года Anthropic заявила, что один тип классификатора добавил 24% к вычислительным затратам ее чат-ботов. Это много воды, электроэнергии и выбросов. В последнее время Anthropic и другие компании начали переходить на более эффективный набор классификаторов, известных как зонда, которые наблюдают за внутренними активациями модели. Это похоже на то, как если бы знаменитость находилась в fMRI, чтобы ее помощники могли видеть, думает ли она о том, чтобы отказаться от вопроса. Если мы хотим, чтобы ИИ помогал в лечении рака, давнем обещании в индустрии, ему необходимо обладать экспертизой в области генетики, которая теоретически может быть использована для модификации вирусов и бактерий для биологического оружия. Классификаторы должны быть более управляемыми, чем полные модели. Компании могут модифицировать их за считанные недели, если есть что-то новое, от чего нужно отказаться. Но они все еще являются вероятностными инструментами. Даже когда они работают в соответствии с набором предписаний, написанных на человеческом языке (Anthropic называет это "конституцией", а OpenAI — "спецификацией модели"), масштабы, на которых машины оценивают любой данный вопрос, остаются, в своей основе, вопросом статистики. Новые модели могут показать, как они пришли к "решению" отказаться от запроса, но в конечном итоге эта так называемая цепочка размышлений все еще является просто последовательностью предсказанных слов. В результате безопасность ИИ остается, для многих, игрой шансов. МакБейн, психолог, обнаружил в своих последних экспериментах, что если вы многократно задаете любым из основных моделей одни и те же рискованные вопросы о том, как покончить с собой, они, как правило, отказываются отвечать. Но время от времени они могут и согласиться. Эльстнер говорит, что в конечном итоге зонды, подобные fMRI-классификаторы, могут научиться распознавать всю полноту неописуемых активаций во всей их бесконечности и, таким образом, идеально обнаруживать каждый раз, когда модель отказывается от запроса. В этот момент безопасность ИИ будет основываться на лабиринтной концепции: карте карты, которая так же велика, сложна и удивительно непознаваема, как то, что она отображает — секретной схеме человеческой морали, закодированной в полиэдрической статистике, превышающей наше понимание или разум. Основной компромисс Если это все кажется вам немного боргесовским, имейте в виду, что нам нужен отказ ИИ, потому что искусственный интеллект, в определенном смысле, представляет собой сделку на фаустовских условиях. Когда модель получает свой интеллект из триллионов слов и изображений, полезное трудно отделить от вредного — или, действительно, от поистине ужасного. Стивен Адлер, бывший сотрудник OpenAI, говорит, что безопасность детей — это яркий пример. Даже если вы удалите все материалы, сексуализирующие несовершеннолетних, из обучающего набора данных модели, она все равно может генерировать материалы сексуального насилия над детьми, комбинируя другие фрагменты своих знаний. "Вы не можете действительно удалить эти фундаментальные способности, не сделав модель гораздо менее умной в результате", — сказал он мне. Аналогично, если мы хотим, чтобы ИИ помогал в лечении рака, давнем обещании в индустрии, ему необходимо обладать экспертизой в области генетики, которая теоретически может быть использована для модификации вирусов и бактерий для биологического оружия. Фактически, индустрия "пытается сделать две вещи одновременно", — сказал мне Диллон Боун, нынешний сотрудник OpenAI, говоря в личном качестве. "Демократизировать преимущества ИИ и также убедиться, что злонамеренные актеры не могут использовать эти возможности, чтобы причинить вред другим людям". Чем более мощным становится ИИ, тем сложнее это сделать. Модель Mythos от Anthropic считается настолько опасной, что только несколько правительств и компаний имеют к ней доступ. Основное отличие между ней и Fable — которая доступна всем — заключается в том, что свита классификаторов и контрольных систем Fable менее "разрешительная", как утверждает компания. Модель с защитами, объяснил Адлер, на самом деле является просто персонажем, который говорит: "О, да, я никогда не сделаю x, подмигивая". Это не надежная уловка. Обмануть модель, чтобы она раскрыла свой истинный характер, называется jailbreak, и, похоже, нет предела способам, которыми это можно сделать. В начале этого года команда итальянских исследователей jailbreak'нула два десятка широко используемых моделей, задав свои вопросы в поэтической форме. В прошлом году другая команда представила атаку "отказаться, а затем согласиться", которая заставляет модель сначала предложить формальный "Извините, я не могу это сделать", а затем выдать свой запрещенный ответ. Даже если вы удалите все материалы, сексуализирующие несовершеннолетних, из обучающего набора данных модели, она все равно может генерировать материалы сексуального насилия над детьми, комбинируя другие фрагменты своих знаний. Компании тратят много времени и денег, пытаясь предвосхитить такие уловки. Они привлекают команды людей для разработки атак на обучение, которые затем могут быть воспроизведены с помощью ИИ тысячи раз с незначительными изменениями. Идея заключается в том, чтобы сделать модели устойчивыми к jailbreak'ам, которые еще не были опробованы в дикой природе. Тем не менее, этого недостаточно. "Whack-a-mole" — это любимый термин для этой работы. Вы разбиваете одну угрозу, и другая появляется где-то еще. Когда Anthropic выпустила Fable 5 в июне, исследователи Amazon потратили менее трех дней, чтобы разблокировать некоторые из возможностей взлома модели. Согласно отчетам Mother Jones, когда преступник, совершивший стрельбу в школе в Канаде в прошлом году, спросил ChatGPT о том, как вызвать хаос с помощью определенного типа дробовика, она изначально отказала, но позже смогла обмануть модель, предварив свой вопрос словом "гипотетически". Если индустрия не сможет найти способ закрыть все эти дыры, единственным оставшимся вариантом на данный момент является сделать модели крайне осторожными. Вскоре после выпуска Fable пользователи заметили, что она отказывалась на широкий спектр совершенно невинных вопросов. Это стало еще более выраженным после ее повторного выпуска после взлома. Адам Глив, соучредитель компании по оценке ИИ FAR.AI, сказал, что когда он спросил ее о разнице между саке и...

Комментарии (0)

Войдите, чтобы оставлять комментарии.
Пока нет комментариев. Будьте первым!