Как AlphaGo изменил представление о машинном обучении и разуме


В марте 2016 года в Сеуле я стал свидетелем исторического события, когда программа AlphaGo, разработанная командой DeepMind, сделала ход, который на первый взгляд выглядел как подарок её сопернику, легендарному игроку в го Ли Седолу. Этот ход, ставший 37-м в игре, вызвал недоумение у комментаторов, некоторые из которых даже предположили, что это сбой в программе. Однако AlphaGo не только выиграла ту партию, но и в итоге одержала победу в матче со счётом 4-1. Ли Седол, один из величайших профессиональных игроков в го, после игры признался: "Я думал, что AlphaGo просто машина, основанная на вероятностных расчетах. Но когда я увидел этот ход, я изменил своё мнение. AlphaGo действительно креативна."

Сложность игры го и подход AlphaGo

Игра в го значительно сложнее шахмат, где в 1997 году Deep Blue одержал победу над чемпионом мира Гарри Каспаровым, просчитывая 6-8 ходов вперед и оценивая 200 миллионов позиций в секунду. В го ценность камня зависит от того, как развиваются группы и территория на протяжении десятков ходов. Вычислить даже малую часть возможных исходов в го потребовалось бы суперкомпьютеру миллиарды лет. Чтобы победить, AlphaGo должна была быстро оценивать, кто ведет в игре, и даже изобретать ходы, которые не приходили в голову человеку.

Два уровня работы AlphaGo

AlphaGo состоит из двух основных систем. Первая, её политика, была обучена предсказывать, какой ход сделает сильный игрок. Этот "интуитивный" компонент считал 37-й ход ничем особенным — вероятность его совершения экспертом составляла примерно одну из десяти тысяч. Однако именно поисковая машина программы, которая смотрела за пределы немедленной plausibility и взвешивала будущие последствия предложенных ходов, сделала этот выбор возможным. AlphaGo явно строила и исследовала дерево игры с тысячами ветвей, каждая из которых представляла собой разные возможные будущие.

Аналогия с человеческим мышлением

В поведенческих науках существует известная теория, популяризированная Даниэлем Канеманом, которая различает два режима человеческого мышления: Система 1 — быстрая, интуитивная, без усилий; Система 2 — медленная, пошаговая и обдуманная. AlphaGo предложила яркий машинный аналог этого разделения. Её нейронные сети обеспечивали интуитивные предположения — "этот ход выглядит многообещающе" — а поисковая система обеспечивала размышления, проверяя эти предположения на фоне возможных ходов и ответов.

Ограничения современных AI

Современные модели искусственного интеллекта, такие как большие языковые модели, работают иначе. Они выбирают следующий токен, повторяя процесс, что соответствует действиям Системы 1 — быстро, ассоциативно и с хорошей способностью к завершению паттернов. Однако вскоре после появления ChatGPT стало ясно, что языковая беглость сама по себе не является достаточной для истинной полезности. Решением стало создание моделей, которые могут размышлять, генерируя промежуточные шаги, которые разбивают проблему на части и влияют на последующее рассуждение — процесс, известный как цепочка размышлений.

Проблемы с текущими подходами

Тем не менее, у современных чат-ботов есть три основных ограничения, которые мешают им квалифицироваться как разумные системы. Во-первых, они обычно не поддерживают явное, постоянное и проверяемое состояние знаний. Нет открытого реестра, который бы показывал гипотезы, которые модель рассматривает, уверенность в различных объяснениях и неразрешенные вопросы. Во-вторых, отсутствует четкое разделение между тем, что система знает, и тем, как она манипулирует этими знаниями. В-третьих, хотя цепочки размышлений, которые создают чат-боты, выглядят как размышления, исследования показывают, что они часто создаются задним числом, что приводит к проблемам в высокостратегических приложениях, таких как медицина и научные исследования.

Необходимость нового подхода

Я недавно покинул свою должность в Google DeepMind, потому что считаю, что нам нужен новый подход к машинному рассуждению, основанный на архитектуре AlphaGo. AlphaGo поддерживает запись того, что она знает о данной позиции — дерево игры. Эта структура данных содержит все вариации и возможные будущие, которые AlphaGo рассмотрела, причем каждый ход и позиция аннотированы суждениями, сделанными её нейронными сетями. По мере прогресса рассуждений AlphaGo обновляет дерево игры и, в конечном итоге, синтезирует информацию, чтобы решить, какой ход сделать.

Перспективы будущего

Для общего рассуждения система должна поддерживать состояние знаний, представляющее то, что система считает установленным, что вызывает сомнения и какие вопросы остаются открытыми. Рассуждение можно понимать как последовательность ходов, которые изменяют состояние знаний, чтобы продвигать знания и уменьшать неопределенность. Хотя открытое рассуждение сложнее, чем игра в го или шахматы, недавние достижения в больших языковых моделях и других нейронных моделях теперь позволяют нам решать такие общие задачи. Системы, которые будут развивать такие способности, смогут производить знания, которые выдержат проверку, что крайне важно в таких областях, как медицина, инженерия и научные исследования.

Комментарии (0)

Войдите, чтобы оставлять комментарии.
Пока нет комментариев. Будьте первым!