Как дети учат язык: уроки для языковых моделей


Люди общаются друг с другом как минимум последние 100,000 лет, и за это время только один вид мог освоить человеческий язык до совершенства — это человеческий ребенок. Теперь же к этому списку можно добавить и языковые модели, такие как ChatGPT, Claude и другие. Четыре года назад, с выходом ChatGPT, многие из нас уже привыкли к тому, что могут вести естественные беседы с телефонами или компьютерами. Однако за кулисами вычислительных процессов скрывается одна важная деталь: обучение компьютера использованию человеческого языка требует колоссального объема данных.

Разрыв в эффективности данных

Языковая модель может обрабатывать в сто тысяч раз больше слов, чем человек, который осваивает свой родной язык, и значительно больше, чем дети могут услышать к своему первому дню рождения, когда они обычно начинают осваивать язык. "Прогресс в этой области действительно впечатляющий," — говорит Майкл С. Франк, когнитивный ученый из Стэнфордского университета. "Но нам все еще нужно сжечь лес и собрать всю сумму человеческих знаний, чтобы воспроизвести этот этап, который происходит у нас дома за год." Этот разрыв между детьми и машинами называется разрывом в эффективности данных и ставит перед когнитивными учеными и архитекторами ИИ важный вопрос: как дети могут превосходить самые сложные языковые машины, когда дело доходит до освоения языка?

Данные и их объем

В последние десять лет языковые модели в основном улучшались за счет увеличения объема данных. Например, открытая языковая модель Meta Llama 3.1, выпущенная два года назад, обработала 15 триллионов токенов (словоподобных единиц языка) в процессе предобучения. По словам Этана Готлиба Уилкокса, когнитивного ученого и лингвиста из Университета Джорджтауна, фронтовые модели могут предобучаться на в десять раз большем объеме данных. Однако интернет не бесконечен, и, возможно, уже к 2030-м годам доступные данные могут иссякнуть. Дети показывают, что возможно учиться больше, используя гораздо меньше данных. Предположим, что ребенок, выросший в язычно богатом окружении, мог услышать около 100 миллионов слов. Если добавить грамотность, это число может увеличиться до 300 миллионов слов к 20 годам. Разница в масштабе колоссальна. "Claude видел объем языка, который всякий город испытывает за одно поколение," — говорит Уилкокс. Если бы напечатать все слова, использованные для обучения современной языковой модели, получилась бы стопка, достигающая Международной космической станции. В то время как 100 миллионов слов, услышанных ребенком, составили бы лишь 20 метров.

Изучение детского обучения

Исследуя, как дети учат язык, ученые надеются создать более эффективные модели ИИ, которые можно использовать для всего, от обучения ИИ на видео до создания чат-ботов для сообществ, говорящих на меньшинственных языках. Тестирование гипотез о человеческом обучении в машинных моделях может также помочь ответить на давние вопросы о языке и развивающихся умах детей. Являемся ли мы рожденными с языковым инстинктом, или возможно ли, даже в принципе, чтобы ребенок учил язык исключительно на основе опыта? Является ли способ, которым мы обрабатываем язык, особенностью нашей биологии, или, возможно, некоторые аспекты отражают универсальные ограничения на то, как языки могут использоваться и изучаться?

Сложности изучения языка

Многие из нас осознают, что язык труден, только когда пытаются выучить новый после детства. Прошедшее совершенное время, произнесенные "р" и носовые гласные — это лишь некоторые из инструментов лингвистических мучений для взрослого изучающего язык. Однако изучение родного языка обычно происходит без особых усилий. Младенцы начинают формировать грамматически правильные предложения после того, как услышат около 10 миллионов слов, а на верхнем уровне — 30 миллионов. "Это просто совершенно чудесно," — говорит Франк. "Если вы обучите GPT-2 на 30 миллионах слов, вы получите генератор бессмыслицы; вы не получите ребенка." Как именно младенцы справляются с этой задачей, остается загадкой. Исследователи знают много о том, что дети учат и как они используют язык на разных этапах развития, но остается много незнаний.

Теории о языке

Одно из самых устойчивых вопросов заключается в том, почему младенцы могут учить язык вообще. Синтаксис человеческого языка — это правила комбинирования слов в предложения, включая рекурсивные, вложенные структуры, которые позволяют нам выражать практически бесконечные идеи с помощью конечного словаря слов и частей слов. Это кажется чем-то, что должно быть проблемой для младенцев. Они лишь плавают в мелководье бездонного океана языка. Тем не менее, каким-то образом этого оказывается достаточно. Один из предложенных решений, выдвинутый лингвистом Ноймом Хомским в 1950-х, заключается в том, что младенцы рождаются с заранее заданными знаниями грамматики. Хомский реагировал на соперничающую точку зрения, поддерживаемую психологом Б.Ф. Скиннером, который считал, что овладение языком полностью зависит от окружающей среды. Скиннер полагал, что язык изучается через кондиционирование и подкрепление, как собака учится сидеть или подавать лапу за угощения. Хомский возразил, указав на "бедность стимула" — идею о том, что язык, особенно синтаксис, слишком сложен, а детское воздействие на него слишком "обеднено", чтобы они могли учить его исключительно на основе опыта.

Применение в ИИ

С точки зрения ИИ, подходы, основанные на правилах, были доминирующими в течение десятилетий, но они не смогли создать модели, способные обрабатывать человеческий язык в больших масштабах. Однако с возвращением нейронных сетей в 2010-х годах и их успехами в обучении на больших объемах данных, такими как BERT и GPT-2, стало ясно, что обучение на огромных объемах данных может работать для языка. С выходом ChatGPT в 2022 году это стало очевидным для всех. Языковые модели не являются мозгами. Они представляют собой мощные статистические обучающие машины, которые не обладают эволюционными биологическими особенностями, присущими человеческой коре. Тем не менее, они способны генерировать правдоподобные тексты и проходить грамматические тесты. Но возможно ли создать модель, которая учится на меньшем объеме данных, соответствующем детскому?

Конкурсы и исследования

Алекс Уорстадт, лингвист и дата-сайентист из Университета Калифорнии в Сан-Диего, помнит, как в 2019 году, когда вышли BERT и GPT-2, он был аспирантом и наблюдал, как его область меняется на глазах. Он увидел потенциал в языковых моделях и предложил идею BabyLM — ежегодного конкурса, организованного для обучения моделей на малых наборах данных. Конкурс ставит перед исследователями задачу обучить языковые модели на "развивающем правдоподобном" корпусе всего из 100 миллионов слов, извлеченных из детских книг, диалогов, субтитров фильмов и других источников. Модели оцениваются по тем же грамматическим критериям, которые используют психолингвисты с людьми. Конкурс уже бросил вызов некоторым предположениям, таким как эффективность обучения по курсу, когда сначала используются простые данные, а затем более сложные. Однако это не сработало так, как ожидалось. Лучшие модели BabyLM, такие как GPT-BERT, обученные на 100 миллионах слов, смогли превзойти производительность более крупных моделей, таких как Meta Llama 2 70B, что говорит о том, что можно достичь значительных результатов на меньшем объеме данных.

Будущее исследований

Тем не менее, модели BabyLM не могут соперничать с современными коммерческими моделями. Дети не являются дискретными компьютерными программами, и их восприятие мира происходит через органы чувств. Чтобы сократить разрыв в данных, некоторые исследователи считают, что машины должны начать учиться через глаза и уши детей. Исследования показывают, что дети активно исследуют мир и выбирают данные, которые им нужны, что может быть недостающим элементом в обучении моделей. В то время как языковые модели открывают новые горизонты, важно понимать, что они не могут полностью заменить человеческий опыт. Тем не менее, они могут служить полезными инструментами для изучения языка и когнитивного процесса, открывая новые возможности для понимания как машинного, так и человеческого обучения.

Комментарии (0)

Войдите, чтобы оставлять комментарии.
Пока нет комментариев. Будьте первым!