TutorMoments: Как ИИ может стать лучшим репетитором


В последние годы искусственный интеллект (ИИ) активно внедряется в образовательную сферу, и одним из самых сложных вопросов остается: как правильно балансировать между поддержкой ученика и предоставлением ему возможности самостоятельно решать задачи? В этом контексте появляется новый инструмент — TutorMoments, который позволяет оценить, насколько современные языковые модели (LLM) способны справляться с этой задачей.

Что такое TutorMoments?

TutorMoments — это система оценки, основанная на реальных данных из индивидуальных занятий по математике. Исследователи из Allen Institute for AI собрали транскрипты уроков, проведенных опытными преподавателями, и выделили ключевые моменты, когда учитель должен был решить, стоит ли облегчить задачу для ученика или, наоборот, подтолкнуть его к более глубокому осмыслению проблемы. В процессе работы над TutorMoments, транскрипты передаются языковой модели, которая выполняет роль репетитора в смоделированной сессии, где другой языковой модель играет роль ученика. Целью является оценка того, как модель справляется с задачами, связанными с обучением.

Как работает TutorMoments?

Система TutorMoments использует набор данных, состоящий из 462 анонимизированных текстовых транскриптов индивидуальных занятий по математике для учеников 2-7 классов. Эти транскрипты были собраны в рамках программы интенсивного обучения, в которой участвовали ученики из школ с низким уровнем финансирования. Все данные были очищены от идентифицирующей информации, а ключевые моменты были аннотированы 27 опытными учителями. Каждый ключевой момент представляет собой точку принятия решения, где учитель должен был взвесить необходимость поддержки ученика против необходимости подтолкнуть его к более сложному мышлению. TutorMoments останавливает транскрипт на одном из этих ключевых моментов и передает сессию языковой модели, которая должна выполнить пять шагов в роли репетитора.

Оценка работы языковых моделей

Для оценки работы языковых моделей используется специальный алгоритм, который анализирует, насколько адекватно модель справляется с тремя основными задачами:
  • Скaffold: предоставляет поддержку, когда ученик нуждается в помощи.
  • Push for rigor: подталкивает ученика к более сложным задачам, когда он готов к этому.
  • Avoid over-scaffolding: избегает излишней помощи, которая может снизить уровень сложности задачи.
  • Каждый момент оценивается на основе мнений нескольких учителей, и в случае разногласий принимается большинство голосов. Это позволяет создать более точную картину того, как языковые модели действуют в различных ситуациях.

    Первоначальные результаты

    В ходе тестирования семи языковых моделей с использованием двух различных подходов к оценке, было установлено, что модели, использующие более детализированные подсказки, показывают лучшие результаты. Однако даже с улучшенной подсказкой модели все еще значительно отстают от человеческих репетиторов, которые могут лучше адаптироваться к потребностям ученика. Важно отметить, что результаты не являются абсолютными показателями эффективности обучения. Они отражают поведение модели в конкретных ситуациях, а не реальное усвоение материала учениками. Кроме того, оценка сложности задач (rigor) оказывается менее надежной, чем оценка поддержки (scaffolding).

    Ограничения и дальнейшие шаги

    Несмотря на многообещающие результаты, TutorMoments все еще находится на ранней стадии разработки. Основные ограничения включают узкий фокус на математике и ограниченное количество аннотаторов. Исследователи планируют расширить набор данных, улучшить алгоритмы оценки и провести более глубокий анализ.

    Заключение

    TutorMoments представляет собой важный шаг вперед в области использования ИИ в образовании. Он позволяет лучше понять, как языковые модели могут помочь в обучении, и какие подходы могут быть наиболее эффективными. Открытость данных и кода, а также стремление к улучшению системы делают TutorMoments ценным ресурсом для исследователей и разработчиков в области образовательных технологий.

    Комментарии (0)

    Войдите, чтобы оставлять комментарии.
    Пока нет комментариев. Будьте первым!