
В последние годы искусственный интеллект (ИИ) активно внедряется в образовательную сферу, и одним из самых сложных вопросов остается: как правильно балансировать между поддержкой ученика и предоставлением ему возможности самостоятельно решать задачи? В этом контексте появляется новый инструмент — TutorMoments, который позволяет оценить, насколько современные языковые модели (LLM) способны справляться с этой задачей.
Что такое TutorMoments?
TutorMoments — это система оценки, основанная на реальных данных из индивидуальных занятий по математике. Исследователи из Allen Institute for AI собрали транскрипты уроков, проведенных опытными преподавателями, и выделили ключевые моменты, когда учитель должен был решить, стоит ли облегчить задачу для ученика или, наоборот, подтолкнуть его к более глубокому осмыслению проблемы.
В процессе работы над TutorMoments, транскрипты передаются языковой модели, которая выполняет роль репетитора в смоделированной сессии, где другой языковой модель играет роль ученика. Целью является оценка того, как модель справляется с задачами, связанными с обучением.
Как работает TutorMoments?
Система TutorMoments использует набор данных, состоящий из 462 анонимизированных текстовых транскриптов индивидуальных занятий по математике для учеников 2-7 классов. Эти транскрипты были собраны в рамках программы интенсивного обучения, в которой участвовали ученики из школ с низким уровнем финансирования. Все данные были очищены от идентифицирующей информации, а ключевые моменты были аннотированы 27 опытными учителями.
Каждый ключевой момент представляет собой точку принятия решения, где учитель должен был взвесить необходимость поддержки ученика против необходимости подтолкнуть его к более сложному мышлению. TutorMoments останавливает транскрипт на одном из этих ключевых моментов и передает сессию языковой модели, которая должна выполнить пять шагов в роли репетитора.
Оценка работы языковых моделей
Для оценки работы языковых моделей используется специальный алгоритм, который анализирует, насколько адекватно модель справляется с тремя основными задачами:
Скaffold: предоставляет поддержку, когда ученик нуждается в помощи.
Push for rigor: подталкивает ученика к более сложным задачам, когда он готов к этому.
Avoid over-scaffolding: избегает излишней помощи, которая может снизить уровень сложности задачи.
Каждый момент оценивается на основе мнений нескольких учителей, и в случае разногласий принимается большинство голосов. Это позволяет создать более точную картину того, как языковые модели действуют в различных ситуациях.
Первоначальные результаты
В ходе тестирования семи языковых моделей с использованием двух различных подходов к оценке, было установлено, что модели, использующие более детализированные подсказки, показывают лучшие результаты. Однако даже с улучшенной подсказкой модели все еще значительно отстают от человеческих репетиторов, которые могут лучше адаптироваться к потребностям ученика.
Важно отметить, что результаты не являются абсолютными показателями эффективности обучения. Они отражают поведение модели в конкретных ситуациях, а не реальное усвоение материала учениками. Кроме того, оценка сложности задач (rigor) оказывается менее надежной, чем оценка поддержки (scaffolding).
Ограничения и дальнейшие шаги
Несмотря на многообещающие результаты, TutorMoments все еще находится на ранней стадии разработки. Основные ограничения включают узкий фокус на математике и ограниченное количество аннотаторов. Исследователи планируют расширить набор данных, улучшить алгоритмы оценки и провести более глубокий анализ.
Заключение
TutorMoments представляет собой важный шаг вперед в области использования ИИ в образовании. Он позволяет лучше понять, как языковые модели могут помочь в обучении, и какие подходы могут быть наиболее эффективными. Открытость данных и кода, а также стремление к улучшению системы делают TutorMoments ценным ресурсом для исследователей и разработчиков в области образовательных технологий.
Комментарии (0)