
В последние годы автоматическое распознавание речи (ASR) стало важным инструментом в различных областях, от голосовых помощников до систем автоматического перевода. Однако, несмотря на значительный прогресс, существующие системы ASR часто демонстрируют предвзятость, особенно в отношении различных этнических и социальных групп. Партнёрство между Voice Arena и Hugging Face нацелено на решение этой проблемы, запуская открытую оценку ASR для хинди и индийского английского.
Значение открытых бенчмарков
Бенчмарки играют ключевую роль в развитии технологий ASR. Модели, которые показывают высокие результаты на открытых лидербордах, чаще всего принимаются и дорабатываются. Однако, как показывает практика, многие аспекты, которые не измеряются на лидерборде, остаются без внимания. Например, недавние исследования показали, что ошибки ASR неравномерно распределены среди пользователей, что приводит к расовым и гендерным различиям в качестве распознавания.
Новые наборы данных для оценки
Чтобы устранить эти недостатки, Voice Arena и Hugging Face представляют два новых набора данных для открытого лидерборда ASR: Monsoon en-IN и Monsoon hi-IN. Хинди, на котором говорит более полумиллиарда людей, стал первым индийским языком в многоязычном табе, который ранее охватывал только европейские языки. Каждый набор данных включает публичную и закрытую выборки, что позволяет избежать оптимизации под конкретные бенчмарки.
Дизайн и сбор данных
Набор данных Monsoon был создан с учётом девяти различных параметров: география, возраст, пол, словарный запас, устройства, акустические условия, тип речи, скорость речи и наличие нескольких допустимых транскрипций для одного и того же аудио. Это позволяет выявить, как средняя ошибка распознавания слов (WER) может быть правильной в целом, но ошибочной для определённой группы.
Структура наборов данных
Наборы данных состоят из четырёх выборок:
Monsoon en-IN public: Индийский английский, 5.62 часа, 1,444 спикера.
Monsoon en-IN private: Индийский английский, 5.58 часа, 1,405 спикеров.
Monsoon hi-IN public: Хинди, 1.33 часа, 468 спикеров.
Monsoon hi-IN private: Хинди, 4.47 часа, 1,571 спикер.
Каждый набор данных включает информацию о 12 атрибутах спикеров, таких как пол, возраст, образование и т.д. Это позволяет глубже анализировать, как различные факторы влияют на качество распознавания.
Контроль качества и сбор данных
Сбор данных проводился через платформу Voice Arena, которая охватывает как городские, так и сельские районы. Участники записывали двухсторонние разговоры на заданные темы, используя свои устройства. Это обеспечивало разнообразие в акустических условиях и типах используемых устройств. Каждый участник проходил проверку на знание языка и давал согласие на использование записей.
Оценка и результаты
Для оценки моделей на закрытых выборках используется тот же процесс, что и для публичных наборов. Модели, которые показывают высокие результаты, добавляются в основной лидерборд ASR. Важно отметить, что результаты на публичных и закрытых выборках могут различаться, что позволяет более точно оценить качество распознавания.
Проблемы с орфографией
Одной из ключевых проблем, с которой сталкиваются системы ASR, является орфографическая вариативность. В то время как английский язык имеет более строгие правила написания, хинди отличается множеством допустимых написаний. Для решения этой проблемы в наборах данных хинди используется специальная структура, называемая "lattice", которая позволяет учитывать различные варианты написания.
Заключение
Партнёрство Voice Arena и Hugging Face в создании открытой оценки ASR для хинди и индийского английского представляет собой важный шаг к более инклюзивным и точным системам распознавания речи. Эти наборы данных не только помогают выявить предвзятости в существующих системах, но и открывают новые возможности для исследований и разработок в области ASR, обеспечивая более точные и разнообразные результаты.
Комментарии (0)