
Современные бенчмарки для оценки систем распознавания речи (ASR) все чаще показывают, что модели достигают уровня, сопоставимого с человеческим. Однако такие оценки не всегда отражают реальную работу моделей в условиях практического использования. Поскольку публичные бенчмарки открыты и широко используются, модели могут оптимизироваться под конкретные тесты. Это приводит к тому, что их результаты могут улучшаться не благодаря реальному прогрессу в распознавании речи, а из-за обучения специфическим паттернам, связанным с бенчмарком.
Проблемы традиционных бенчмарков
Одной из причин этого явления является то, что традиционные бенчмарки не учитывают многие условия и качества, которые делают голосовые системы надежными, естественными и эффективными в реальной практике. В ответ на это были введены новые наборы данных в рамках Real World VoiceEQ, Open-ASR Leaderboard и Far-field ASR Leaderboard, чтобы оценить более значимые аспекты работы моделей в реальных условиях. Однако, даже более широкие измерения не решают проблему полностью. Это явление, иногда называемое оптимизацией бенчмарков или "benchmaxxing", обсуждается в контексте машинного обучения, но его сложно измерить в области распознавания речи.
Новые тесты для оценки моделей
Наше последнее исследование вводит три теста, которые помогают количественно оценить это явление. Мы протестировали 11 широко используемых открытых моделей ASR и обнаружили, что несколько из них, показывающих высокие результаты, воспроизводили транскрипции бенчмарков из наборов данных VoxPopuli English и LibriSpeech, даже когда аудио противоречило этим транскрипциям, важные слова были заглушены или аудио поддерживало две разные письменные формы. В некоторых случаях модели, похоже, полагались не только на произнесенные слова, но и на тонкие акустические подсказки, указывающие на то, какой бенчмарк они проходят.
Исследование несоответствий ссылок
VoxPopuli известен высоким числом ошибок транскрипции, что стало причиной выпуска очищенной версии Artificial Analysis. Наш тест на несогласие с консенсусом проверяет, как ведущие модели ASR справляются с этими ошибками: точно ли они транскрибируют то, что говорит аудио, или воспроизводят неправильную транскрипцию бенчмарка? Для масштабного тестирования мы использовали ансамбль независимых моделей, выбранных за их низкий коэффициент ошибок фонем (PER). Этот коэффициент измеряет, насколько близко письменная транскрипция соответствует звукам в аудио, что делает его полезным индикатором точности транскрипции.
Например, один из клипов VoxPopuli явно включает фразу "Thank you, Mr. President", но ссылка пропускает "Thank you". Шесть из 11 протестированных моделей воспроизвели ошибочную транскрипцию бенчмарка, давая "ожидаемый" ответ, хотя он противоречил аудио. Когда мы представили тот же контент в новых записях голосов из парламентских заседаний ЕС, такое поведение часто ослабевало или исчезало.
Проблемы с извлечением сущностей
Для дальнейшего изучения мы намеренно заглушили числа в аудиозаписях тестовых наборов и попросили модели транскрибировать то, что они слышат. Число отсутствовало в аудио, поэтому модели не должны были выводить никакое число, тем более точное. Некоторые из этих чисел были полупредсказуемыми, хотя другие были довольно неожиданными. В одном из клипов модели воспроизводили ошибки транскрипции, включая неправильное число, и одна модель даже автоматически дополнила относительно случайный год (2011), несмотря на то, что он был заглушен.
Ортографическое переключение
Наш тест на ортографическое переключение проверяет, воспроизводят ли модели точное написание, использованное в ссылочной транскрипции бенчмарка, несмотря на то, что это не всегда ясно в аудио. Ортографические варианты — это слова, которые семантически и фонетически идентичны, но могут быть написаны по-разному. Если модели систематически переключаются, чтобы соответствовать тому, что указано в ссылочной транскрипции, это указывает на то, что они улавливают, какой бенчмарк ожидается. Например, в одном из тестов 6 из 11 моделей использовали "any one", а 5 — "anyone".
Выводы
Наши результаты показывают, что на двух крупных открытых наборах данных некоторые модели распознавания речи могут обнаруживать акустические подсказки, связанные с конкретными наборами данных, и соответственно корректировать свое поведение транскрипции. Это подчеркивает важность использования полностью отобранных наборов для оценки, как это делают RW-Voice-EQ Bench и Open ASR Leaderboard, а также необходимость смотреть за пределы коэффициента ошибок слов на одном публичном бенчмарке. Мы добавили вкладку "Подгонка под бенчмарк" в Open ASR Leaderboard, которая включает два из вышеупомянутых анализа по всем моделям, что позволяет количественно оценить (1) коэффициенты ошибок ссылок из VoxPopuli и (2) ортографическое переключение по всем публичным наборам данных. Эти находки также подчеркивают необходимость большей прозрачности в отношении данных для обучения и процедур выбора моделей, чтобы исследователи могли лучше понять, как возникают такие поведения.
Комментарии (0)