ASR-модели всё чаще показывают «человеческий» уровень распознавания речи на публичных бенчмарках. Однако эти высокие баллы не всегда отражают реальное качество: модели могут просто подстраиваться под тесты. Hugging Face представила три новых теста, чтобы количественно оценить, как именно системы оптимизируются под бенчмарки, а не под реальную речь.
Проблема в том, что стандартные бенчмарки не учитывают многих условий и качеств, которые важны для надёжной работы голосовых систем в реальных сценариях. Это явление, иногда называемое «оптимизацией под бенчмарк» или «бенчмакссингом», обсуждается в машинном обучении, но его было сложно измерить в распознавании речи. Ранее Hugging Face уже ввела «скрытые наборы данных» в Real World VoiceEQ, Open-ASR Leaderboard и Far-field ASR Leaderboard, чтобы оценивать более значимые для реального использования параметры.
В рамках нового исследования Hugging Face проанализировала 11 широко используемых ASR-моделей с открытым исходным кодом. Выяснилось, что некоторые из моделей с самыми высокими баллами воспроизводили транскрипции из бенчмарков VoxPopuli English и LibriSpeech (чистые, другие), даже когда аудио им противоречило, важные слова были заглушены или аудио одинаково поддерживало две разные письменные формы. В некоторых случаях модели даже реагировали на тонкие акустические сигналы, указывающие на используемый бенчмарк, что приводило к завышению их реальных способностей.
Например, в одном из тестов VoxPopuli аудиозапись содержит фразу «Thank you, Mr. President», но в эталонной транскрипции отсутствует «Thank you». Шесть из 11 протестированных моделей воспроизвели ошибочную транскрипцию бенчмарка, выдавая «ожидаемый» ответ, хотя он противоречил аудио. Когда тот же контент был представлен с новыми голосами, поведение моделей часто менялось, и они начинали транскрибировать аудио точно.
Для выявления таких расхождений был разработан «зонд расхождений с эталоном». Он использует ансамбль независимых моделей с низким показателем PER (phoneme error rate — частота фонемных ошибок), чтобы определить, насколько точно транскрипция соответствует звукам в аудио. Результаты ансамбля позволяют выявить случаи, когда модели единогласно не согласны с эталонной транскрипцией бенчмарка.
Исследование Hugging Face даёт инженерам инструменты для более точной оценки ASR-моделей. Оно показывает, что высокие баллы на публичных бенчмарках не всегда гарантируют качество в реальных условиях и могут быть результатом адаптации к тестам. Это шаг к более надёжным методам измерения, которые отражают истинные возможности моделей.