Автоматическое распознавание речи (ASR) часто работает хуже для одних групп людей, чем для других, но стандартные бенчмарки этого не показывают. Hugging Face совместно с Voice Arena добавила на свою таблицу лидеров Open ASR новые наборы данных: Monsoon en-IN и Monsoon hi-IN. Впервые ASR-модели для хинди и индийского английского будут оценивать не только по общей точности, но и по справедливости.
На текущих бенчмарках ASR, включая Open ASR Leaderboard, модели оцениваются по одной цифре — частоте ошибок (WER). Однако это число скрывает, что распознавание речи работает по-разному для разных групп: например, коммерческие системы могут быть вдвое менее точными для одних этнических групп по сравнению с другими, а также имеют различия по полу, возрасту и акценту. Существующие тестовые наборы не собирают информацию о говорящих, что делает невозможным выявление таких предвзятостей.
Hugging Face уже предпринимала шаги для повышения достоверности оценки, чтобы модели не "накручивали" результаты под публичные тесты (так называемый "benchmaxxing"). Это включало:
- Использование закрытых частных разделений данных (в том числе от Appen).
- Анализ соответствия бенчмарку, чтобы модели не просто воспроизводили эталонные транскрипции.
- Устранение пробелов в нормализаторах, исключающее несправедливые штрафы за правильные варианты.
Теперь Open ASR Leaderboard пополнилась двумя новыми оценочными наборами: Monsoon en-IN (для индийского английского) и Monsoon hi-IN (для хинди). Хинди стал первым индийским языком на многоязычной вкладке, которая до этого охватывала только европейские языки. Каждый набор выпущен как с общедоступным, так и с частным разделением, чтобы ограничить оптимизацию под конкретный бенчмарк.
Эти наборы данных Monsoon созданы специально для выявления проблем, невидимых в агрегированном WER. Они варьируют данные по девяти ключевым осям, где общая точность может быть высокой, но для конкретных групп — низкой. К таким осям относятся: география, возраст, пол, словарный запас, используемые устройства, акустические среды, тип и скорость речи, а также наличие нескольких допустимых транскрипций для одного аудио.
Дизайн сбора данных в Monsoon целенаправленно учитывал эти вариации:
- География — данные собирались в сотнях районов, а не в меньшем числе мест с длительными сессиями.
- Устройства и акустические условия — участники использовали свои телефоны и подключения, записываясь как в помещении, так и на улице, а не в тихих комнатах с предоставленным оборудованием.
- Словарный запас, тип и скорость речи — подсказки включали повседневные темы, побуждающие к выражению мнений, несогласий, повествованию и воспоминаниям, что естественным образом вводило именованные сущности, числа и неподготовленные фразы.
- Возраст и пол — эти атрибуты записывались для каждого спикера и проходили проверку.
- Множественные допустимые транскрипции — это свойство эталонной транскрипции, а не самого аудио.
В общей сложности четыре разделения (два языка, публичные и частные версии) охватывают 4 888 уникальных спикеров. Для каждого из них записано до 12 атрибутов, что позволяет глубоко анализировать производительность модели по различным демографическим и контекстуальным параметрам.
Добавление хинди и индийского английского, а главное — новые методы оценки, указывают на смещение фокуса в ASR-бенчмарках. Теперь недостаточно просто показать низкий WER; модели должны быть справедливыми для разных групп пользователей. Это важный шаг для языков глобального Юга, но пока непонятно, как быстро появятся аналогичные наборы для других подобных языков.