AI News Watcher
Friday, Aug 28, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 28, 2026 · 2 min read · HuggingFace ← Back to feed

Hugging Face научила ASR-бенчмарки искать предвзятость — и добавила хинди daily

Обычные метрики ASR скрывают, как модели ошибаются для разных людей. Новые наборы данных учитывают 9 параметров, чтобы это исправить.

Hugging Face научила ASR-бенчмарки искать предвзятость — и добавила хинди
Редакция · Daily briefing

Автоматическое распознавание речи (ASR) часто работает хуже для одних групп людей, чем для других, но стандартные бенчмарки этого не показывают. Hugging Face совместно с Voice Arena добавила на свою таблицу лидеров Open ASR новые наборы данных: Monsoon en-IN и Monsoon hi-IN. Впервые ASR-модели для хинди и индийского английского будут оценивать не только по общей точности, но и по справедливости.

На текущих бенчмарках ASR, включая Open ASR Leaderboard, модели оцениваются по одной цифре — частоте ошибок (WER). Однако это число скрывает, что распознавание речи работает по-разному для разных групп: например, коммерческие системы могут быть вдвое менее точными для одних этнических групп по сравнению с другими, а также имеют различия по полу, возрасту и акценту. Существующие тестовые наборы не собирают информацию о говорящих, что делает невозможным выявление таких предвзятостей.

Hugging Face уже предпринимала шаги для повышения достоверности оценки, чтобы модели не "накручивали" результаты под публичные тесты (так называемый "benchmaxxing"). Это включало:

Теперь Open ASR Leaderboard пополнилась двумя новыми оценочными наборами: Monsoon en-IN (для индийского английского) и Monsoon hi-IN (для хинди). Хинди стал первым индийским языком на многоязычной вкладке, которая до этого охватывала только европейские языки. Каждый набор выпущен как с общедоступным, так и с частным разделением, чтобы ограничить оптимизацию под конкретный бенчмарк.

Эти наборы данных Monsoon созданы специально для выявления проблем, невидимых в агрегированном WER. Они варьируют данные по девяти ключевым осям, где общая точность может быть высокой, но для конкретных групп — низкой. К таким осям относятся: география, возраст, пол, словарный запас, используемые устройства, акустические среды, тип и скорость речи, а также наличие нескольких допустимых транскрипций для одного аудио.

Дизайн сбора данных в Monsoon целенаправленно учитывал эти вариации:

В общей сложности четыре разделения (два языка, публичные и частные версии) охватывают 4 888 уникальных спикеров. Для каждого из них записано до 12 атрибутов, что позволяет глубоко анализировать производительность модели по различным демографическим и контекстуальным параметрам.

Добавление хинди и индийского английского, а главное — новые методы оценки, указывают на смещение фокуса в ASR-бенчмарках. Теперь недостаточно просто показать низкий WER; модели должны быть справедливыми для разных групп пользователей. Это важный шаг для языков глобального Юга, но пока непонятно, как быстро появятся аналогичные наборы для других подобных языков.

Дополнительные источники

  1. Hugging Face Open ASR Leaderboard GitHub
  2. Appen Provides Private, High-Quality Audio Data to Hugging Face's Open ASR Leaderboard
  3. AI4Bharat Official Website
  4. AI4Bharat OIWER GitHub
  5. huggingface.co

Источники

  1. https://huggingface.co/blog/open-asr-leaderboard-global-south external
→ Опубликовано в Telegram: @agentic_ai_news/947