Количество открытых моделей синтеза речи (TTS) на Hugging Face Hub превысило 8000, но их оценка оставалась медленной и фрагментированной. Теперь Hugging Face представила Open TTS Leaderboard, которая радикально ускоряет этот процесс, позволяя инженерам оперативно сравнивать производительность.
Существующие методы оценки, основанные на предпочтениях человека, такие как MOS (Mean Opinion Score) или MUSHRA, не справлялись с масштабом. Оценка одной модели могла занимать недели, и большинство открытых моделей просто не попадали в такие рейтинги из-за сложности хостинга и сбора голосов. Добавить проприетарную модель в рейтинг было проще, чем открытую.
Open TTS Leaderboard использует объективные метрики для быстрой оценки:
- Разборчивость — вычисляется Word Error Rate (WER) и Character Error Rate (CER) между исходным текстом и транскриптом сгенерированного аудио. Для транскрипции используется ASR-модель Qwen3 ASR.
- Скорость — измеряется обратный коэффициент реального времени (RTFx) для пакетного офлайн-инференса на GPU H200, а также время до первого аудио (TTFA) для оценки задержки потоковой передачи при размере батча 1 на GPU H200 и CPU.
- Схожесть голоса при клонировании — определяется через косинусное сходство между WavLM-эмбеддингами сгенерированного аудио и референсного клипа.
Благодаря этим объективным метрикам, время оценки одной модели сокращается с нескольких недель до нескольких часов. Это позволяет оперативно сравнивать производительность в многоязычных сценариях и задачах клонирования голоса, которые становятся всё более востребованными.
Новый подход Hugging Face не заменяет человеческую оценку естественности и выразительности, но предоставляет необходимый инструмент для первичного, быстрого и масштабируемого отбора моделей. Это особенно важно в условиях бурного роста рынка клонирования голоса. Однако вендор не сообщил, как именно будет обеспечиваться прозрачность и верифицируемость используемых ASR и WavLM моделей, которые сами по себе могут иметь свои погрешности.