Распознавание речи для языков, на которых говорят десятки миллионов человек, но которые редко поддерживаются крупными ASR-моделями, всегда было проблемой. Deepgram обновила свою модель Nova-3, добавив поддержку ассамского, монгольского и пушту, а также улучшив существующие монолингвальные модели для шести других языков.
Deepgram Nova-3 теперь способна распознавать речь на ассамском (as, as-IN), монгольском (mn) и пушту (ps, ps-AF). Эти языки доступны как для пакетной, так и для потоковой обработки аудио. Для активации необходимо указать model="nova-3" и соответствующий языковой код в запросе к API. Добавление этих языков особенно важно, учитывая их низкую представленность в других крупных ASR-сервисах: например, Google не поддерживает пушту. По данным академических исследований, распознавание пушту представляет трудности, часто приводя к ошибкам в скрипте и высоким показателям ошибок (WER) даже у современных мультиязычных моделей.
Помимо новых языков, Deepgram также улучшила существующие монолингвальные модели Nova-3 для нескольких уже поддерживаемых языков. Улучшения коснулись:
- Чешского (cs, cs-CZ), датского (da, da-DK) и тагальского (tl) — для пакетной и потоковой обработки.
- Турецкого (tr, tr-TR) — только для пакетной обработки.
- Шведского (sv, sv-SE) — только для потоковой обработки. Эти улучшения применяются автоматически для всех пользователей Nova-3 без необходимости менять API-запросы. Клиенты, использующие локально размещаемые версии, могут запросить обновленные модели у своего представителя Deepgram.
Эта стратегия Deepgram открывает новые возможности для разработчиков, работающих с глобальными или нишевыми аудиториями, снижая барьер для создания инклюзивных голосовых интерфейсов и аналитических инструментов. Однако реальная производительность на таких сложных языках, как пушту, требует независимой оценки, так как заявки вендоров часто оптимистичны.