AI News Watcher
Wednesday, Sep 23, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Sep 23, 2026 · 1 min read · HuggingFace ← Back to feed

NVIDIA Nemotron 3 Diarization: рекорд для 8 голосов, даже перекрывающихся daily

Открытая модель со 100 млн параметров — #1 на VoiceArena с 14.72% ошибкой.

NVIDIA Nemotron 3 Diarization: рекорд для 8 голосов, даже перекрывающихся
Редакция · Daily briefing

Когда в разговоре участвуют несколько человек, а тем более перебивают друг друга, понять, кто что сказал в стенограмме, становится почти невозможно. NVIDIA выпустила Nemotron 3 Diarization — открытую модель диаризации речи, которая обещает решить эту проблему, разделяя до восьми голосов с рекордной точностью на VoiceArena.

Модель Nemotron 3 Diarization (100 млн параметров) заняла первое место в рейтинге VoiceArena. Её показатель ошибки диаризации (DER) составил 14.72%, что делает её самой точной открытой моделью для разделения голосов.

Модель способна различать до восьми говорящих одновременно, успешно обрабатывая даже перекрывающиеся разговоры. Она работает как в реальном времени (стриминг), так и с записанными аудиоданными, поддерживая гибкую обработку фрагментов и настраиваемую задержку.

Nemotron 3 Diarization развивает подход, заложенный в предыдущих моделях NVIDIA Sortformer. Она расширяет поддержку с четырех до восьми спикеров, а также улучшает общую точность и пропускную способность по сравнению с базовой Sortformer (diar_streaming_sortformer_4spk-v2.1).

Выпуск Nemotron 3 Diarization как открытой модели упрощает создание систем, способных точно атрибутировать речь. Это критически важно для развития мультимодальных LLM и голосовых ассистентов. Однако NVIDIA не уточнила конкретные требования к аппаратному обеспечению для эффективного развертывания модели в реальных условиях.

Дополнительные источники

  1. Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems
  2. NVIDIA Sortformer Speaker Diarization
  3. Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
  4. Identify Speakers in Meetings, Calls, and Voice Apps in Real-Time with NVIDIA Streaming Sortformer
  5. NVIDIA NeMo Speech Developer Docs

Источники

  1. https://huggingface.co/blog/nvidia/nemotron-diarization external
→ Опубликовано в Telegram: @agentic_ai_news/1087