Когда в разговоре участвуют несколько человек, а тем более перебивают друг друга, понять, кто что сказал в стенограмме, становится почти невозможно. NVIDIA выпустила Nemotron 3 Diarization — открытую модель диаризации речи, которая обещает решить эту проблему, разделяя до восьми голосов с рекордной точностью на VoiceArena.
Модель Nemotron 3 Diarization (100 млн параметров) заняла первое место в рейтинге VoiceArena. Её показатель ошибки диаризации (DER) составил 14.72%, что делает её самой точной открытой моделью для разделения голосов.
Модель способна различать до восьми говорящих одновременно, успешно обрабатывая даже перекрывающиеся разговоры. Она работает как в реальном времени (стриминг), так и с записанными аудиоданными, поддерживая гибкую обработку фрагментов и настраиваемую задержку.
Nemotron 3 Diarization развивает подход, заложенный в предыдущих моделях NVIDIA Sortformer. Она расширяет поддержку с четырех до восьми спикеров, а также улучшает общую точность и пропускную способность по сравнению с базовой Sortformer (diar_streaming_sortformer_4spk-v2.1).
Выпуск Nemotron 3 Diarization как открытой модели упрощает создание систем, способных точно атрибутировать речь. Это критически важно для развития мультимодальных LLM и голосовых ассистентов. Однако NVIDIA не уточнила конкретные требования к аппаратному обеспечению для эффективного развертывания модели в реальных условиях.