Работать с аудио в реальном времени и точно распознавать речь в шумной обстановке — две главные сложности для разработчиков голосовых ИИ. OpenAI выпустила в API две новые модели, GPT-Live-Transcribe и GPT-Transcribe, которые устраняют эти ограничения.
Новые модели предназначены для разных сценариев использования:
- GPT-Live-Transcribe — для транскрипции речи в реальном времени с низкой задержкой.
- GPT-Transcribe — для асинхронной обработки завершенных аудиофайлов и пакетных задач.
Обе модели лучше понимают контекст и обеспечивают более точную транскрипцию реального звука. Они способны обрабатывать речь с различными акцентами и на разных языках, включая короткие фразы, числа, специализированную терминологию и речь с громким фоновым шумом.
Эти две модели напрямую отвечают на запросы разработчиков голосовых ИИ, предлагая специализированные решения для разных сценариев работы с аудио. Однако OpenAI не предоставила данных о ценах или независимых бенчмарках новых API.