Качественная транскрипция аудио в реальном времени долгое время оставалась сложной задачей для разработчиков. Теперь OpenAI представила две новые модели для своего API, одна из которых — GPT-Live-Transcribe — решает эту проблему с минимальной задержкой.
OpenAI своего API для работы с аудио, представив две специализированные модели транскрипции. Одна из них, GPT-Live-Transcribe, предназначена для работы с живым потоком, а вторая, GPT-Transcribe, — для обработки уже готовых аудиофайлов.
Модель GPT-Live-Transcribe разработана специально для сценариев, требующих минимальной задержки. Она найдёт применение в голосовых помощниках, онлайн-конференциях и интерактивных диалогах, где скорость ответа критически важна.
GPT-Transcribe, в свою очередь, оптимизирована для асинхронной обработки больших объемов аудио. Эта модель идеально подходит для пакетной транскрипции записей и анализа архивов, где приоритет отдаётся общей пропускной способности, а не мгновенной реакции.
Появление специализированных моделей для разных типов транскрипции позволяет разработчикам точнее подбирать инструмент под конкретную задачу. Однако OpenAI не раскрыла подробных данных о производительности и ценах новых моделей по сравнению с существующим Whisper API.