Когда пользователь перебивает голосового агента, главная проблема инженера — понять, что именно агент успел сказать. Deepgram выпустила Flux TTS, модель преобразования текста в речь, которая решает эту задачу: она точно сообщает, сколько текста было произнесено до прерывания.
Deepgram сделала Flux TTS общедоступной через эндпоинт /v2/speak. Модель поддерживает два способа работы: потоковую передачу по WebSocket для живых диалогов и пакетный REST для предварительно записанных данных.
Ключевая особенность Flux TTS — функция «Barge-in», которая позволяет точно отслеживать прерванную речь. При перебивке команда Interrupt отменяет активный ход диалога, а SpeechInterrupted сообщает два параметра: text_spoken (произнесенный текст) и text_remaining (оставшийся текст). Это помогает инженерам поддерживать контекст больших языковых моделей (LLM) и синхронизировать состояние диалога.
Также добавлена возможность изменять скорость речи прямо во время сессии без переподключения. Команда Configure регулирует скорость в диапазоне от 0.85 до 1.15 с шагом 0.05.
Расширен каталог голосов: теперь доступно 36 английских голосов с разными акцентами, включая американские, британские, ирландские, австралийские, индийские, сингапурские и филиппинские. В бета-версии появился параметр экспрессивности, который позволяет менять регистр произношения от спокойного (-2) до более анимированного (2). Flux TTS также доступна для самоуправляемых развертываний в режиме раннего доступа.
Deepgram специально разработала Flux TTS для голосовых агентов, решая одну из самых сложных задач при создании естественных диалогов — точную обработку перебивок. Это упрощает инженерам поддержание связного контекста в LLM. Единственный пробел: параметр экспрессивности пока в бета-версии.