Когда голосовой помощник спотыкается на фоновом шуме или сложном жаргоне, это убивает диалог. Google выпустила Gemini 3.5 Transcribe — модель, которая обещает превращать сырое аудио сразу в чистый, отформатированный текст, справляясь с типичными помехами. Она уже доступна разработчикам через API.
Gemini 3.5 Transcribe позиционируется как самый точный движок распознавания речи от Google, предназначенный для интеллектуального голосового взаимодействия. В отличие от других моделей, которые плохо работают с фоновым шумом, сложной терминологией и дефектами речи, Gemini 3.5 Transcribe преобразует сырое аудио напрямую в отполированный и правильно отформатированный текст.
Модель доступна через Gemini API в Google AI Studio и на платформе Gemini Enterprise Agent. Разработчикам предложены два отдельных API:
- Real-time streaming — для интерактивных голосовых приложений, требующих непрерывной двунаправленной потоковой передачи с задержкой менее секунды. Используется модель
gemini-3.5-transcribe-live. - Pre-recorded audio processing — для транскрибирования записанного аудио, встреч и звонков. Поддерживает атрибуцию говорящих и временные метки на уровне слов. Используется модель
gemini-3.5-transcribe.
Модель gemini-3.5-transcribe для не-потокового аудио поддерживает до часа записи (или до 30 минут с включенной диаризацией говорящих или временными метками). Среди её возможностей:
- Автоматическое определение более 85 языков и переключение между ними.
- Диаризация говорящих (разделение речи по участникам).
- Временные метки для каждого слова.
- Smart transcription — умное форматирование текста.
- Custom vocabulary speech biasing — адаптация к доменным терминам.
Платформы, такие как Pipecat.ai, Agora, Fishjam, LiveKit, Vercel и Vision Agents, уже интегрировали Live API для создания голосовых интерфейсов. Важно отметить, что Gemini 3.5 Transcribe — это специализированный пайплайн для распознавания речи, а не полноценный разговорный агент, который слушает, рассуждает и отвечает.
Модель Gemini 3.5 Transcribe призвана снять часть головной боли с разработчиков голосовых интерфейсов, предлагая им готовый чистый текст даже из сложного аудио. Однако, как и любой экспериментальный генеративный ИИ от Google, её реальная производительность в боевых условиях потребует независимой оценки.