Обычно голосовые ИИ-агенты вынуждены замолкать, чтобы подумать или выполнить задачу, разрывая нить разговора. Теперь Google выпустила две новые аудио-модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, которые способны вести непрерывный диалог, параллельно рассуждая и выполняя сложные действия в фоне.
Google DeepMind представила две ключевые модели, теперь общедоступные через Live API. Gemini 3.8 Live (gemini-3.8-live) предназначена для большинства голосовых агентов, требующих низкой задержки и плавных диалогов. Она поддерживает переменное рассуждение и асинхронный вызов функций по умолчанию. Gemini 3.8 Live Extended Thinking (gemini-3.8-live-extended-thinking) — это модель с высоким уровнем рассуждений, способная выполнять глубокие фоновые вычисления, не прерывая беседу.
Gemini 3.8 Live обеспечивает быстрые и естественные разговоры, обрабатывая визуальные данные почти в реальном времени для контекста. Она автоматически распознает и переключается между 97 языками в процессе диалога. Модель выполняет вызовы инструментов и API в фоновом режиме, позволяя агенту продолжать общение, пока задачи завершаются. По пользовательским предпочтениям она занимает второе место в Speech Agent Arena и отличается ценовой эффективностью.
Модель Extended Thinking создана для сложных задач, где требуется более глубокое рассуждение. Она рассуждает и говорит одновременно, используя ранние вербальные сигналы вроде «Позвольте мне проверить…» и рассказывая о ходе многоэтапных фоновых задач. По данным Artificial Analysis, она заняла первое место (82.6) в Speech to Speech Quality Index и лидирует в выполнении агентных задач (68.6% на τ-Voice). Также модель показала высокие результаты в рассуждениях (97.7% на Big Bench Audio) при конкурентной цене.
Обе модели доступны через Gemini Live API, который обеспечивает низкую задержку и взаимодействие с голосом и зрением в реальном времени. API поддерживает barge-in (перебивание), вызов инструментов (включая Google Search), транскрипцию аудио и проактивное управление ответами. Все генерируемое аудио помечается SynthID — незаметным водяным знаком для обнаружения ИИ-контента.
Модели развертываются для разработчиков через Gemini API и Google AI Studio, для корпоративных клиентов — в частном превью Gemini Enterprise, а также доступны в Google Workspace (Docs Live, Gmail Live, Keep Live) и Search Live. Среди партнеров, использующих Gemini Live API, — платформы Agora, LiveKit, Vercel, а также компании Salesforce и Genspark.
Появление моделей, способных рассуждать и выполнять задачи, не прерывая естественного диалога, радикально меняет ожидания от голосовых ассистентов. Google предлагает два подхода: быстрый для массовых сценариев и глубокий для сложных кейсов, что даёт разработчикам гибкость. Однако реальная сложность будет заключаться в адаптации существующих систем к этой новой парадигме непрерывного взаимодействия.