Полный разговорный ИИ-агент, способный не только слышать и отвечать, но и видеть окружение, обычно требует сложной инфраструктуры. Google DeepMind упростила это, выпустив новые модели Gemini 3.8 Live, а ElevenLabs тут же сделала их доступными для разработчиков.
Google DeepMind представила Gemini 3.8 Live и 3.8 Live Extended Thinking — новые модели, разработанные для создания разговорных ИИ-агентов, способных обрабатывать информацию и поддерживать диалог в реальном времени. Они оптимизированы для задач с высокой нагрузкой и низкой задержкой, таких как живое общение.
Модели обладают расширенным набором функций, позволяющих агентам:
- Выполнять асинхронные вызовы — запускать функции API и инструментов в фоновом режиме, продолжая при этом потоковую передачу аудиоответов пользователю.
- Использовать визуальный контекст — понимать диалог на основе живых видео- и фото входов, что позволяет агентам видеть и понимать окружение пользователя.
- Точно распознавать текст — обеспечивать высокую точность транскрипции буквенно-цифровых последовательностей.
Версия Gemini 3.8 Live Extended Thinking предлагает более глубокие возможности рассуждения и занимает первое место в рейтинге Speech-to-Speech на Artificial Analysis. Модели также поддерживают многоязычное общение на 70 языках, позволяют пользователям прерывать агента (barge-in) и интегрируются с инструментами, такими как Google Search, для динамических взаимодействий.
ElevenLabs, в лице руководителя отдела по работе с разработчиками Торстена Шеффа, объявила, что модели Gemini 3.8 Live и 3.8 Live Extended Thinking уже доступны в агентах LiveKit и Google AI SDK. Это открывает новые возможности для разработчиков, особенно для тех, кто использует платформу Vercel.
Gemini 3.8 Live поднимает планку для создания ИИ-агентов, способных к по-настоящему живому взаимодействию: не только слышать, но и видеть окружение, а также глубоко рассуждать. Доступность через инструменты ElevenLabs означает, что разработчики могут сразу начать экспериментировать с этими функциями, но насколько легко их адаптируют в реальных продуктах — покажет время.