AI News Watcher
Thursday, Sep 24, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Sep 24, 2026 · 2 min read · Google ← Back to feed

Google Gemini 3.8 Live Avatar: ИИ-помощник получил живое лицо и говорит на 97 языках daily

ИИ-аватар видит и слышит, ведёт диалог и выполняет задачи в фоне, не прерывая беседу — и это делает ИИ-общение живым.

Google Gemini 3.8 Live Avatar: ИИ-помощник получил живое лицо и говорит на 97 языках
Редакция · Daily briefing

Общаться с ИИ-помощником только голосом или текстом — это удобно, но не всегда естественно. Теперь Google DeepMind сделал следующий шаг, добавив ИИ-модели Gemini 3.8 Live полноценное визуальное присутствие в реальном времени.

Этот шаг реализован через функцию Live Avatar, которая нативно связывает живой диалог с потоковым видео с низкой задержкой. Аватар не просто воспроизводит речь, но и генерирует её в реальном времени вместе с видео, создавая динамичный визуальный образ, который слушает, видит и говорит.

Интеграция визуальных и аудиовходов позволяет модели обрабатывать информацию одновременно, обеспечивая более полное восприятие контекста. Кроме того, Live Avatar поддерживает асинхронное выполнение инструментов: ИИ может вызывать внешние сервисы и получать данные в фоновом режиме, продолжая при этом активный диалог. Это позволяет ему решать сложные задачи, например, регистрировать гостя в отеле, без прерывания беседы.

Особое внимание уделено глобальному масштабированию: функция обеспечивает нативную синхронизацию речи на 97 языках. Аватар динамически адаптирует мимику и артикуляцию губ, плавно переключаясь между языками без потери качества видео или визуальных артефактов. Для брендов предусмотрена возможность кастомизации: помимо библиотеки готовых аватаров, компании могут создавать собственные на основе высококачественных изображений, сохраняя фирменный стиль и идентичность (доступно по запросу для корпоративных клиентов).

Gemini 3.8 Live с Live Avatar уже доступен в Gemini Enterprise. Google DeepMind подчеркивает, что при разработке особое внимание уделялось безопасности и прозрачности: весь генерируемый контент маркируется невидимым водяным знаком SynthID, встроенным непосредственно в аудио- и видеовыход. Это помогает обнаруживать созданный ИИ контент и минимизировать дезинформацию.

Переход от голосовых помощников к полноценным визуальным аватарам с возможностью видеть и слышать, а также выполнять задачи в фоне, повышает реалистичность и эффективность корпоративных ИИ-взаимодействий. Это открывает новые перспективы для инженеров, желающих создавать более интерактивные и живые решения. Однако возможность создания кастомных аватаров пока доступна только корпоративным клиентам по специальному запросу.

Дополнительные источники

  1. Power your agents: Gemini 3.8 Live with Live Avatar is now generally available
  2. Gemini Live API overview
  3. Gemini 3.8 Audio (Live, Live Extended Thinking)
  4. Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
  5. Introducing agentic video understanding with Gemini
  6. openhelm.ai
  7. spatius.ai
  8. models
  9. ibm.com

Источники

  1. https://deepmind.google/blog/introducing-gemini-38-live-with-live-avatar/ blog
→ Опубликовано в Telegram: @agentic_ai_news/1103