AI News Watcher
Wednesday, Aug 5, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 05, 2026 · 1 min read · ByteDance ← Back to feed

ByteDance SeedRealtime: ИИ теперь смотрит, слушает и говорит одновременно daily

Модель сама решает, когда вмешаться, и сокращает неловкие паузы вдвое.

ByteDance SeedRealtime: ИИ теперь смотрит, слушает и говорит одновременно
Редакция · Daily briefing

До сих пор ИИ-ассистенты часто казались медленными или неуклюжими в разговоре, потому что им приходилось ждать, пока вы закончите говорить, прежде чем начать думать. Теперь ByteDance Seed Team изменила это: её модель SeedRealtime — первая в индустрии полнодуплексная аудиовизуальная LLM, которая обрабатывает речь, видео и текст в едином потоке, позволяя ИИ вести диалог так же естественно, как человек.

Ключевое достижение SeedRealtime — это единая архитектура, которая нативно объединяет аудио, видео и текст, позволяя модели непрерывно воспринимать, понимать и реагировать. Это устраняет задержки и потерю информации, присущие каскадным системам (отдельные модули для ASR, VLM, TTS), и уходит от полудуплексного режима "вопрос-ответ", где ИИ ждет своей очереди. Восприятие, понимание, принятие решений и выражение работают параллельно над непрерывными потоками данных.

Модель демонстрирует в естественном ритме взаимодействия, сокращая проблемы с темпом разговора вдвое по сравнению с каскадными системами. SeedRealtime способна активно вмешиваться в диалог, основываясь на визуальных изменениях — например, заметив нужный объект на экране или ошибку в действиях пользователя. Также она понимает контекст, различая фоновый шум и реплики посторонних, чтобы не прерывать беседу без повода.

SeedRealtime объединяет аудиовизуальное понимание, позволяя ИИ разрешать омофоны по визуальному контексту и связывать увиденное, услышанное и сказанное. Это позволяет модели не только распознавать людей и их голоса в шумной обстановке, но и понимать действия пользователя. Например, она может исправлять ошибки при работе с кофемашиной, давать рекомендации по меню в ресторане или находить нужный раздел в документе, просто наблюдая за происходящим.

С запуском SeedRealtime ИИ переходит от простого разговора к активному взаимодействию и действиям в реальном мире, но ByteDance пока не раскрывает, как именно модель будет интегрировать внешние инструменты для выполнения задач, помимо наблюдения и общения.

Дополнительные источники

  1. Real-Time AI Voice Models Compared: GPT Realtime 2, Gemini TTS, Grok, and InWorld
  2. deepmind.google
  3. vier.ai

Источники

  1. https://seed.bytedance.com/en/blog/seedrealtime-audio-visual-full-duplex-llm-released-toward-omni-modal-natural-interaction?view_from=content_recommend blog
→ Опубликовано в Telegram: @agentic_ai_news/817