До сих пор ИИ-ассистенты часто казались медленными или неуклюжими в разговоре, потому что им приходилось ждать, пока вы закончите говорить, прежде чем начать думать. Теперь ByteDance Seed Team изменила это: её модель SeedRealtime — первая в индустрии полнодуплексная аудиовизуальная LLM, которая обрабатывает речь, видео и текст в едином потоке, позволяя ИИ вести диалог так же естественно, как человек.
Ключевое достижение SeedRealtime — это единая архитектура, которая нативно объединяет аудио, видео и текст, позволяя модели непрерывно воспринимать, понимать и реагировать. Это устраняет задержки и потерю информации, присущие каскадным системам (отдельные модули для ASR, VLM, TTS), и уходит от полудуплексного режима "вопрос-ответ", где ИИ ждет своей очереди. Восприятие, понимание, принятие решений и выражение работают параллельно над непрерывными потоками данных.
Модель демонстрирует в естественном ритме взаимодействия, сокращая проблемы с темпом разговора вдвое по сравнению с каскадными системами. SeedRealtime способна активно вмешиваться в диалог, основываясь на визуальных изменениях — например, заметив нужный объект на экране или ошибку в действиях пользователя. Также она понимает контекст, различая фоновый шум и реплики посторонних, чтобы не прерывать беседу без повода.
SeedRealtime объединяет аудиовизуальное понимание, позволяя ИИ разрешать омофоны по визуальному контексту и связывать увиденное, услышанное и сказанное. Это позволяет модели не только распознавать людей и их голоса в шумной обстановке, но и понимать действия пользователя. Например, она может исправлять ошибки при работе с кофемашиной, давать рекомендации по меню в ресторане или находить нужный раздел в документе, просто наблюдая за происходящим.
С запуском SeedRealtime ИИ переходит от простого разговора к активному взаимодействию и действиям в реальном мире, но ByteDance пока не раскрывает, как именно модель будет интегрировать внешние инструменты для выполнения задач, помимо наблюдения и общения.