Обычно, чтобы получить видео от ИИ, нужно ввести запрос, а затем ждать готовый файл. Runway предлагает изменить этот подход: компания выпустила исследовательскую статью о потоковой генерации видео, которая позволяет получать кадры в реальном времени, по мере ввода промпта. Текущие модели работают поэтапно, выдавая готовый объект, но новый метод фокусируется на времени до появления первого кадра и непрерывной трансляции.
Такой подход критически важен, потому что он устраняет барьер между идеей и созданием, обеспечивая скорость и контроль, недоступные современным моделям. Быстрая генерация также сокращает время использования GPU, что снижает стоимость. Это переводит фокус пользователя с пассивного ожидания на активное управление процессом, а также открывает новые экономически выгодные сценарии использования, которые раньше были невозможны.
Подход Runway основан на пост-тренинге базовых моделей, таких как Gen-4.5. Каждый авторегрессивный шаг обусловлен двумя факторами: начальным первым кадром и текстовой подписью, выбранной пользователем. Генерация происходит покадрово, при этом все сгенерированные латенты сохраняются в контексте для поддержания качества. Декодеры видео и аудио работают причинно, стримя выход по мере генерации латентов.
Чтобы базовая модель работала в реальном времени, процесс разбит на два этапа:
- Teacher forcing (каузальность). Вся архитектура модели преобразуется в темпорально каузальный, покадровый авторегрессивный генератор. Это позволяет модели адаптироваться к авторегрессивному режиму, не теряя своих сильных сторон.
- Student forcing (ускорение). Полученная каузальная модель всё ещё медленная. Для ускорения используется дистилляция (передача знаний от большой модели-учителя к меньшей модели-ученику), которая сокращает количество шагов денойзинга до нескольких, что достаточно для потоковой передачи с хорошей задержкой. Этот процесс дистилляции проходит в две стадии:
- Off-policy дистилляция. Модель-ученик причинно предсказывает следующие состояния, используя "истинный" контекст. Замороженная двунаправленная модель-учитель показывает, как должна выглядеть качественная генерация, а модель-критик отслеживает текущий выход ученика, подталкивая его к распределению учителя. Это эффективный способ начать обучение, но он не решает проблему накопления ошибок.
- On-policy дистилляция. Чтобы уменьшить накопление ошибок (которые в видео быстро нарастают), модель-ученик выполняет rollouts (генерирует последовательности) непосредственно во время обучения. Каждый сгенерированный латент становится контекстом для следующего, позволяя модели видеть свои ошибки и корректировать их. Обучение с постепенно увеличивающейся длиной последовательности показало лучшие результаты, чем с фиксированной.
С переходом к реальному времени узкое место вычислений смещается от обучения к инференсу (использованию модели). Каждый кадр должен быть выдан достаточно быстро, чтобы соответствовать скорости воспроизведения, на оборудовании, которое одновременно используется для множества сессий. Runway использует свои внутренние инструменты оценки и обсервабилити для сравнения качества и задержки между различными конфигурациями.
Мгновенная генерация — это основа для интерактивных опытов, которые, по мнению Runway, станут крупнейшим применением генеративных медиа. Образование, игры, робототехника и другие области будут зависеть от видео, которое реагирует так же быстро, как и смотрящий его человек. Это также применимо к симуляции, где физические (роботы, автономные транспортные средства) и цифровые агенты нуждаются в средах, генерируемых в реальном времени и мгновенно реагирующих на пограничные случаи.
Подход Runway обещает не только снизить стоимость итераций при создании видео, но и открыть дорогу для по-настоящему интерактивных AI-приложений — от образовательных платформ и игр до робототехники. Пока это исследовательская статья, но она задаёт вектор развития генеративных медиа.