Обработка длинных видео высокого разрешения — одно из самых ресурсоёмких направлений в задачах ИИ. Cohere Labs представила AutoGaze, инструмент, который радикально снижает вычислительные затраты, делая высококачественный видеоанализ гораздо доступнее для инженеров. Модуль ускоряет работу больших языковых моделей (MLLM) с видео до 19 раз, интеллектуально отбирая только ключевые кадры.
AutoGaze работает как легковесный модуль, который удаляет избыточные участки из видео до того, как оно поступит на обработку в основные модели, такие как Vision Transformers (ViT) или MLLM. Он использует предсказание следующего токена и обучение с подкреплением, чтобы авторегрессивно выбрать минимальный набор патчей, которые восстанавливают видео, устраняя избыточность, но сохраняя всю важную информацию.
Благодаря этому подходу AutoGaze сокращает количество визуальных токенов в 4–100 раз и ускоряет работу ViT и MLLM до 19 раз. Это позволяет масштабировать MLLM для анализа видео до 1000 кадров в разрешении 4K, а также улучшает результаты на бенчмарках. Например, на новом бенчмарке HLVid (High-resolution, Long-form Video QA) MLLM, использующая AutoGaze, превосходит базовую модель на 10,1%.
Подобные решения указывают на общий тренд в развитии ИИ — повышение эффективности понимания видео. Google DeepMind также работает над схожими задачами со своей моделью D4RT, фокусируясь на 4D-реконструкции и отслеживании сцен.
AutoGaze меняет подход к обработке видео для больших моделей, перенося фокус на интеллектуальную предобработку. Это открывает двери для более широкого применения ИИ в задачах с высококачественным видео, где раньше доминировали вычислительные ограничения. Однако, как это решение покажет себя за пределами бенчмарков, в реальных условиях, покажет только время.