Обработка длинных видео высокого разрешения всегда была узким местом для мультимодальных LLM. Cohere Labs представит AutoGaze — модуль, который радикально меняет подход: модели смогут эффективно работать с 4K-видео.
AutoGaze — это легковесный модуль, который удаляет избыточные патчи из видео до их обработки трансформерами или мультимодальными LLM (MLLM). Он авторегрессивно выбирает минимальный набор мультимасштабных патчей, способных реконструировать видео в заданных пределах ошибки. Так модуль сохраняет информацию, устраняя избыточность.
Эмпирические тесты показывают: AutoGaze сокращает количество визуальных токенов в 4–100 раз и ускоряет работу ViT (Vision Transformers) и MLLM до 19 раз. Это позволяет масштабировать MLLM до видео с 1000 кадрами в разрешении 4K. Результаты на существующих бенчмарках улучшаются, например, до 67,0% на VideoMME.
В рамках проекта также представили HLVid — первый бенчмарк для вопросов и ответов по длинным видео высокого разрешения. Он включает 5-минутные 4K-видео. MLLM, масштабированная с AutoGaze, превосходит базовую модель на 10,1% и обходит предыдущие лучшие MLLM на 4,5% на этом новом бенчмарке.
AutoGaze показывает, как преодолеть ограничения существующих MLLM в работе с визуальными данными и сделать их пригодными для реальных сценариев с высококачественным видео. Однако не сообщается, когда именно AutoGaze будет интегрирован в продукты Cohere или станет общедоступным.