Обычные модели обрабатывают видео пассивно, кадр за кадром. Google научил свои Gemini активно «смотреть» ролики: новая функция агентного понимания позволяет моделям динамически выбирать нужные моменты, сокращая затраты и повышая точность анализа. Она работает с моделями Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite.
Новая функция сокращает потребление токенов до 88% и затраты до 66%. Одновременно она повышает качество анализа видео до 7% по сравнению со статическим подходом. Эти улучшения особенно заметны при работе с длинными видеозаписями, от 10-минутных инструкций до многочасовых лекций.
«Агентное» понимание видео позволяет модели динамически сканировать сегменты. Вместо фиксированной частоты кадров (по умолчанию 1 FPS), модель активно определяет, что смотреть, с какой скоростью и через какую модальность — кадры, аудио или транскрипт. Модель использует свои внутренние инструменты, чтобы загружать только релевантные части видеофайла, что снижает накладные расходы на разработку.
Это открывает новые возможности для работы с длинными видео:
- Поиск моментов с точностью до доли секунды: позволяет находить изменения состояния и границы склеек, что важно для автоматического монтажа.
- Иголка в стоге сена» в многочасовых записях: отвечает на сложные запросы без потребления миллионов токенов.
- Обнаружение аномалий: динамически пересчитывает интересные временные окна с более высокой частотой кадров для анализа быстрого движения и едва заметных визуальных артефактов.
- Подсчет объектов и действий: точно отслеживает повторяющиеся физические движения и отдельные объекты в течение времени.
Функция агентного понимания видео уже доступна через API Gemini в Google AI Studio и Gemini Enterprise Agent Platform. Для активации достаточно установить параметр processing в значение "agentic" в конфигурации API. В ближайшие месяцы эта технология также будет использоваться в функции YouTube «Спросить YouTube», повышая качество ответов на вопросы о видеоконтенте.