Видеоанализ через AI всегда требовал много ресурсов, а модели обрабатывали его покадрово. Теперь Gemini может динамически сканировать длинные записи, используя код для поиска нужных моментов. Это позволяет сократить затраты и повысить точность.
Google DeepMind представила «агентное» понимание видео для моделей Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Новая функция комбинирует мультимодальные возможности Gemini с выполнением кода. Это позволяет моделям динамически искать, сканировать и инспектировать длинные видео, включая аудио.
По сравнению со статичной обработкой, где модель анализирует видео с фиксированной частотой кадров (по умолчанию 1 FPS), агентный подход дает преимущества:
- Токены — сокращение до 88%
- Стоимость — снижение до 66%
- Точность — улучшение до 7%
Выполнение кода позволяет модели генерировать и запускать Python-код, итеративно обучаясь на результатах до получения финального ответа. Это дает возможность использовать логику на основе кода для решения задач и обработки текста.
Благодаря динамическому сканированию, Gemini теперь умеет:
- Извлекать моменты с точностью до доли секунды.
- Точнее обнаруживать аномалии.
- Точно подсчитывать объекты или события.
Функция доступна разработчикам уже сегодня через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Видео можно загружать различными способами: через File API (до 20 ГБ для платных аккаунтов, 2 ГБ для бесплатных), регистрацию в Cloud Storage (до 2 ГБ на файл), как встроенные данные (до 100 МБ) или по ссылкам на YouTube.
«Агентное» понимание видео через выполнение кода — это попытка решить проблему избыточных затрат при работе с длинными видео. Модель теперь сама определяет, какие фрагменты анализировать, что делает процесс более эффективным. При этом заявленные улучшения по токенам и стоимости — это значения «до», фактические показатели будут зависеть от сценария использования.