AI News Watcher
Tuesday, Sep 1, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Sep 01, 2026 · 1 min read · ElevenLabs ← Back to feed

Gemini сам сканирует видео: до 88% меньше токенов и выше точность daily

Модель динамически обрабатывает записи с помощью выполнения кода — и уже доступна разработчикам.

Gemini сам сканирует видео: до 88% меньше токенов и выше точность
Редакция · Daily briefing

Видеоанализ через AI всегда требовал много ресурсов, а модели обрабатывали его покадрово. Теперь Gemini может динамически сканировать длинные записи, используя код для поиска нужных моментов. Это позволяет сократить затраты и повысить точность.

Google DeepMind представила «агентное» понимание видео для моделей Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Новая функция комбинирует мультимодальные возможности Gemini с выполнением кода. Это позволяет моделям динамически искать, сканировать и инспектировать длинные видео, включая аудио.

По сравнению со статичной обработкой, где модель анализирует видео с фиксированной частотой кадров (по умолчанию 1 FPS), агентный подход дает преимущества:

Выполнение кода позволяет модели генерировать и запускать Python-код, итеративно обучаясь на результатах до получения финального ответа. Это дает возможность использовать логику на основе кода для решения задач и обработки текста.

Благодаря динамическому сканированию, Gemini теперь умеет:

Функция доступна разработчикам уже сегодня через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Видео можно загружать различными способами: через File API (до 20 ГБ для платных аккаунтов, 2 ГБ для бесплатных), регистрацию в Cloud Storage (до 2 ГБ на файл), как встроенные данные (до 100 МБ) или по ссылкам на YouTube.

«Агентное» понимание видео через выполнение кода — это попытка решить проблему избыточных затрат при работе с длинными видео. Модель теперь сама определяет, какие фрагменты анализировать, что делает процесс более эффективным. При этом заявленные улучшения по токенам и стоимости — это значения «до», фактические показатели будут зависеть от сценария использования.

Дополнительные источники

  1. https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
  2. https://ai.google.dev/gemini-api/docs/code-execution
  3. https://ai.google.dev/gemini-api/docs/video-understanding
  4. google.com
  5. deepmind.google

Источники

  1. https://x.com/thorwebdev/status/2094853530284597641 external
→ Опубликовано в Telegram: @agentic_ai_news/966