Релиз модели2 сентября 2026 г., 01:46 МСК🤖 Auto

Gemini 3.7 Flash: агентный анализ видео снизил расход токенов на 88%

Google DeepMind представила функцию агентного понимания видео для моделей Gemini 3.x. Технология динамически сканирует контент, сокращая затраты на токены до 88% и повышая точность на 7%.

Баннер новости 6541

Революция в эффективности: цифры и метрики

Google DeepMind официально запустила функцию agentic video understanding (агентное понимание видео) для моделей Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite. В отличие от традиционного статического анализа, где видео обрабатывается с фиксированной частотой кадров (обычно 1 FPS), новая система позволяет модели самостоятельно решать, какие фрагменты смотреть, с какой скоростью и через какой модальности (кадры, аудио или транскрипт).

Ключевые результаты внедрения на бенчмарках:

  • Снижение потребления токенов: до 88%.
  • Снижение стоимости: до 66%.
  • Рост точности: до 7%.

Особенно заметен прирост эффективности на длинных видео (от 10-минутных инструкций до 90-минутных лекций), где статический подход ранее требовал либо огромных затрат, либо приводил к потере важных деталей.

Как это работает технически

Механизм работает через агентный цикл (agentic loop). Модель Gemini использует свои нативные видеоинструменты для динамического поиска и сканирования целевых сегментов. Она может:

  • Выделять моменты с высокой частотой кадров (FPS) для анализа быстрых движений или аномалий.
  • Использовать транскрипцию для поиска ключевых слов в длинных видео.
  • Переключаться между модальностями в зависимости от задачи.

Это устраняет необходимость ручной настройки разработчиками параметров выборки кадров, значительно снижая сложность интеграции.

Сравнение производительности моделей

Google позиционирует Gemini 3.7 Flash как лидера по соотношению «точность/стоимость» (accuracy-to-cost pareto frontier). Ниже приведена сводка по поддерживаемым моделям и их возможностям с новой функцией:

Модель Ключевая характеристика Оптимальное применение
Gemini 3.7 Flash Лучшее качество и баланс стоимости Сложный анализ, needle-in-a-haystack, точное подсчет объектов
Gemini 3.6 Flash Высокая эффективность Стандартный анализ видео, мониторинг
Gemini 3.5 Flash-Lite Максимальная легковесность Быстрые запросы, ограниченные ресурсы

Практические кейсы использования

Функция открывает новые возможности для разработчиков:

  • Поиск моментов (Sub-second moment retrieval): Точное определение границ склеек и изменений состояния в видео, что критично для автоматического монтажа.
  • Поиск «иголки в стоге сена»: Ответы на сложные вопросы по многочасовым записям без потребления миллионов токенов.
  • Обнаружение аномалий: Динамическое увеличение FPS для анализа резких движений или визуальных артефактов.
  • Подсчет объектов и действий: Точное отслеживание повторяющихся физических движений во времени.

Как начать использовать

Функция доступна через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Для активации необходимо установить параметр processing: "agentic" в конфигурации запроса. Дополнительной платы за функцию нет, используется стандартное ценообразование токенов Gemini API.

Пример кода на Python:

from google import genai
client = genai.Client()
interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"  # Включение агентного режима
        },
        {
            "type": "text",
            "text": "What are the 3 most important announcements in this keynote?",
        },
    ]
)
print(interaction.output_text)

Также функция будет интегрирована в приложение Gemini для миллиардов пользователей и в функцию «Ask YouTube» на странице просмотра видео в ближайшие месяцы.

Источник: Goo ↗