Релиз модели2 сентября 2026 г., 17:46 МСК🤖 Auto

Google Gemini 3.7 Flash: агентный анализ видео снижает затраты на 66%

Google DeepMind представила функцию «агентного» анализа видео для моделей Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Технология динамически сканирует кадры, экономя до 88% токенов и повышая точность на 7%.

Баннер новости 6600

Революция в эффективности: цифры и метрики

Google официально запустила функцию agentic video understanding (агентное понимание видео) в своих последних моделях: Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. В отличие от традиционного статического анализа, где видео обрабатывается с фиксированной частотой кадров (по умолчанию 1 FPS), новая технология позволяет модели самостоятельно решать, какие фрагменты, с какой скоростью и через какой модальность (кадры, аудио или транскрипт) нужно проанализировать.

Ключевые результаты внедрения на бенчмарках:

  • Снижение потребления токенов: до 88%.
  • Снижение стоимости: до 66%.
  • Рост точности: до 7%.

Особенно заметен прирост эффективности на длинных видео (от 10-минутных инструкций до 90-минутных лекций), где статический подход ранее требовал либо огромных затрат, либо приводил к потере важных деталей.

Техническая реализация и сравнение моделей

Новый подход использует «агентный цикл», в котором модель вызывает внутренние инструменты для загрузки и инспекции релевантных частей видеофайла. Это устраняет необходимость ручной настройки разработчиками. Среди трех поддерживаемых моделей, Gemini 3.7 Flash демонстрирует наилучшее соотношение качества и стоимости, находясь на «парето-фронте» точности и эффективности.

Модель Ключевая характеристика Роль в экосистеме
Gemini 3.7 Flash Лучшее качество и эффективность Оптимальный выбор для сложных задач и длинных видео
Gemini 3.6 Flash Баланс производительности Стандартное решение для большинства задач
Gemini 3.5 Flash-Lite Минимальные затраты Для простых запросов и ограниченных бюджетов

Новые возможности: от поиска иголки до детекции аномалий

Агентный анализ открывает новые сценарии использования, недоступные при статической обработке:

  • Поиск моментов с точностью до субсекунды: Модель может находить точные границы склеек и изменения состояния, что критично для автоматического монтажа.
  • Поиск «иголки в стоге сена»: Ответы на сложные вопросы по многочасовым записям без потребления миллионов токенов.
  • Детекция аномалий: Автоматическое увеличение частоты кадров (FPS) для анализа быстрых движений или визуальных артефактов.
  • Подсчет объектов и действий: Точное отслеживание повторяющихся физических движений во времени.

Как подключиться и будущее продукта

Функция доступна через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Для активации достаточно установить параметр обработки в значение "agentic". Дополнительной платы за функцию нет, используется стандартное ценообразование по токенам.

Пример кода для Python:

from google import genai
client = genai.Client()
interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"  # Включение агентного режима
        },
        {
            "type": "text",
            "text": "What are the 3 most important announcements in this keynote?",
        },
    ]
)
print(interaction.output_text)

Google также анонсировала rollout этой функции для миллиардов пользователей в приложении Gemini (Flash и Flash-Lite) и интеграцию в функцию «Ask YouTube» на странице просмотра видео в ближайшие месяцы.

Источник: Blog ↗