Революция в эффективности: цифры и метрики
Google DeepMind официально запустила функцию agentic video understanding (агентное понимание видео) для моделей Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite. В отличие от традиционного статического анализа, где видео обрабатывается с фиксированной частотой кадров (обычно 1 FPS), новая система позволяет модели самостоятельно решать, какие фрагменты смотреть, с какой скоростью и через какой модальности (кадры, аудио или транскрипт).
Ключевые результаты внедрения на бенчмарках:
- Снижение потребления токенов: до 88%.
- Снижение стоимости: до 66%.
- Рост точности: до 7%.
Особенно заметен прирост эффективности на длинных видео (от 10-минутных инструкций до 90-минутных лекций), где статический подход ранее требовал либо огромных затрат, либо приводил к потере важных деталей.
Как это работает технически
Механизм работает через агентный цикл (agentic loop). Модель Gemini использует свои нативные видеоинструменты для динамического поиска и сканирования целевых сегментов. Она может:
- Выделять моменты с высокой частотой кадров (FPS) для анализа быстрых движений или аномалий.
- Использовать транскрипцию для поиска ключевых слов в длинных видео.
- Переключаться между модальностями в зависимости от задачи.
Это устраняет необходимость ручной настройки разработчиками параметров выборки кадров, значительно снижая сложность интеграции.
Сравнение производительности моделей
Google позиционирует Gemini 3.7 Flash как лидера по соотношению «точность/стоимость» (accuracy-to-cost pareto frontier). Ниже приведена сводка по поддерживаемым моделям и их возможностям с новой функцией:
| Модель | Ключевая характеристика | Оптимальное применение |
|---|---|---|
| Gemini 3.7 Flash | Лучшее качество и баланс стоимости | Сложный анализ, needle-in-a-haystack, точное подсчет объектов |
| Gemini 3.6 Flash | Высокая эффективность | Стандартный анализ видео, мониторинг |
| Gemini 3.5 Flash-Lite | Максимальная легковесность | Быстрые запросы, ограниченные ресурсы |
Практические кейсы использования
Функция открывает новые возможности для разработчиков:
- Поиск моментов (Sub-second moment retrieval): Точное определение границ склеек и изменений состояния в видео, что критично для автоматического монтажа.
- Поиск «иголки в стоге сена»: Ответы на сложные вопросы по многочасовым записям без потребления миллионов токенов.
- Обнаружение аномалий: Динамическое увеличение FPS для анализа резких движений или визуальных артефактов.
- Подсчет объектов и действий: Точное отслеживание повторяющихся физических движений во времени.
Как начать использовать
Функция доступна через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Для активации необходимо установить параметр processing: "agentic" в конфигурации запроса. Дополнительной платы за функцию нет, используется стандартное ценообразование токенов Gemini API.
Пример кода на Python:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic" # Включение агентного режима
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
]
)
print(interaction.output_text)
Также функция будет интегрирована в приложение Gemini для миллиардов пользователей и в функцию «Ask YouTube» на странице просмотра видео в ближайшие месяцы.
Источник: Goo ↗
