От «слепого» просмотра к навигации
Ранее модели Gemini обрабатывали видео статично: загружали весь таймлайн с фиксированной частотой 1 кадр в секунду (FPS), независимо от сложности запроса. Это приводило к перерасходу контекста. Новый Agentic Video Understanding заменяет этот подход на итеративный цикл: модель использует встроенные инструменты для поиска, сканирования и детального анализа целевых сегментов, загружая только то, что необходимо для ответа.
Ключевые метрики эффективности
По данным Google, внедрение агентного режима позволяет существенно оптимизировать затраты и улучшить качество анализа, особенно на длинных видео. Сравнение результатов приведено в таблице ниже:
| Метрика | Результат | Примечание |
|---|---|---|
| Снижение токенов | до 88% | За счет загрузки только релевантных фрагментов |
| Снижение стоимости | до 66% | Прямое следствие экономии токенов |
| Точность (Accuracy) | до +7% | На стандартных бенчмарках видеоанализа |
Техническая реализация и тарификация
Функция доступна через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. В ответе API добавляются новые шаги (processing_call и processing_result), позволяющие отслеживать процесс анализа в реальном времени. Тарификация разделена:
- Thought tokens (
total_thought_tokens): оплачивается логика навигации и рассуждения модели. - Tool-use tokens (
total_tool_use_tokens): оплачивается загрузка кадров, аудио и транскриптов по запросу.
Поддержка и ограничения
Агентный режим поддерживается в моделях Gemini 3.8, 3.7, 3.6 Flash и 3.5 Flash-Lite. Включается одним полем "processing": "agentic" в запросе. Важно отметить, что для коротких видео (менее 5 минут) или задач, требующих точности по каждому кадру, статический режим обработки остается более предпочтительным. Открытых весов для локального развертывания нет — решение доступно только как облачный API.
Источник: MarkTechPost ↗
