Долгое время видео оставалось самым «дорогим» и сложным модальным типом данных для обработки искусственным интеллектом. Представьте себе ситуацию: вы передаете модели Gemini 90-минутную лекцию. До недавнего времени архитектура была жесткой — система поглощала весь контент с фиксированной частотой в один кадр в секунду (1 FPS). Эта стратегия не делала различий между задачами: будь то простой запрос на суммирование содержания или сложный вопрос о том, в какой именно момент времени спикер переходит к слайду с ценообразованием, модель была вынуждена обрабатывать весь хронометраж одинаково. Такой однократный проход (single-pass design) создавал вынужденный компромисс: либо вы платите за полный контекст всей временной шкалы, что приводит к огромным расходам, либо предварительно разбиваете видео на фрагменты, рискуя упустить критически важные детали, которые могли бы содержаться в пропущенных интервалах.
Эта проблема была фундаментальной для индустрии, так как она ограничивала масштабируемость видеоаналитики. Однако на этой неделе Google DeepMind совершил качественный скачок, запустив функцию агентного понимания видео (agentic video understanding) в своих моделях серии Flash. Вместо того чтобы механически поглощать временную шкалу, новая архитектура позволяет модели Gemini «навигировать» по видео. Она самостоятельно решает, какие фрагменты стоит посмотреть, с какой частотой кадров это делать и через какой модальность (визуальную, аудио или текстовую транскрипцию) извлекать информацию. По заявлениям Google, этот подход позволяет сократить количество используемых токенов до 88%, снизить стоимость обработки до 66% и повысить точность на стандартных бенчмарках видеоанализа до 7%.
Но является ли эта технология готовой к немедленному развертыванию в продакшене? Ответ требует нюансов. Да, она доступна, но исключительно как функция хостингового API. На данный момент нет открытых весов (open weights) для самостоятельного хостинга на собственных серверах. Функция поставляется через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, поддерживая как загрузку файлов, так и прямые ссылки на публичные видео YouTube. При этом тарификация происходит по стандартным ставкам Gemini API за токены, без дополнительных наценок за саму функцию агентного режима.
01Что именно изменилось в архитектуре обработки
Чтобы понять масштаб инновации, нужно сравнить старый и новый подходы. Статическая обработка, которая остается режимом по умолчанию для всех моделей Gemini, работает по принципу извлечения кадров с частотой 1 FPS в один проход. Аудио при этом обрабатывается с битрейтом 1 кбит/с в одном канале, а временные метки вставляются каждую секунду. Это простой, но неэффективный метод для длинных видео.
Агентная обработка заменяет этот линейный процесс на итеративный цикл (loop). Модель сочетает собственное рассуждение (reasoning) с нативными инструментами видеоанализа. Она может искать, сканировать и детально изучать целевые сегменты, переключаясь между кадрами, аудио и текстовыми транскриптами, загружая только то, что требуется для ответа на конкретный промпт. Разработчики уже могли собрать подобную логику вручную, используя доступные инструменты, но ключевое изменение заключается в том, что теперь Gemini выполняет этот цикл внутренне. Это устраняет значительную часть накладных расходов на разработку и отладку сложных пайплайнов обработки видео.
В ходе внутренних оценок Google, модель Gemini 3.7 Flash с включенным агентным пониманием вышла на границу Парето (Pareto frontier) по соотношению точности и стоимости среди всех протестированных моделей. Эффективность этих улучшений особенно ярко проявляется на длинном контенте: от 10-минутных инструкций «как сделать» (how-to guides) до многочасовых записей конференций или лекций.

02Как устроен ответ API: шаги и токены
Для разработчиков, интегрирующих эту функцию в свои приложения, важно понимать структуру ответа. Агентная обработка добавляет два новых типа шагов в массив steps ответа API:
- processing_call: Этот шаг появляется, когда модель запрашивает определенный сегмент видео или транскрипцию. Это сигнал о том, что модель «решила» посмотреть конкретный фрагмент.
- processing_result: Соответствующий шаг, который возвращается после завершения загрузки и обработки запрошенного сегмента.
Эти шаги чередуются с шагами thought (рассуждение модели) и предшествуют финальному model_output. Такая структура позволяет разработчикам отрисовывать в пользовательском интерфейсе (UI) живую трассировку прогресса, показывая пользователю, что именно сейчас анализирует ИИ. Кроме того, наличие этих шагов служит надежным индикатором того, что агентный режим действительно был активирован и выполнен.
Также важно правильно учитывать токены, так как тарификация разделяется:
- Thought tokens (total_thought_tokens): Биллингуется навигационное рассуждение. То есть, когда модель думает, куда пойти дальше в видео, это считается токенами рассуждения.
- Tool-use tokens (total_tool_use_tokens): Биллингуются кадры, аудио и транскрипты, загружаемые по требованию. Это стоимость самого «просмотра» контента.

Понимание этой разницы критично для оптимизации бюджета. Если модель тратит много времени на рассуждения, но мало на загрузку контента, вы платите за «ум», а не за «глаза».
03Техническая реализация: как включить режим
Включение агентного режима удивительно просто — это всего одно поле в параметрах видео. Ниже приведен пример кода запроса к модели gemini-3.7-flash, где явно указан режим обработки "agentic".
{
"model": "gemini-3.7-flash",
"input": [
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?"
}
]
}Интересной возможностью является смешивание режимов в одном запросе. Вы можете указать агентную обработку для длинной лекции и статическую обработку для короткого клипа в рамках одного вызова API. Это дает гибкость в управлении затратами и точностью для мультимедийных проектов.
04Практические примеры использования
Где именно эта технология находит применение? Рассмотрим несколько сценариев, где агентный подход дает явное преимущество перед статическим анализом.
1. Анализ корпоративных встреч и лекций
Представьте, что HR-отдел компании загружает запись 2-часового тренинга по безопасности. При статическом режиме модель должна была бы проанализировать все 7200 секунд с частотой 1 кадр/сек, что потребовало бы огромного количества токенов. С агентным режимом модель может сначала быстро просканировать оглавление или транскрипцию, найти моменты, связанные с ключевыми терминами (например, «data breach» или «password policy»), и затем детально проанализировать только эти сегменты. Это не только дешевле, но и точнее, так как модель не отвлекается на irrelevant content, такой как паузы или технические настройки камеры.

2. Поиск информации в обучающих видео
Студент загружает 45-минутный курс по Python. Вопрос: «В каком таймкоде объясняется работа с декораторами?». Агентная модель не будет просматривать весь курс равномерно. Она будет использовать транскрипцию для поиска ключевых слов, а затем проверять визуальный контекст (код на экране) только в найденных фрагментах. Это экономит время и деньги, предоставляя точный ответ с таймкодом.
3. Модерация контента
Для платформ, где требуется модерация пользовательского контента, агентный режим позволяет фокусироваться на подозрительных участках. Вместо анализа каждого кадра рекламного ролика, модель может сначала оценить общий тон и аудио, а затем детально проверить только те секунды, где есть аномалии в визуальном ряде или звуке.
05Ограничения и риски
Несмотря на очевидные преимущества, важно учитывать ограничения. Во-первых, отсутствие локального хостинга означает, что данные видео обрабатываются на серверах Google. Для компаний с жесткими требованиями к конфиденциальности данных (например, в сфере здравоохранения или финансов) это может быть критичным фактором. Хотя Gemini Enterprise Agent Platform предлагает корпоративные гарантии, передача видео в облако всегда несет определенные риски.
Во-вторых, сложность запросов. Хотя API упростил включение режима, понимание того, как модель принимает решения о навигации, может быть неочевидным. Разработчикам может потребоваться итеративная настройка промптов, чтобы направлять модель к более эффективному использованию ресурсов. Например, если промпт слишком общий, модель может потратить много токенов на «блуждание» по видео, прежде чем найти ответ.
steps, чтобы убедиться, что агентный режим сработал корректно. Если вы видите только thought и model_output без processing_call и processing_result, возможно, модель решила, что статического анализа достаточно, или возникла ошибка в запросе.06Что это значит на практике
Запуск агентного понимания видео в моделях Gemini Flash знаменует собой переход от пассивной обработки медиа к активному интеллектуальному взаимодействию с контентом. Для бизнеса это означает возможность анализировать часы видео за доли стоимости и времени, что ранее было экономически нецелесообразно. Для разработчиков это открывает новые возможности для создания приложений, которые могут «смотреть» и «слушать» видео так же гибко, как человек, фокусируясь на важном и игнорируя шум.
Однако, как и любая новая технология, она требует осторожного внедрения. Необходимо тщательно тестировать затраты, мониторить использование токенов и учитывать вопросы конфиденциальности данных. Тем не менее, с поддержкой широкого спектра моделей Flash и простой интеграцией через API, Google делает этот мощный инструмент доступным для широкой аудитории. Если вы работаете с длинными видео, игнорировать эту возможность было бы ошибкой — она может стать вашим главным конкурентным преимуществом в скорости и эффективности анализа контента.
Для тех, кто хочет глубже погрузиться в тему, рекомендуется изучить документацию Gemini API по видеоанализу, руководство разработчика в AI Studio и официальное объявление об агентном зрении на сайте Google. Также не забывайте следить за обновлениями в сообществе ML, так как эта область развивается очень быстро.
Источник: MarkTechPost ↗
