Релиз модели13 июля 2026 г., 19:46 МСК🤖 Auto

GenCeption от Google DeepMind: видео-генератор как универсальный зритель

Google DeepMind представила GenCeption — модель, превращающую текстово-видео генераторы в единый feed-forward зрительный интеллект, превосходящий специализированные SOTA-решения при использовании в 7–500 раз меньше данных.

Баннер новости 3474

Пардигмальный сдвиг: от задач к универсальному интеллекту

Команда Google DeepMind во главе с Каймингом Хэ (Kaiming He) и Эндрю Зиссерманом (Andrew Zisserman) представила GenCeption — архитектуру, которая переосмысливает роль видео-генеративных моделей. В отличие от традиционных подходов, где для каждой задачи (глубина, сегментация, трекинг) обучается отдельная сеть, GenCeption использует предварительно обученную видео-генеративную диффузионную модель как базу для извлечения представлений. Затем она адаптируется в feed-forward (однопроходную) модель, способную решать широкий спектр зрительных задач по текстовым инструкциям.

Это знаменует переход от эры специализированных CV-моделей к эре универсального зрительного интеллекта, аналогично тому, как NLP перешла от узких задач к большим языковым моделям. Модель демонстрирует emergent behaviors (эмерджентные свойства): она способна к zero-shot переносу из симуляции в реальность и обобщению на невидимые категории объектов.

Архитектура и эффективность данных

GenCeption объединяет плотные (dense) и разреженные (sparse) задачи в едином пространстве. Плотные задачи решаются в RGB-пространстве с эффективным обучением в латентном пространстве, а разреженные — через добавляемые обучаемые токены в диффузионный трансформер (DiT). Ключевое преимущество — высокая эффективность данных. При сопоставимом объеме данных для дообучения (fine-tuning) генеративный бэкбон превосходит альтернативы, такие как V-JEPA и VideoMAE V2.

Сравнение с SOTA-специалистами

GenCeption показывает результаты, сопоставимые или превосходящие узкоспециализированные модели, обученные на отдельных задачах. Ниже приведено сравнение ключевых характеристик и результатов:

Характеристика / Модель GenCeption (Generalist) Специализированные SOTA (Specialists)
Архитектура Единая feed-forward модель на базе DiT Отдельные модели (DepthAnything3, SAM3, D4RT и др.)
Объем данных для fine-tuning В 7–500 раз меньше, чем у конкурентов Требуют значительных объемов размеченных данных
Симуляция → Реальность (Sim-to-Real) Zero-shot перенос без дополнительной донастройки Часто требуют адаптации или дообучения
Обобщение на новые категории Работает с невидимыми объектами (ракеты, животные) Ограничены категориями обучающей выборки
Взаимодействие с языком Нативное выравнивание Vision-Language Требуют дополнительных модулей (CLIP и др.)

Ключевые возможности и эмерджентные свойства

Модель демонстрирует удивительную способность к обобщению, обучаясь преимущественно на синтетических данных:

  • Grounded 4D Reconstruction: Предсказание пиксельной геометрии и позы камеры из одного видео, позволяющее создавать 4D-облака точек и свободный просмотр сцены.
  • Understanding Complex Visual World: Устойчивое предсказание 4D-ключевых точек человека в сложных условиях (окклюзия, эгоцентричный вид, множественные ракурсы).
  • Zero-shot Generalization: Обученная только на синтетических видео с одним объектом, модель успешно работает с несколькими экземплярами в реальном мире. Обученная только на людях, она сегментирует животных и роботов.

Значение для индустрии

Работа, принятая к публикации в ECCV 2026, предлагает новый путь развития компьютерного зрения. Вместо создания сотен узких моделей, индустрия может двигаться к созданию единых «зрительных мозгов», которые понимают мир так же гибко, как люди, используя текстовые инструкции для переключения между задачами. Это критически важно для робототехники, AR/VR и автономных систем, где требуется быстрая адаптация к новым условиям без переобучения.

Источник: Github ↗