Пардигмальный сдвиг: от задач к универсальному интеллекту
Команда Google DeepMind во главе с Каймингом Хэ (Kaiming He) и Эндрю Зиссерманом (Andrew Zisserman) представила GenCeption — архитектуру, которая переосмысливает роль видео-генеративных моделей. В отличие от традиционных подходов, где для каждой задачи (глубина, сегментация, трекинг) обучается отдельная сеть, GenCeption использует предварительно обученную видео-генеративную диффузионную модель как базу для извлечения представлений. Затем она адаптируется в feed-forward (однопроходную) модель, способную решать широкий спектр зрительных задач по текстовым инструкциям.
Это знаменует переход от эры специализированных CV-моделей к эре универсального зрительного интеллекта, аналогично тому, как NLP перешла от узких задач к большим языковым моделям. Модель демонстрирует emergent behaviors (эмерджентные свойства): она способна к zero-shot переносу из симуляции в реальность и обобщению на невидимые категории объектов.
Архитектура и эффективность данных
GenCeption объединяет плотные (dense) и разреженные (sparse) задачи в едином пространстве. Плотные задачи решаются в RGB-пространстве с эффективным обучением в латентном пространстве, а разреженные — через добавляемые обучаемые токены в диффузионный трансформер (DiT). Ключевое преимущество — высокая эффективность данных. При сопоставимом объеме данных для дообучения (fine-tuning) генеративный бэкбон превосходит альтернативы, такие как V-JEPA и VideoMAE V2.
Сравнение с SOTA-специалистами
GenCeption показывает результаты, сопоставимые или превосходящие узкоспециализированные модели, обученные на отдельных задачах. Ниже приведено сравнение ключевых характеристик и результатов:
| Характеристика / Модель | GenCeption (Generalist) | Специализированные SOTA (Specialists) |
|---|---|---|
| Архитектура | Единая feed-forward модель на базе DiT | Отдельные модели (DepthAnything3, SAM3, D4RT и др.) |
| Объем данных для fine-tuning | В 7–500 раз меньше, чем у конкурентов | Требуют значительных объемов размеченных данных |
| Симуляция → Реальность (Sim-to-Real) | Zero-shot перенос без дополнительной донастройки | Часто требуют адаптации или дообучения |
| Обобщение на новые категории | Работает с невидимыми объектами (ракеты, животные) | Ограничены категориями обучающей выборки |
| Взаимодействие с языком | Нативное выравнивание Vision-Language | Требуют дополнительных модулей (CLIP и др.) |
Ключевые возможности и эмерджентные свойства
Модель демонстрирует удивительную способность к обобщению, обучаясь преимущественно на синтетических данных:
- Grounded 4D Reconstruction: Предсказание пиксельной геометрии и позы камеры из одного видео, позволяющее создавать 4D-облака точек и свободный просмотр сцены.
- Understanding Complex Visual World: Устойчивое предсказание 4D-ключевых точек человека в сложных условиях (окклюзия, эгоцентричный вид, множественные ракурсы).
- Zero-shot Generalization: Обученная только на синтетических видео с одним объектом, модель успешно работает с несколькими экземплярами в реальном мире. Обученная только на людях, она сегментирует животных и роботов.
Значение для индустрии
Работа, принятая к публикации в ECCV 2026, предлагает новый путь развития компьютерного зрения. Вместо создания сотен узких моделей, индустрия может двигаться к созданию единых «зрительных мозгов», которые понимают мир так же гибко, как люди, используя текстовые инструкции для переключения между задачами. Это критически важно для робототехники, AR/VR и автономных систем, где требуется быстрая адаптация к новым условиям без переобучения.
Источник: Github ↗
