Релиз модели26 июля 2026 г., 19:46 МСК🤖 Auto

UniD: Единая модель для 8 задач видеоанализа без общих датасетов

Исследователи из Adobe и Cornell представили UniD — модель, которая предсказывает геометрию, семантику и материалы видео за один проход, обучаясь на разрозненных данных без псевдо-разметки.

Баннер новости 4428

Проблема фрагментации данных

Понимание сцены требует одновременного ответа на множество вопросов: глубина, текстура, свет, семантика. Однако существующие датасеты фрагментированы. Геометрические данные (глубина, нормали) собираются с помощью RGB-D камер, но ограничены архитектурными интерьерами. Семантические аннотации дороги и редко совмещены с геометрией. Внутренние свойства (альбедо, затенение) почти полностью синтетичны. Расширение на видео делает проблему аннотационной нехватки критической.

Решение: UniD и дистилляция знаний

Команда представила UniD — унифицированную модель видео, которая jointly предсказывает 8 плотных свойств сцены за один прямой проход. Ключевое отличие: модель обучается на разрозненных, доменно-специфичных датасетах без перекрытия аннотаций. Вместо сложного псевдо-разметочного конвейера используется этап дистилляции: легковесные проекторы задач обучаются воспроизводить латенты, предсказанные замороженными экспертами-специалистами. Это позволяет использовать сильные визуальные приоритеты предварительно обученной диффузионной модели для преодоления разрывов между доменами.

Архитектура и инференс

Обучение проходит в два этапа. Сначала обучаются специалисты по каждой задаче. Затем унифицированный бэкбон G обучается вместе с латентными проекторами Ψ для реконструкции латентов специалистов. На этапе инференса видео обрабатывается через Extended Self-Attention (ESA), а унифицированное представление декодируется через проекторы для получения временнó согласованных предсказаний по всем задачам одновременно.

Результаты и сравнение

UniD демонстрирует конкурентоспособные результаты против специалистов по отдельным задачам и многозадачных базовых моделей, с сильной обобщающей способностью на out-of-distribution сценариях. Ниже приведено качественное сравнение предсказаний для ключевых задач на данных "in-the-wild" (вне домена обучения) по сравнению с базовой моделью DINOv3.

Задача Описание предсказания Особенности UniD
Depth (Глубина) Расстояние до объектов Высокая точность в сложных сценариях
Surface Normals (Нормали) Ориентация поверхностей Согласованность с геометрией
Semantic Segmentation Классификация пикселей по классам Работа с редкими классами
Human Parts Сегментация частей тела Детализация анатомии
Albedo & Shading Разделение цвета и освещения Работа с синтетическими доменами
Materials Сегментация материалов Устойчивость к изменениям света

Модель обеспечивает улучшенную временную и кросс-задачную согласованность, что критично для приложений в реальном времени и компьютерного зрения.

Источник: Github ↗