Проблема фрагментации данных
Понимание сцены требует одновременного ответа на множество вопросов: глубина, текстура, свет, семантика. Однако существующие датасеты фрагментированы. Геометрические данные (глубина, нормали) собираются с помощью RGB-D камер, но ограничены архитектурными интерьерами. Семантические аннотации дороги и редко совмещены с геометрией. Внутренние свойства (альбедо, затенение) почти полностью синтетичны. Расширение на видео делает проблему аннотационной нехватки критической.
Решение: UniD и дистилляция знаний
Команда представила UniD — унифицированную модель видео, которая jointly предсказывает 8 плотных свойств сцены за один прямой проход. Ключевое отличие: модель обучается на разрозненных, доменно-специфичных датасетах без перекрытия аннотаций. Вместо сложного псевдо-разметочного конвейера используется этап дистилляции: легковесные проекторы задач обучаются воспроизводить латенты, предсказанные замороженными экспертами-специалистами. Это позволяет использовать сильные визуальные приоритеты предварительно обученной диффузионной модели для преодоления разрывов между доменами.
Архитектура и инференс
Обучение проходит в два этапа. Сначала обучаются специалисты по каждой задаче. Затем унифицированный бэкбон G обучается вместе с латентными проекторами Ψ для реконструкции латентов специалистов. На этапе инференса видео обрабатывается через Extended Self-Attention (ESA), а унифицированное представление декодируется через проекторы для получения временнó согласованных предсказаний по всем задачам одновременно.
Результаты и сравнение
UniD демонстрирует конкурентоспособные результаты против специалистов по отдельным задачам и многозадачных базовых моделей, с сильной обобщающей способностью на out-of-distribution сценариях. Ниже приведено качественное сравнение предсказаний для ключевых задач на данных "in-the-wild" (вне домена обучения) по сравнению с базовой моделью DINOv3.
| Задача | Описание предсказания | Особенности UniD |
|---|---|---|
| Depth (Глубина) | Расстояние до объектов | Высокая точность в сложных сценариях |
| Surface Normals (Нормали) | Ориентация поверхностей | Согласованность с геометрией |
| Semantic Segmentation | Классификация пикселей по классам | Работа с редкими классами |
| Human Parts | Сегментация частей тела | Детализация анатомии |
| Albedo & Shading | Разделение цвета и освещения | Работа с синтетическими доменами |
| Materials | Сегментация материалов | Устойчивость к изменениям света |
Модель обеспечивает улучшенную временную и кросс-задачную согласованность, что критично для приложений в реальном времени и компьютерного зрения.
Источник: Github ↗
