Решение проблемы отсутствия данных
Основная сложность в обучении 3D-моделей для панорам — отсутствие размеченных данных. Команда разработала автоматический пайплайн курирования данных, который использует комбинацию foundation-моделей для генерации псевдо-меток. Процесс включает:
- Preprocess: Разбиение панорамы на 5 перспективных изображений и 15 кропов.
- Mask generation: Использование SAM3 для получения классово-аgnostic масок и PanSt3R для грубых семантических масок.
- Mask aggregation: Сопоставление масок через IoU для присвоения меток.
- VLM filtering: Фильтрация результатов через визуальные языковые модели (VLM) для удаления шумных предсказаний.
Архитектура и производительность
Модель PanoSeg3R работает по принципу "feed-forward", не требуя перенастройки (per-scene optimization) для каждой новой сцены. Она использует предобученный бэкбон Wid3R, query-based декодер и DPT-голову для извлечения признаков, а также ray-based модули для реконструкции 3D-геометрии.
Результаты тестирования демонстрируют значительное улучшение метрик по сравнению с существующими методами:
| Метрика / Датасет | Результат PanoSeg3R | Улучшение (Delta) |
|---|---|---|
| 3D mIoU на ScanNet++ | State-of-the-art | +16.02 |
| Zero-shot mIoU на Stanford2D3D | Улучшенный результат | +4.26 |
| Zero-shot mIoU на ToF-360 | Улучшенный результат | +43.28 |
Почему это важно
В отличие от таких моделей, как PanSt3R и IGGT, которые теряют геометрию и точность меток при обработке, PanoSeg3R сохраняет высокую точность, близкую к Ground Truth. Использование курированных данных из датасетов Realsee3D и OmniScenes позволяет модели эффективно обобщать знания (zero-shot generalization), что критически важно для применения в робототехнике и дополненной реальности, где данные часто не имеют ручной разметки.
Источник: Github ↗
