Решение проблемы разрыва между трекингом и детализацией
Проблема видео-маттинга (video matting) долгое время заключалась в конфликте задач: высокочастотный трекинг требует понимания сцены, а низкочастотный маттинг — работы с пиксельными деталями. Существующие методы страдали от узкой специализации на дорогих датасетах, что ухудшало обобщающую способность (generalization). SAM2Matting решает это через декомпозицию: базовый трекер (VOS) отвечает за временную согласованность, а специализированные модули — за тонкую детализацию.
Архитектура: от маски к альфа-каналу
Метод использует фундаментальные трекеры (SAM2, SAM3) как основу. Процесс работает в два этапа:
- ROI Detector: Находит области, критичные для маттинга (полупрозрачность, мелкие детали), на основе маски от трекера и многомасштабных признаков изображения.
- Progressive Alpha Predictor: Итеративно уточняет альфа-матт в каскаде «от грубого к детальному». Промежуточные результаты контролируются на каждом масштабе, что позволяет захватывать мельчайшие детали волос или стекла.
Ключевое достижение: Zero-Shot Video Matting
Самое важное в работе SAM2Matting — модель обучалась только на изображениях. При этом она демонстрирует состояние искусства (SOTA) в видео-маттинге в режиме zero-shot (без дообучения на видео-данных). Это доказывает, что качественная сегментация и маттинг изображений могут быть перенесены на видео через надежный трекинг.
Количественные результаты и бенчмарки
Метод протестирован в трех вариантах на базе разных версий SAM. Результаты показывают превосходство над существующими baselines, особенно в сложных сценариях (in-the-wild, быстрые движения).
| Модель (База) | Тип задачи | Ключевая особенность | Результат |
|---|---|---|---|
| SAM2.1-T / SAM2.1-B+ / SAM3 | Image Matting | Обучение на изображениях | SOTA на бенчмарках |
| SAM2Matting (Zero-Shot) | Video Matting | Без дообучения на видео | Новый SOTA, высокая temporal consistency |
Метод поддерживает разнообразные типы промптов (prompt types) и позволяет выделять любые объекты открытого мира (open-world targets) в видео, сохраняя стабильность там, где базовые модели дают сбой.
Источник: Henghuiding ↗
