Проблема масштабирования SAM2
Хотя SAM2 демонстрирует выдающиеся результаты в сегментации одиночных объектов, его архитектура не масштабируется для сцен с множеством целей. Стандартный подход требует повторного прохода (propagation) для каждого объекта, что приводит к линейному росту задержки и потребления видеопамяти. Это делает систему непригодной для интерактивного использования в сложных сценариях, где пользователь выделяет сразу несколько объектов.
Архитектурные инновации SAM-MT
Команда разработала SAM-MT, переосмыслив подход SAM2 от объектно-ориентированного распространения к query-driven (запросно-управляемой) модели. Ключевые технические решения:
- Shared Global Context: Плотная память (dense memory) SAM2 используется однократно для моделирования общего контекста сцены, а не для каждого объекта отдельно.
- Decoupled Masked Attention: Механизм внимания, который позволяет всем целевым запросам (target queries) обращаться к общему контексту, но блокирует прямое взаимодействие между разными целями. Это предотвращает «перекрестные помехи» (cross-target interference).
- Sparse Memory & Identity Transformer: Исторические данные сохраняются в виде легких запросов в FIFO-памяти, а не пиксельных признаков. Identity Transformer обновляет каждый объект только на основе его собственной истории, исключая дрейф идентичности (identity drift).
Производительность и метрики
Главное преимущество SAM-MT — независимость скорости от количества целей. Система сохраняет интерактивную частоту кадров даже при работе с десятками объектов. Ниже приведено сравнение эффективности по сравнению с базовым подходом:
| Метрика | SAM2 (Multi-target via repetition) | SAM-MT (Proposed) |
|---|---|---|
| Скорость (FPS) при 20 целях | Критически низкая (нереально для real-time) | 35+ FPS |
| Потребление VRAM | Растет линейно с числом целей | Низкое, стабильное |
| Масштабируемость | Плохая (зависит от N) | Высокая (decoupled latency) |
Значение для индустрии
Результаты тестов на бенчмарках VOS показывают, что SAM-MT не только быстрее, но и сохраняет качество сегментации, сопоставимое с состоянием искусства. Способность системы точно отслеживать и сегментировать множество объектов в «загруженных» сценах (crowded scenes) открывает новые возможности для интерактивных видео-редакторов, систем видеонаблюдения и робототехники, где критически важна скорость реакции и точность разделения объектов.
Работа опубликована в ECCV 2026 и доступна на arXiv. Код и демо-версия модели уже опубликованы авторами.
Источник: Henghuiding ↗
