Релиз модели13 июля 2026 г., 17:45 МСК🤖 Auto

SAM-MT: Реальное время для мульти-объектов. Прорыв от Fudan University

Исследователи из Фуданьского университета представили SAM-MT — архитектуру на базе SAM2, которая позволяет сегментировать десятки объектов в видео одновременно без падения скорости, сохраняя 35+ FPS.

Баннер новости 3465

Проблема масштабирования SAM2

Хотя SAM2 демонстрирует выдающиеся результаты в сегментации одиночных объектов, его архитектура не масштабируется для сцен с множеством целей. Стандартный подход требует повторного прохода (propagation) для каждого объекта, что приводит к линейному росту задержки и потребления видеопамяти. Это делает систему непригодной для интерактивного использования в сложных сценариях, где пользователь выделяет сразу несколько объектов.

Архитектурные инновации SAM-MT

Команда разработала SAM-MT, переосмыслив подход SAM2 от объектно-ориентированного распространения к query-driven (запросно-управляемой) модели. Ключевые технические решения:

  • Shared Global Context: Плотная память (dense memory) SAM2 используется однократно для моделирования общего контекста сцены, а не для каждого объекта отдельно.
  • Decoupled Masked Attention: Механизм внимания, который позволяет всем целевым запросам (target queries) обращаться к общему контексту, но блокирует прямое взаимодействие между разными целями. Это предотвращает «перекрестные помехи» (cross-target interference).
  • Sparse Memory & Identity Transformer: Исторические данные сохраняются в виде легких запросов в FIFO-памяти, а не пиксельных признаков. Identity Transformer обновляет каждый объект только на основе его собственной истории, исключая дрейф идентичности (identity drift).

Производительность и метрики

Главное преимущество SAM-MT — независимость скорости от количества целей. Система сохраняет интерактивную частоту кадров даже при работе с десятками объектов. Ниже приведено сравнение эффективности по сравнению с базовым подходом:

Метрика SAM2 (Multi-target via repetition) SAM-MT (Proposed)
Скорость (FPS) при 20 целях Критически низкая (нереально для real-time) 35+ FPS
Потребление VRAM Растет линейно с числом целей Низкое, стабильное
Масштабируемость Плохая (зависит от N) Высокая (decoupled latency)

Значение для индустрии

Результаты тестов на бенчмарках VOS показывают, что SAM-MT не только быстрее, но и сохраняет качество сегментации, сопоставимое с состоянием искусства. Способность системы точно отслеживать и сегментировать множество объектов в «загруженных» сценах (crowded scenes) открывает новые возможности для интерактивных видео-редакторов, систем видеонаблюдения и робототехники, где критически важна скорость реакции и точность разделения объектов.

Работа опубликована в ECCV 2026 и доступна на arXiv. Код и демо-версия модели уже опубликованы авторами.

Источник: Henghuiding ↗