Проблема текущих решений
Современные модели сегментации, включая SAM 3, часто теряют цель при выходе из кадра, фрагментируют её при экстремальных ракурсах или путают реальные объекты с их двойниками (статуями, отражениями, картинами). ENEAS (Embedding-guided Neural Ensemble for Adaptive Segmentation) решает эту проблему, объединяя точный трекинг и семантическое открытие в едином методе, управляемом естественным языком.
Два режима работы
Модель принимает текстовый промпт и набор кадров (видео или упорядоченные/неупорядоченные изображения), возвращая маски сегментации. Архитектура работает в двух ключевых направлениях:
- Instance Tracking (Отслеживание экземпляра): Модель следит за одним конкретным объектом через окклюзии и изменения масштаба. Ключевая особенность — способность «вспоминать» объект, если он покинул кадр и вернулся, не путая его с похожими фигурами.
- Semantic Discovery (Семантическое открытие): Поиск всех объектов заданной категории. ENEAS фильтрует «двойников», исключая из результата статуи, картины или отражения, которые визуально похожи на целевой объект, но не являются им.
Результаты бенчмарков SA-Co/VEval
Сравнение проводилось под официальным оценщиком SAM 3. ENEAS демонстрирует преимущество в метриках ассоциации (AssA) и общей точности (HOTA) при отслеживании, что критично для стабильности трекинга. В семантическом поиске результаты сопоставимы, но ENEAS выигрывает в стабильности ассоциации.
| Метрика | ENEAS (Instance Tracking) | SAM 3 (Instance Tracking) |
|---|---|---|
| HOTA (%) | 26.70 | 26.51 |
| DetA (%) | 7.92 | 7.84 |
| AssA (%) | 90.77 | 90.18 |
| LocA (%) | 87.86 | 89.26 |
| TETA (%) | 17.86 | 16.65 |
| Метрика | ENEAS (Semantic Discovery) | SAM 3 (Semantic Discovery) |
|---|---|---|
| HOTA (%) | 9.23 | 9.19 |
| DetA (%) | 6.16 | 6.21 |
| AssA (%) | 14.28 | 13.85 |
| LocA (%) | 74.25 | 75.38 |
| TETA (%) | 9.53 | 9.10 |
Визуальное сравнение
В демонстрационных материалах показано, что при запросе "nearest guy with a gun" или "soldier outside the line", ENEAS корректно выделяет целевые объекты, игнорируя фоновые элементы и похожие силуэты, в то время как SAM 3 может давать ложные срабатывания на статичных объектах или терять связь с целью при движении.
Доступность
Работа опубликована в arXiv (arXiv:2609.03756) авторами Javier del Pino, Salvador Rodríguez, Alejandro Garabito, Javier Álvarez и Chema Garabito. Код и демо-пространства доступны на сайте Speridlabs.
Источник: Speridlabs ↗
