Проблема классических Feature Pyramids
Традиционные иерархические структуры, такие как Feature Pyramid Network (FPN), используют только верхне-нисходящий путь (top-down). Это означает, что семантическая информация от глубоких слоев (высокий уровень абстракции) передается к мелким слоям. Однако этот процесс сопровождается значительной потерей пространственной информации из-за операций пулинга и стриджа. В результате, детекторы объектов часто испытывают трудности с точным определением границ объектов, особенно маленьких.
Решение: Нижне-восходящий путь (Bottom-Up Path)
Авторы PANet предлагают дополнить стандартную FPN новым направлением потока данных — снизу вверх. Этот путь позволяет передавать богатые пространственные детали от низких уровней сети (где высокая точность локализации) к высоким уровням (где сильная семантика). Ключевым элементом здесь является блок Low-Level Feature Refinement (LLFR), который использует 3x3 свертки для улучшения качества признаков низкого уровня перед их передачей наверх.
Архитектурные изменения и метрики
Внедрение нижне-восходящего пути в архитектуру FPN привело к существенному улучшению показателей на стандартных бенчмарках COCO. Ниже приведено сравнение эффективности базовой FPN и улучшенной PANet при использовании различных бэкбондов (ResNet-50 и ResNet-101):
| Модель | Бэкбон | AP (Overall) | AP_s (Small) | AP_m (Medium) | AP_l (Large) |
|---|---|---|---|---|---|
| FPN | ResNet-50 | 36.0 | 19.8 | 39.8 | 47.3 |
| PANet | ResNet-50 | 38.2 | 22.3 | 42.0 | 49.3 |
| FPN | ResNet-101 | 38.0 | 21.3 | 41.9 | 49.4 |
| PANet | ResNet-101 | 40.0 | 23.8 | 44.0 | 51.3 |
Как видно из таблицы, PANet демонстрирует стабильный прирост во всех категориях, особенно в сегменте малых объектов (AP_s), где улучшение составило более 2.5% для ResNet-50.
Почему это важно для индустрии
Улучшение качества детекции малых объектов критически важно для таких приложений, как автономное вождение, медицинская визуализация и мониторинг безопасности. PANet не требует значительных вычислительных затрат, так как добавляет лишь несколько слоев свертки, но при этом позволяет существующим детекторам (таким как Faster R-CNN, RetinaNet и YOLO) достигать state-of-the-art результатов без перестройки всей архитектуры. Это делает PANet легким в интеграции улучшением для современных систем компьютерного зрения.
Источник: Towards Data Science ↗
