Проблема долгосрочного прогнозирования
Событийные камеры (Event Cameras) генерируют асинхронные потоки данных, что делает их идеальными для задач с высокой динамикой. Однако существующие модели, такие как E2VID и FireNet, сталкиваются с серьезной проблемой: при увеличении длины прогнозируемого фрагмента (long-term prediction) качество восстановленного видео резко падает. Архитектуры, основанные исключительно на сверточных нейронных сетях (CNN), не способны эффективно удерживать долгосрочные пространственно-временные зависимости.
Архитектура LongE2V
Исследователи представили LongE2V — модель, которая интегрирует механизм внимания (Transformer) в процесс восстановления кадров. Ключевые технические особенности:
- Гибридная структура: Комбинация CNN для локальной обработки событий и Transformer для глобального контекста.
- Квантование: Применение методов квантования для снижения вычислительных затрат без критической потери точности, что важно для развертывания на edge-устройствах.
- Масштабируемость: Архитектура способна обрабатывать более длинные последовательности событий, чем предыдущие SOTA-решения.
Результаты бенчмарков
Модель LongE2V демонстрирует значительное превосходство над базовыми моделями E2VID и FireNet, особенно в задачах долгосрочного прогнозирования. Ниже приведено сравнение ключевых метрик (PSNR в дБ) на стандартных датасетах:
| Модель | Краткосрочное прогнозирование (PSNR) | Долгосрочное прогнозирование (PSNR) | Ключевая особенность |
|---|---|---|---|
| E2VID | 32.5 | 24.1 | Базовая CNN-архитектура |
| FireNet | 33.1 | 25.3 | Улучшенная обработка событий |
| LongE2V (Ours) | 34.2 | 29.8 | Transformer + Квантование |
Как видно из таблицы, при долгосрочном прогнозировании LongE2V обеспечивает прирост более чем на 4.5 дБ по сравнению с FireNet, что является существенным улучшением для индустрии.
Значение для индустрии
Развитие событийного компьютерного зрения критически важно для автономных транспортных средств, дронов и робототехники, где задержка и энергопотребление играют решающую роль. LongE2V показывает, что интеграция механизмов внимания в событийные сети не только повышает качество, но и делает процесс более устойчивым к шуму и длительным временным интервалам. Исходный код и модели доступны на GitHub, что открывает возможности для дальнейшей оптимизации и внедрения в реальные продукты.
Источник: Github ↗
