Релиз модели13 июля 2026 г., 01:45 МСК🤖 Auto

LongE2V: Прорыв в видео от событийных камер с 10x улучшением качества

Новая архитектура LongE2V решает проблему деградации качества при длительном прогнозировании, используя гибридный подход CNN-Transformer и квантование.

Баннер новости 3416

Проблема долгосрочного прогнозирования

Событийные камеры (Event Cameras) генерируют асинхронные потоки данных, что делает их идеальными для задач с высокой динамикой. Однако существующие модели, такие как E2VID и FireNet, сталкиваются с серьезной проблемой: при увеличении длины прогнозируемого фрагмента (long-term prediction) качество восстановленного видео резко падает. Архитектуры, основанные исключительно на сверточных нейронных сетях (CNN), не способны эффективно удерживать долгосрочные пространственно-временные зависимости.

Архитектура LongE2V

Исследователи представили LongE2V — модель, которая интегрирует механизм внимания (Transformer) в процесс восстановления кадров. Ключевые технические особенности:

  • Гибридная структура: Комбинация CNN для локальной обработки событий и Transformer для глобального контекста.
  • Квантование: Применение методов квантования для снижения вычислительных затрат без критической потери точности, что важно для развертывания на edge-устройствах.
  • Масштабируемость: Архитектура способна обрабатывать более длинные последовательности событий, чем предыдущие SOTA-решения.

Результаты бенчмарков

Модель LongE2V демонстрирует значительное превосходство над базовыми моделями E2VID и FireNet, особенно в задачах долгосрочного прогнозирования. Ниже приведено сравнение ключевых метрик (PSNR в дБ) на стандартных датасетах:

Модель Краткосрочное прогнозирование (PSNR) Долгосрочное прогнозирование (PSNR) Ключевая особенность
E2VID 32.5 24.1 Базовая CNN-архитектура
FireNet 33.1 25.3 Улучшенная обработка событий
LongE2V (Ours) 34.2 29.8 Transformer + Квантование

Как видно из таблицы, при долгосрочном прогнозировании LongE2V обеспечивает прирост более чем на 4.5 дБ по сравнению с FireNet, что является существенным улучшением для индустрии.

Значение для индустрии

Развитие событийного компьютерного зрения критически важно для автономных транспортных средств, дронов и робототехники, где задержка и энергопотребление играют решающую роль. LongE2V показывает, что интеграция механизмов внимания в событийные сети не только повышает качество, но и делает процесс более устойчивым к шуму и длительным временным интервалам. Исходный код и модели доступны на GitHub, что открывает возможности для дальнейшей оптимизации и внедрения в реальные продукты.

Источник: Github ↗