Проблема: «Усталость» от длинных видео
Носимые камеры (wearable assistants) генерируют огромные объемы данных, но современные Vision-Language Models (VLM) сталкиваются с тремя критическими барьерами: жесткие лимиты кадров, экспоненциальный рост стоимости визуальных токенов и провалы при поиске в длинном контексте. Авторы работы из команды Dingli Liang предлагают альтернативу: использовать текстовые субтитры (captions) как переиспользуемую эпизодическую память.
Что такое CapMem и его метрики
Команда разработала задачу Episodic Memory Video Caption QA и анонсировала датасет CapMem. Это аннотированный человеком набор данных, содержащий 75 видео общей продолжительностью 33,7 часа. Для проверки моделей подготовлено 1 000 вопросов с множественным выбором, охватывающих 16 различных сценариев повседневной жизни.
Результаты: Капшены против прямого анализа
Ключевой вывод исследования касается эффективности работы с длинными видео (>20 минут). Прямой анализ (VideoQA) часто проигрывает подходу с предварительным созданием текстовых описаний (CaptionQA). Ниже приведены сравнительные данные по улучшению точности (accuracy gain) на подмножестве длинных видео при использовании окон генерации капшенов по 30 и 60 секунд:
| Метрика / Модель | Окно 30 сек (CaptionQA vs VideoQA) | Окно 60 сек (CaptionQA vs VideoQA) |
|---|---|---|
| Средний прирост точности (6 моделей Qwen) | +3.22 пункта | +2.55 пункта |
| Доля моделей, где CaptionQA лучше | 10 из 12 | 8 из 12 |
Дополнительно, внедрение механизма caption-guided retrieve-and-verify (поиск и проверка на основе капшенов) позволило увеличить точность ответов еще на 5.3 пункта по сравнению с базовыми методами.
Почему это важно для индустрии
Результаты, представленные на EMNLP 2026, доказывают, что текстовая абстракция визуального ряда — это не просто сжатие данных, а эффективный механизм памяти. Для разработчиков носимых устройств и AI-ассистентов это означает возможность обработки часовых записей без необходимости содержать в контекстном окне тысячи визуальных токенов, что снижает вычислительные затраты и повышает релевантность ответов.
Источник: arXiv cs.AI ↗
