Исследования17 сентября 2026 г., 08:20 МСК🤖 Auto

CapMem: Текстовая память решает проблему долгого видео в VLM

Исследователи представили CapMem — первый бенчмарк для оценки эпизодической памяти в эгоцентрическом видео. Текстовые описания (капшены) позволяют моделям лучше ориентироваться в часах footage, обходя ограничения контекстного окна.

Баннер новости 7692

Проблема: «Усталость» от длинных видео

Носимые камеры (wearable assistants) генерируют огромные объемы данных, но современные Vision-Language Models (VLM) сталкиваются с тремя критическими барьерами: жесткие лимиты кадров, экспоненциальный рост стоимости визуальных токенов и провалы при поиске в длинном контексте. Авторы работы из команды Dingli Liang предлагают альтернативу: использовать текстовые субтитры (captions) как переиспользуемую эпизодическую память.

Что такое CapMem и его метрики

Команда разработала задачу Episodic Memory Video Caption QA и анонсировала датасет CapMem. Это аннотированный человеком набор данных, содержащий 75 видео общей продолжительностью 33,7 часа. Для проверки моделей подготовлено 1 000 вопросов с множественным выбором, охватывающих 16 различных сценариев повседневной жизни.

Результаты: Капшены против прямого анализа

Ключевой вывод исследования касается эффективности работы с длинными видео (>20 минут). Прямой анализ (VideoQA) часто проигрывает подходу с предварительным созданием текстовых описаний (CaptionQA). Ниже приведены сравнительные данные по улучшению точности (accuracy gain) на подмножестве длинных видео при использовании окон генерации капшенов по 30 и 60 секунд:

Метрика / Модель Окно 30 сек (CaptionQA vs VideoQA) Окно 60 сек (CaptionQA vs VideoQA)
Средний прирост точности (6 моделей Qwen) +3.22 пункта +2.55 пункта
Доля моделей, где CaptionQA лучше 10 из 12 8 из 12

Дополнительно, внедрение механизма caption-guided retrieve-and-verify (поиск и проверка на основе капшенов) позволило увеличить точность ответов еще на 5.3 пункта по сравнению с базовыми методами.

Почему это важно для индустрии

Результаты, представленные на EMNLP 2026, доказывают, что текстовая абстракция визуального ряда — это не просто сжатие данных, а эффективный механизм памяти. Для разработчиков носимых устройств и AI-ассистентов это означает возможность обработки часовых записей без необходимости содержать в контекстном окне тысячи визуальных токенов, что снижает вычислительные затраты и повышает релевантность ответов.

Источник: arXiv cs.AI ↗