Проблема контекстного окна в MLLM
Мультимодальные большие языковые модели (MLLM) демонстрируют отличные результаты в базовых задачах видеоанализа, но их применение ограничено узким контекстным окном. Для работы с длинными видео (LongVideoQA) стандартным решением является выбор ключевых кадров. Однако традиционные методы, такие как равномерная выборка или статический отбор на основе запроса, часто упускают критически важный временной контекст. Они не адаптируются к разной временной детализации запросов пользователя, что приводит к потере информации.
Решение: ReMem и двухуровневая память
Авторы предлагают ReMem (Reasoning with Memory) — фреймворк для выбора ключевых кадров, не требующий дообучения (training-free). Метод использует двухуровневую адаптацию на основе памяти:
- На уровне запроса: Memory-Driven Question Parsing использует долгосрочную память LLM для декодирования временной детализации вопроса и извлечения семантических сущностей.
- На уровне видео: Synergistic Dual-Semantic Frame Alignment использует внутреннюю структурную память для выравнивания кадров с семантикой запроса. Это направляет Structure-Aware Dynamic Frame Routing, который группирует события и оптимально распределяет бюджет выборки кадров.
Результаты: State-of-the-Art без обучения
Оценка проводилась на четырех популярных бенчмарках LongVideoQA с использованием трех различных MLLM. ReMem показал высокую эффективность в режиме zero-shot. Особенно выделяются результаты модели LLaVA-Video в сочетании с ReMem:
| Бенчмарк | Результат (LLaVA-Video + ReMem) | Прирост (Delta) |
|---|---|---|
| LVBench | 54.5% | +12.3% |
| LongVideoBench | 67.1% | +8.2% |
Эти цифры свидетельствуют о том, что явное сохранение временной информации через механизмы памяти подавляет избыточность данных и позволяет моделям выполнять надежное многогранное рассуждение над видео.
Значение для индустрии
Работа принята к публикации в ECCV 2026. Подход ReMem важен тем, что он не требует ресурсоемкого дообучения базовых моделей, а лишь улучшает их работу за счет умного препроцессинга данных. Это открывает путь к более эффективному анализу часовых видеозаписей в системах видеонаблюдения, архивации и контент-платформах.
Источник: arXiv cs.AI ↗
