Исследования3 августа 2026 г., 10:17 МСК🤖 Auto

ViSAGE: Самокорректирующаяся память для анализа длинных видео

Исследователи представили ViSAGE — систему, устраняющую галлюцинации мультимодальных агентов при работе с длинными видео за счет привязки к сущностям и перекрестной верификации.

Баннер новости 4936

Проблема: Ошибка идентификации в длинных контекстах

Мультимодальные агенты, работающие с видео длительностью в часы, сталкиваются с критической проблемой: при сжатии контекста теряются тонкие различия между объектами. Существующие подходы, полагающиеся на векторный поиск по схожести, часто извлекают семантически похожие, но визуально разные кадры. Это приводит к путанице сущностей (entity confusion), накоплению ошибок и выдуманным ответам.

Решение: Архитектура ViSAGE

Команда авторов (Xinkui Zhao, Enbo Chen и др.) предложила фреймворк ViSAGE, который строит память, центрированную вокруг конкретных сущностей. Ключевые инновации:

  • Кросс-модальная привязка: Идентичность объекта фиксируется через связь визуальных и текстовых данных на длительных временных отрезках.
  • Двустороннее уточнение памяти: Система способна «задним числом» обновлять исторические записи, когда появляется новое доказательство идентичности, обеспечивая согласованность во времени.
  • Мультиагентная перекрестная проверка: Перед выдачей ответа агенты оценивают соответствие извлеченных доказательств заявленной сущности. Если доказательств нет, система предпочитает воздержаться от ответа, а не галлюцинировать.

Результаты и значимость

Эксперименты показали, что ViSAGE стабильно превосходит сильные базовые модели. Главное достижение — повышение точности на 5.9% по сравнению с лучшими существующими подходами. Работа принята к публикации на конференции ACMMM 2026, что подтверждает ее важность для развития надежных AI-агентов.

Характеристика Описание в ViSAGE
Основной механизм Самокорректирующаяся память, центрированная на сущностях
Ключевая технология Кросс-модальная привязка и двустороннее уточнение
Метрика улучшения +5.9% точности относительно базовых моделей
Статус Принято в ACMMM 2026

Для разработчиков AI-агентов это означает переход от простого «поиска по ключевым словам» к логике, способной отслеживать идентичность объектов через сложные временные интервалы, что критично для анализа видеоконтента, мониторинга безопасности и анализа спортивных трансляций.

Источник: arXiv cs.AI ↗