Исследования30 июня 2026 г., 14:18 МСК🤖 Auto

ComMem: Бионическая память для адаптации VLM на лету

Исследователи представили ComMem — метод тестовой адаптации (TTA) зрительно-языковых моделей, имитирующий работу гиппокампа и неокортекса для повышения устойчивости к сдвигам данных.

Баннер новости 2565

Проблема существующих методов TTA

Адаптация зрительно-языковых моделей (VLM) во время тестирования (Test-Time Adaptation, TTA) критически важна для их работы в реальных условиях, где распределение данных постоянно меняется. Однако текущие подходы имеют два существенных недостатка: они адаптируются локально, не накапливая знания со временем, или работают только с одним модальностью, игнорируя синергию между текстом и изображением.

Решение: Бионическая архитектура ComMem

Команда авторов во главе с Гуанлуном Сунем (Guanglong Sun) предложила метод ComMem (Complementary Memory Systems), который копирует кооперацию двух систем памяти человеческого мозга:

  • Быстрая детальная память (Гиппокамп): Формирует динамический визуальный кэш на основе высоконадежных тестовых выборок. Это позволяет модели мгновенно реагировать на новые визуальные паттерны.
  • Медленная абстрактная память (Неокортекс): Постепенно уточняет глобальные текстовые прототипы. Это обеспечивает стабильность и обобщение знаний.

Для каждого тестового примера ComMem совместно оптимизирует обе системы, обеспечивая кросс-модальную согласованность между визуальными и текстовыми представлениями.

Результаты и метрики

Эксперименты проводились на 15 бенчмарках. Метод демонстрирует значительное превосходство над существующими состояниями искусства (SOTA) в двух ключевых сценариях:

  1. Естественные сдвиги распределения (Natural distribution shifts): Устойчивость к изменению качества, освещения или стиля изображений.
  2. Кросс-датасетная генерализация: Способность работать на данных, не встречавшихся в обучающей выборке.

Значение для индустрии

ComMem открывает новый вектор развития VLM, смещая фокус с простой дообучения параметров на управление памятью модели. Это позволяет создавать более надежные системы компьютерного зрения, способные к непрерывному обучению в реальном времени без риска «катастрофического забывания» и с учетом мультимодальной природы данных.

Источник: arXiv cs.AI ↗