Проблема существующих методов TTA
Адаптация зрительно-языковых моделей (VLM) во время тестирования (Test-Time Adaptation, TTA) критически важна для их работы в реальных условиях, где распределение данных постоянно меняется. Однако текущие подходы имеют два существенных недостатка: они адаптируются локально, не накапливая знания со временем, или работают только с одним модальностью, игнорируя синергию между текстом и изображением.
Решение: Бионическая архитектура ComMem
Команда авторов во главе с Гуанлуном Сунем (Guanglong Sun) предложила метод ComMem (Complementary Memory Systems), который копирует кооперацию двух систем памяти человеческого мозга:
- Быстрая детальная память (Гиппокамп): Формирует динамический визуальный кэш на основе высоконадежных тестовых выборок. Это позволяет модели мгновенно реагировать на новые визуальные паттерны.
- Медленная абстрактная память (Неокортекс): Постепенно уточняет глобальные текстовые прототипы. Это обеспечивает стабильность и обобщение знаний.
Для каждого тестового примера ComMem совместно оптимизирует обе системы, обеспечивая кросс-модальную согласованность между визуальными и текстовыми представлениями.
Результаты и метрики
Эксперименты проводились на 15 бенчмарках. Метод демонстрирует значительное превосходство над существующими состояниями искусства (SOTA) в двух ключевых сценариях:
- Естественные сдвиги распределения (Natural distribution shifts): Устойчивость к изменению качества, освещения или стиля изображений.
- Кросс-датасетная генерализация: Способность работать на данных, не встречавшихся в обучающей выборке.
Значение для индустрии
ComMem открывает новый вектор развития VLM, смещая фокус с простой дообучения параметров на управление памятью модели. Это позволяет создавать более надежные системы компьютерного зрения, способные к непрерывному обучению в реальном времени без риска «катастрофического забывания» и с учетом мультимодальной природы данных.
Источник: arXiv cs.AI ↗
