Проблема текстовых «подсказок»
Современные персонализированные агенты ИИ опираются на текстовую память: транскрипты и текстовые описания (captions), извлеченные по семантической схожести. Такой подход работает для фактов, которые можно назвать (например, «кошку зовут Бибби»), но полностью игнорирует перцептивную половину личности: как звучит голос, как меняется лицо с возрастом или при разном освещении, как читается усталость. Исследователи из Университета Вашингтона (Bojie Li, Noah Shi) доказали, что этот метод приводит к критической потере данных.
Архитектура PerceptMem
Авторы предлагают декомпозировать задачу распознавания на два этапа, храня результат как один встроенный токен (inline token), доступный модели внимания (attention) без внешних запросов:
- Vision-Language Model (VLM): Определяет «что» и «где» (контекст и референс).
- Dedicated Encoder: Извлекает «ключ» личности (кто), не требуя дообучения (training-free) и работая с замороженными моделями (frozen models) с затратой O(1).
Результаты бенчмарка PerceptMem
Тестирование проводилось на датасете PerceptMem, включающем 12 доменов и 1080 задач. Сравнение показывает, что ни один из методов по отдельности не дает идеального результата, но их комбинация достигает почти идеальной точности.
| Метод / Модель | Метрика (Recall) | Комментарий |
|---|---|---|
| Strong caption-based re-identifier | 0.11 | Восстанавливает лишь 11% от возможностей специализированного энкодера; результат близок к случайному для неназываемых сигналов. |
| Face Encoder (изолированно) | 0.81 | Высокая точность распознавания, но без контекста VLM. |
| VLM (распознавание лиц) | 0.54 | Способен опознать лицо в разных возрастах, но уступает специализированному энкодеру. |
| Ungrounded Encoder (сцена с 2 людьми) | 0.05 | Полный провал без привязки к контексту (VLM). |
| PerceptMem (VLM + Encoder) | 0.96 | Достигает точности «oracle» (идеального распознавания в нужной области), обобщаясь на аудио и видео с несколькими говорящими. |
Почему это важно
Исследование вводит важное разделение: точные факты (facts) должны храниться в текстовом хранилище (binding-limited), а идентичность (identity) — в параметрическом банке (capacity-limited). Агент, использующий PerceptMem, способен помнить не только то, что сказал пользователь, но и то, какой он есть перцептивно, что критически важно для создания по-настоящему эмпатичных и контекстно-осведомленных ИИ-ассистентов.
Источник: arXiv cs.CL ↗
