Исследования1 сентября 2026 г., 11:18 МСК🤖 Auto

PerceptMem: Как ИИ запоминает голос и лицо, а не только текст

Исследователи представили PerceptMem — систему, которая хранит перцептивную память пользователя (голос, внешность) в параметрической форме, решая проблему потери контекста при использовании только текстовых описаний.

Баннер новости 6481

Проблема текстовых «подсказок»

Современные персонализированные агенты ИИ опираются на текстовую память: транскрипты и текстовые описания (captions), извлеченные по семантической схожести. Такой подход работает для фактов, которые можно назвать (например, «кошку зовут Бибби»), но полностью игнорирует перцептивную половину личности: как звучит голос, как меняется лицо с возрастом или при разном освещении, как читается усталость. Исследователи из Университета Вашингтона (Bojie Li, Noah Shi) доказали, что этот метод приводит к критической потере данных.

Архитектура PerceptMem

Авторы предлагают декомпозировать задачу распознавания на два этапа, храня результат как один встроенный токен (inline token), доступный модели внимания (attention) без внешних запросов:

  • Vision-Language Model (VLM): Определяет «что» и «где» (контекст и референс).
  • Dedicated Encoder: Извлекает «ключ» личности (кто), не требуя дообучения (training-free) и работая с замороженными моделями (frozen models) с затратой O(1).

Результаты бенчмарка PerceptMem

Тестирование проводилось на датасете PerceptMem, включающем 12 доменов и 1080 задач. Сравнение показывает, что ни один из методов по отдельности не дает идеального результата, но их комбинация достигает почти идеальной точности.

Метод / Модель Метрика (Recall) Комментарий
Strong caption-based re-identifier 0.11 Восстанавливает лишь 11% от возможностей специализированного энкодера; результат близок к случайному для неназываемых сигналов.
Face Encoder (изолированно) 0.81 Высокая точность распознавания, но без контекста VLM.
VLM (распознавание лиц) 0.54 Способен опознать лицо в разных возрастах, но уступает специализированному энкодеру.
Ungrounded Encoder (сцена с 2 людьми) 0.05 Полный провал без привязки к контексту (VLM).
PerceptMem (VLM + Encoder) 0.96 Достигает точности «oracle» (идеального распознавания в нужной области), обобщаясь на аудио и видео с несколькими говорящими.

Почему это важно

Исследование вводит важное разделение: точные факты (facts) должны храниться в текстовом хранилище (binding-limited), а идентичность (identity) — в параметрическом банке (capacity-limited). Агент, использующий PerceptMem, способен помнить не только то, что сказал пользователь, но и то, какой он есть перцептивно, что критически важно для создания по-настоящему эмпатичных и контекстно-осведомленных ИИ-ассистентов.

Источник: arXiv cs.CL ↗