Исследования6 августа 2026 г., 05:16 МСК🤖 Auto

MemArena: Тест на память для AI-ассистентов на устройстве

Исследователи представили MemArena — первый эгоцентричный бенчмарк для оценки персональной памяти AI-агентов, работающих локально на edge-устройствах.

Баннер новости 5177

Проблема локальных ассистентов

Персональные AI-ассистенты, развертываемые на edge-устройствах (смартфонах, ноутбуках), должны обрабатывать приватные межличностные разговоры без отправки данных в облако. Существующие бенчмарки не учитывают три ключевых фактора: плотность взаимодействий, эгоцентричную перспективу (точка зрения пользователя) и согласованность в рамках нескольких сессий. Авторы работы Jiadong Zhang и Xiaosong Ma заполнили этот пробел, создав MemArena.

Масштаб и методология

Бенчмарк построен с использованием симулятора агентов MASim. В тестовом наборе данных смоделировано поведение 50 агентов в течение 15 дней. Объем данных впечатляет:

  • 10.3 млн токенов диалогового текста;
  • 24.1 тыс. токенов, наблюдаемых от первого лица (ego-observed) на агента в день.

На основе истории взаимодействий автоматически сгенерирована «истина» (ground truth) для оценки по шести измерениям: запоминание, рассуждение, достоверность и другие.

Результаты тестирования бэкендов памяти

Исследователи протестировали пять открытых моделей-читателей (readers) с различными бэкендами памяти: Vanilla context, BM25-RAG, Oracle retrieval, Memobase и MemSearch. Ключевые выводы показали, что выбор архитектуры памяти критичнее, чем масштабирование самой модели.

Метрика / Сценарий Результат / Наблюдение
Влияние бэкенда (Qwen3-0.6B) Переход с Memobase на MemSearch дал прирост точности контента на +32.5/+19.2 pp.
Влияние масштабирования модели Улучшение за счет размера читателя составило лишь +10.6/+6.8 pp (меньше, чем от смены бэкенда).
Проблема приватности Механизмы контроля доступа (permission-aware) провалились: Oracle-поиск давал утечки, остальные бэкенды были слишком осторожны.
Задержка поиска (Edge-устройство) На Spark GB10 добавление поиска памяти дало фиксированную задержку: 87 мс (BM25), 7 мс (Memobase), 48 мс (MemSearch).

Почему это важно

Результаты доказывают, что для локальных AI-ассистентов оптимизация системы хранения и поиска памяти (memory backend) дает больший выигрыш в качестве ответов, чем покупка более мощных моделей. Кроме того, задержка поиска на современных edge-чипах остается приемлемой (единицы-десятки миллисекунд), что делает развертывание таких систем технически viable. Код, симулятор MASim и датасет MemArena-L будут опубликованы после рецензирования.

Источник: arXiv cs.CL ↗