Проблема локальных ассистентов
Персональные AI-ассистенты, развертываемые на edge-устройствах (смартфонах, ноутбуках), должны обрабатывать приватные межличностные разговоры без отправки данных в облако. Существующие бенчмарки не учитывают три ключевых фактора: плотность взаимодействий, эгоцентричную перспективу (точка зрения пользователя) и согласованность в рамках нескольких сессий. Авторы работы Jiadong Zhang и Xiaosong Ma заполнили этот пробел, создав MemArena.
Масштаб и методология
Бенчмарк построен с использованием симулятора агентов MASim. В тестовом наборе данных смоделировано поведение 50 агентов в течение 15 дней. Объем данных впечатляет:
- 10.3 млн токенов диалогового текста;
- 24.1 тыс. токенов, наблюдаемых от первого лица (ego-observed) на агента в день.
На основе истории взаимодействий автоматически сгенерирована «истина» (ground truth) для оценки по шести измерениям: запоминание, рассуждение, достоверность и другие.
Результаты тестирования бэкендов памяти
Исследователи протестировали пять открытых моделей-читателей (readers) с различными бэкендами памяти: Vanilla context, BM25-RAG, Oracle retrieval, Memobase и MemSearch. Ключевые выводы показали, что выбор архитектуры памяти критичнее, чем масштабирование самой модели.
| Метрика / Сценарий | Результат / Наблюдение |
|---|---|
| Влияние бэкенда (Qwen3-0.6B) | Переход с Memobase на MemSearch дал прирост точности контента на +32.5/+19.2 pp. |
| Влияние масштабирования модели | Улучшение за счет размера читателя составило лишь +10.6/+6.8 pp (меньше, чем от смены бэкенда). |
| Проблема приватности | Механизмы контроля доступа (permission-aware) провалились: Oracle-поиск давал утечки, остальные бэкенды были слишком осторожны. |
| Задержка поиска (Edge-устройство) | На Spark GB10 добавление поиска памяти дало фиксированную задержку: 87 мс (BM25), 7 мс (Memobase), 48 мс (MemSearch). |
Почему это важно
Результаты доказывают, что для локальных AI-ассистентов оптимизация системы хранения и поиска памяти (memory backend) дает больший выигрыш в качестве ответов, чем покупка более мощных моделей. Кроме того, задержка поиска на современных edge-чипах остается приемлемой (единицы-десятки миллисекунд), что делает развертывание таких систем технически viable. Код, симулятор MASim и датасет MemArena-L будут опубликованы после рецензирования.
Источник: arXiv cs.CL ↗
