Проблема долгосрочной памяти
Современные ИИ-агенты отлично справляются с сиюминутными задачами, но терпят крах при необходимости понимать контекст, формирующийся неделями. Авторы работы из SIMLIFE (Run Peng, Zinnia Nie, Jing Ding и др.) подчеркивают, что для истинного партнерства с человеком агент должен не только реагировать на запросы, но и инферировать скрытые правила поведения, понимать, почему рутина повторяется и когда она меняется.
Масштаб данных: 15 часов и 38 дней
Для проверки этих гипотез создана платформа SimLife, генерирующая синтетические диалоги с аудио, визуальные наблюдения и ground-truth логи действий. Бенчмарк SimLife-BP включает 106 эпизодов, каждый из которых в среднем длится 15.49 часов (38.57 игровых дней). Всего в датасете 1,439 пар вопросов и ответов, охватывающих прямые, контрфактические, зашумленные и обратные рассуждения.
Результаты: частота вместо логики
Тестирование передовых архитектур показало критический пробел: модели часто достигают поверхностного предсказания, опираясь на эвристики частотности, а не на причинно-следственные связи (if-then reasoning). Они не способны адаптироваться, когда поведенческие паттерны меняются.
| Метрика / Характеристика | Значение / Описание |
|---|---|
| Количество эпизодов | 106 |
| Средняя длительность эпизода | 15.49 часов (38.57 дней) |
| Объем QA-пар | 1,439 |
| Типы рассуждений | Прямые, контрфактические, зашумленные, обратные |
| Основной вывод | Модели зависят от частотности, а не от понимания правил |
Значение для индустрии
Работа, представленная на воркшопе COLM 2026, открывает новое пространство для исследований памяти, персонализации и долгосрочного планирования. Без решения проблемы понимания паттернов в долгосрочной перспективе создание по-настоящему автономных embodied-агентов для дома останется невозможным.
Источник: arXiv cs.AI ↗
