Проблема «эпизодической памяти»
Современные LLM-агенты, обучающиеся на собственном опыте, часто полагаются на trajectory-level reflection (рефлексию на уровне траектории). Авторы статьи указывают, что этот подход создает лишь epistemic hindsight (постфактумное понимание), что приводит к хрупким, зависящим от пути эвристикам. Агент запоминает, что было сделано, но не понимает причинно-следственных связей конкретного состояния среды.
Решение: Stateful Knowledge Learning (SKL)
Предложенный метод SKL смещает фокус с обобщения всей траектории на поддержание Stateful Knowledge — явных, декларативных предиктивных оценок, привязанных к конкретному состоянию. Это позволяет модели:
- Достигать большей детализации (granularity) при анализе ситуации.
- Улучшать обобщающую способность (generalization) на новых задачах.
- Обеспечивать «загрузку» знаний (bootstrapping) для быстрого старта в схожих сценариях.
Два алгоритма обучения
Для масштабирования идеи авторы внедрили два подхода к извлечению знаний из опыта:
- SKL-SD: обучение через самодистилляцию (self-distillation).
- SKL-RL: обучение с подкреплением (reinforcement learning), где агент автономно извлекает знания, привязанные к состоянию, и использует их для принятия решений.
Результаты бенчмарков
Эксперименты проводились в интерактивных средах (WebShop, ScienceWorld) и сложной задаче на рассуждение (ChessPuzzles). Внедрение SKL значительно превзошло текущие парадигмы, основанные на рефлексии.
| Метрика / Среда | Описание результата |
|---|---|
| WebShop | Значительное улучшение эффективности поиска и покупки товаров по сравнению с базовыми моделями рефлексии. |
| ScienceWorld | Повышение успешности выполнения научных экспериментов за счет лучшего понимания состояния среды. |
| ChessPuzzles | Превосходство в сложных задачах на логическое рассуждение, требующих прогнозирования ходов. |
Исследование демонстрирует, что переход от «памяти о действиях» к «знанию о состояниях» является ключом к созданию более надежных автономных агентов.
Источник: arXiv cs.CL ↗
