Исследования4 августа 2026 г., 05:17 МСК🤖 Auto

SKL: LLM-агенты учатся на состояниях, а не на истории

Исследователи представили Stateful Knowledge Learning (SKL) — метод, заменяющий поверхностный рефлекс LLM-агентов на глубокое извлечение предиктивных знаний из состояний среды.

Баннер новости 5007

Проблема «эпизодической памяти»

Современные LLM-агенты, обучающиеся на собственном опыте, часто полагаются на trajectory-level reflection (рефлексию на уровне траектории). Авторы статьи указывают, что этот подход создает лишь epistemic hindsight (постфактумное понимание), что приводит к хрупким, зависящим от пути эвристикам. Агент запоминает, что было сделано, но не понимает причинно-следственных связей конкретного состояния среды.

Решение: Stateful Knowledge Learning (SKL)

Предложенный метод SKL смещает фокус с обобщения всей траектории на поддержание Stateful Knowledge — явных, декларативных предиктивных оценок, привязанных к конкретному состоянию. Это позволяет модели:

  • Достигать большей детализации (granularity) при анализе ситуации.
  • Улучшать обобщающую способность (generalization) на новых задачах.
  • Обеспечивать «загрузку» знаний (bootstrapping) для быстрого старта в схожих сценариях.

Два алгоритма обучения

Для масштабирования идеи авторы внедрили два подхода к извлечению знаний из опыта:

  1. SKL-SD: обучение через самодистилляцию (self-distillation).
  2. SKL-RL: обучение с подкреплением (reinforcement learning), где агент автономно извлекает знания, привязанные к состоянию, и использует их для принятия решений.

Результаты бенчмарков

Эксперименты проводились в интерактивных средах (WebShop, ScienceWorld) и сложной задаче на рассуждение (ChessPuzzles). Внедрение SKL значительно превзошло текущие парадигмы, основанные на рефлексии.

Метрика / Среда Описание результата
WebShop Значительное улучшение эффективности поиска и покупки товаров по сравнению с базовыми моделями рефлексии.
ScienceWorld Повышение успешности выполнения научных экспериментов за счет лучшего понимания состояния среды.
ChessPuzzles Превосходство в сложных задачах на логическое рассуждение, требующих прогнозирования ходов.

Исследование демонстрирует, что переход от «памяти о действиях» к «знанию о состояниях» является ключом к созданию более надежных автономных агентов.

Источник: arXiv cs.CL ↗