Проблема: LLM-агенты не умеют переносить знания
Большие языковые модели (LLM) все чаще используются как автономные агенты для принятия решений в несколько шагов. Однако они плохо справляются с переносом навыков на новые, невиданные среды. Существующие методы «мировых моделей» (world-models), обучающие агента предсказывать будущие наблюдения, требуют дополнительных вычислений и накапливают ошибки прогнозирования.
Авторы статьи из arXiv (2026) утверждают, что для цифровых сред основная часть знаний уже заложена в модель во время предобучения. Проблема не в их отсутствии, а в том, что стандартное дообучение (post-training) не заставляет модель их использовать. При обучении под одну конкретную цель политика часто полагается на поверхностные контекстные привычки, а не на глубокое понимание мира.
Решение: EVOKE через разнообразие целей
Метод EVOKE (Eliciting World Knowledge in Agents) решает эту проблему, создавая давление на модель через разнообразие целей при фиксированном состоянии. Идея основана на теории: если агент компетентен в разных сценариях, он должен кодировать мировую модель, которую можно извлечь из его предпочтений в действиях.
Алгоритм работает следующим образом:
- Состояние среды и история взаимодействия фиксируются.
- Одни и те же кандидаты на действия ранжируются при альтернативных целях.
- Это заставляет предпочтения в действиях меняться, что невозможно при использовании поверхностных корреляций.
Таким образом, метод неявно извлекает встроенные знания модели для информирования решений, не требуя сложного обучения предсказанию состояний.
Результаты и эффективность
EVOKE был протестирован на разнообразных задачах с использованием трех различных архитектурных основ (backbones). Метод продемонстрировал:
- Улучшение производительности в задачах.
- Более высокую способность к обобщению на невиданных средах.
- Повышенную эффективность использования данных (data efficiency).
Контролируемый анализ показал, что именно принудительное изменение порядка действий при смене цели является ключевым драйвером этих улучшений, позволяя модели опираться на истинное понимание причинно-следственных связей, а не на статистические совпадения.
Значение для индустрии
Работа предлагает новый взгляд на использование LLM в автономных системах. Вместо того чтобы тратить ресурсы на дообучение предсказанию будущего, разработчики могут использовать EVOKE для «пробуждения» уже имеющихся у модели знаний. Это снижает вычислительные затраты и повышает надежность агентов в динамичных средах, где критически важна способность к быстрому переносу решений.
Источник: arXiv cs.CL ↗
