Исследования2 октября 2026 г., 05:22 МСК🤖 Auto

EVOKE: Как заставить LLM использовать встроенные знания для решений

Исследователи представили метод EVOKE, который улучшает обобщающую способность агентов на базе LLM за счет принудительного выбора действий при разных целях в одном состоянии.

Баннер новости 8747

Проблема: LLM-агенты не умеют переносить знания

Большие языковые модели (LLM) все чаще используются как автономные агенты для принятия решений в несколько шагов. Однако они плохо справляются с переносом навыков на новые, невиданные среды. Существующие методы «мировых моделей» (world-models), обучающие агента предсказывать будущие наблюдения, требуют дополнительных вычислений и накапливают ошибки прогнозирования.

Авторы статьи из arXiv (2026) утверждают, что для цифровых сред основная часть знаний уже заложена в модель во время предобучения. Проблема не в их отсутствии, а в том, что стандартное дообучение (post-training) не заставляет модель их использовать. При обучении под одну конкретную цель политика часто полагается на поверхностные контекстные привычки, а не на глубокое понимание мира.

Решение: EVOKE через разнообразие целей

Метод EVOKE (Eliciting World Knowledge in Agents) решает эту проблему, создавая давление на модель через разнообразие целей при фиксированном состоянии. Идея основана на теории: если агент компетентен в разных сценариях, он должен кодировать мировую модель, которую можно извлечь из его предпочтений в действиях.

Алгоритм работает следующим образом:

  • Состояние среды и история взаимодействия фиксируются.
  • Одни и те же кандидаты на действия ранжируются при альтернативных целях.
  • Это заставляет предпочтения в действиях меняться, что невозможно при использовании поверхностных корреляций.

Таким образом, метод неявно извлекает встроенные знания модели для информирования решений, не требуя сложного обучения предсказанию состояний.

Результаты и эффективность

EVOKE был протестирован на разнообразных задачах с использованием трех различных архитектурных основ (backbones). Метод продемонстрировал:

  • Улучшение производительности в задачах.
  • Более высокую способность к обобщению на невиданных средах.
  • Повышенную эффективность использования данных (data efficiency).

Контролируемый анализ показал, что именно принудительное изменение порядка действий при смене цели является ключевым драйвером этих улучшений, позволяя модели опираться на истинное понимание причинно-следственных связей, а не на статистические совпадения.

Значение для индустрии

Работа предлагает новый взгляд на использование LLM в автономных системах. Вместо того чтобы тратить ресурсы на дообучение предсказанию будущего, разработчики могут использовать EVOKE для «пробуждения» уже имеющихся у модели знаний. Это снижает вычислительные затраты и повышает надежность агентов в динамичных средах, где критически важна способность к быстрому переносу решений.

Источник: arXiv cs.CL ↗