Исследования3 сентября 2026 г., 09:16 МСК🤖 Auto

BCO: Явная модель мира для агентов LLM

Исследователи представили Belief-Calibrated Optimization (BCO) — метод, превращающий неявные убеждения оптимизатора в явную документированную модель среды, что повышает надежность агентов LLM.

Баннер новости 6657

Проблема неявного знания

Производительность LLM-агентов критически зависит от «скаффолда» (оптимизационной оболочки) вокруг замороженной модели. Стандартный подход использует код-агента для итеративного редактирования исходного кода на основе оценок и трассировок. Однако текущие методы опираются на неявные убеждения (beliefs): агент «понимает», что пошло не так, но эта информация остается в латентных параметрах или краткосрочном контексте текущего вызова. Последующие итерации не используют накопленный опыт, что ограничивает эффективность обучения.

Решение: Belief-Calibrated Optimization (BCO)

Авторы предлагают метод BCO, который фиксирует убеждения оптимизатора в виде персистентного документа в контексте (in-context document). Этот документ функционирует как явная модель мира: он описывает, как среда реагирует на изменения. По мере оценки новых кандидатов документ постоянно пересматривается и обновляется, создавая кумулятивную базу знаний о поведении системы.

Результаты бенчмарков

Метод BCO демонстрирует превосходство над контрольной группой (без модели мира) на пяти различных бенчмарках. Разрыв в производительности сохраняется на всех тестовых выборках, не использовавшихся для выбора кандидатов. Важно, что после замены базовой модели (target-model swap) скаффолд, обученный с помощью BCO, продолжает лидировать, доказывая свою универсальность.

d>Code-as-action
Категория задач Описание Результат BCO
Memory QA Вопросы, требующие удержания и использования контекста памяти Выше, чем у контроля
Tool-use QA Взаимодействие с внешними инструментами Выше, чем у контроля
Агенты, управляемые кодом для выполнения приложений Выше, чем у контроля
Terminal agents Агенты для работы в терминале/CLI Выше, чем у контроля

Валидация через абляцию

Для подтверждения того, что преимущество дает именно содержание документа, а не просто его наличие, авторы провели офлайн-абляцию. Свежий предиктор, обученный на накопленном документе BCO, точнее прогнозирует реакцию среды, чем предикторы, получавшие либо пустой документ, либо документ с искаженным (фальсифицированным) содержанием. Это доказывает, что документ несет в себе переиспользуемую семантическую информацию о мире.

Источник: arXiv cs.AI ↗