Исследования12 августа 2026 г., 10:18 МСК🤖 Auto

SBCO: Оптимизация планирующих агентов без людей и рефлексии

Исследователи представили SBCO — метод самообучения планирующих AI-агентов, который превосходит аналоги по эффективности, используя в 4-5.5 раз меньше вычислительных ресурсов.

Баннер новости 5593

Проблема самореференции в AI

Современные подходы к самообучению, такие как Darwin Gödel Machine и Huxley Gödel Machine, позволяют агентам переписывать собственный код. Однако этот метод работает только там, где компетенция для выполнения задачи совпадает с компетенцией для модификации кода (например, в программировании). Для сложных планирующих задач с жесткими ограничениями такой подход либо невозможен, либо требует дорогостоящего поиска по популяции агентов.

Решение: SBCO

Авторы предлагают SBCO (Self-supervised Block Coordinate Optimizer) — оптимизатор «опоры» (harness) агента, который не требует самореференции. Метод использует фиксированного мета-агента и учится на собственном опыте через приблизительно восходящий блочный координатный спуск (approximate block coordinate ascent). Ключевая особенность — использование банка верификаторов, обученных без участия человека (self-supervised), для оценки качества решений.

Результаты и сравнение

Эксперименты показали, что SBCO достигает результатов, сопоставимых с или превосходящих кастомизированные базовые линии с самоизменением, но при значительно меньших затратах. Ниже приведено сравнение эффективности методов:

Метод Тип оптимизации Относительные затраты вычислений Результативность
SBCO Без самореференции, верификаторы 1x (Базовый уровень) Превосходит или равен базовым линиям
Self-modifying Baseline Самомодификация кода 4.0x - 5.5x Сопоставимо с SBCO

Таким образом, SBCO позволяет планирующим агентам улучшать свои стратегии на основе обратной связи от собственных оценок, устраняя необходимость в человеческой разметке и дорогостоящих итерациях переписывания кода.

Источник: arXiv cs.AI ↗