Проблема самореференции в AI
Современные подходы к самообучению, такие как Darwin Gödel Machine и Huxley Gödel Machine, позволяют агентам переписывать собственный код. Однако этот метод работает только там, где компетенция для выполнения задачи совпадает с компетенцией для модификации кода (например, в программировании). Для сложных планирующих задач с жесткими ограничениями такой подход либо невозможен, либо требует дорогостоящего поиска по популяции агентов.
Решение: SBCO
Авторы предлагают SBCO (Self-supervised Block Coordinate Optimizer) — оптимизатор «опоры» (harness) агента, который не требует самореференции. Метод использует фиксированного мета-агента и учится на собственном опыте через приблизительно восходящий блочный координатный спуск (approximate block coordinate ascent). Ключевая особенность — использование банка верификаторов, обученных без участия человека (self-supervised), для оценки качества решений.
Результаты и сравнение
Эксперименты показали, что SBCO достигает результатов, сопоставимых с или превосходящих кастомизированные базовые линии с самоизменением, но при значительно меньших затратах. Ниже приведено сравнение эффективности методов:
| Метод | Тип оптимизации | Относительные затраты вычислений | Результативность |
|---|---|---|---|
| SBCO | Без самореференции, верификаторы | 1x (Базовый уровень) | Превосходит или равен базовым линиям |
| Self-modifying Baseline | Самомодификация кода | 4.0x - 5.5x | Сопоставимо с SBCO |
Таким образом, SBCO позволяет планирующим агентам улучшать свои стратегии на основе обратной связи от собственных оценок, устраняя необходимость в человеческой разметке и дорогостоящих итерациях переписывания кода.
Источник: arXiv cs.AI ↗
