От GPI к GAI: преодоление разрыва
Проблема рекурсивного самосовершенствования (RSI) долгое время оставалась зоной спекуляций: не существовало единого формального аппарата, описывающего этот феномен. Авторы работы — Хуняо Тан, И Ма, Пэнъи Ли и Ифу Юань — предлагают решение через концепцию Generalized Agent Iteration (GAI). Фреймворк позиционирует RSI не как магию, а как частный случай классической обобщенной итерации политик (GPI), где границы между внешним управлением и автономным развитием становятся четкими.
Два ключевых параметра системы
GAI определяет агента как конфигурацию изменяемых компонентов системы. Обучение моделируется как цикл оценки и улучшения. Авторы выделяют два «регулятора» (dials), которые определяют природу системы:
- Встроенность механизма улучшения: Является ли алгоритм, улучшающий агента, частью самого агента?
- Источник стандарта оценки: Замеряется ли прогресс относительно внешней метрики или внутренней референции?
Классификация систем: Анкер, дрейф и рефлексия
На основе этих двух осей GAI позволяет классифицировать существующие ИИ-системы и выявлять их уязвимости. Система может быть «заякоренной» (anchored), иметь «дрейф целей» (goal drift) или быть полностью самореференциальной. Это позволяет статистически описывать дефекты RSI по одному условию за раз.
| Критерий | Классическая GPI | Рекурсивное самосовершенствование (RSI) |
|---|---|---|
| Механизм улучшения | Вне агента (внешний оптимизатор) | Внутри агента (само-модификация) |
| Источник стандарта | Внешний (фиксированная цель) | Внутренний или гибридный |
| Тип системы | Анкерная (Anchored) | Дрейфующая или самореференциальная |
Значение для индустрии
Работа, опубликованная 11 сентября 2026 года, закладывает принципальную основу для анализа и проектирования новых автономных систем. GAI делает RSI сопоставимым с классическим машинным обучением, позволяя исследователям формально описывать, где именно в цепи автономного развития возникает риск неконтролируемого дрейфа целей или деградации производительности.
Источник: arXiv cs.AI ↗
