Исследования15 сентября 2026 г., 08:17 МСК🤖 Auto

GAI: Единая теория для самоулучшения ИИ и классического RL

Исследователи представили Generalized Agent Iteration (GAI) — формальную модель, объединяющую итеративное улучшение политик и рекурсивное самосовершенствование в единую парадигму.

Баннер новости 7511

От GPI к GAI: преодоление разрыва

Проблема рекурсивного самосовершенствования (RSI) долгое время оставалась зоной спекуляций: не существовало единого формального аппарата, описывающего этот феномен. Авторы работы — Хуняо Тан, И Ма, Пэнъи Ли и Ифу Юань — предлагают решение через концепцию Generalized Agent Iteration (GAI). Фреймворк позиционирует RSI не как магию, а как частный случай классической обобщенной итерации политик (GPI), где границы между внешним управлением и автономным развитием становятся четкими.

Два ключевых параметра системы

GAI определяет агента как конфигурацию изменяемых компонентов системы. Обучение моделируется как цикл оценки и улучшения. Авторы выделяют два «регулятора» (dials), которые определяют природу системы:

  • Встроенность механизма улучшения: Является ли алгоритм, улучшающий агента, частью самого агента?
  • Источник стандарта оценки: Замеряется ли прогресс относительно внешней метрики или внутренней референции?

Классификация систем: Анкер, дрейф и рефлексия

На основе этих двух осей GAI позволяет классифицировать существующие ИИ-системы и выявлять их уязвимости. Система может быть «заякоренной» (anchored), иметь «дрейф целей» (goal drift) или быть полностью самореференциальной. Это позволяет статистически описывать дефекты RSI по одному условию за раз.

Критерий Классическая GPI Рекурсивное самосовершенствование (RSI)
Механизм улучшения Вне агента (внешний оптимизатор) Внутри агента (само-модификация)
Источник стандарта Внешний (фиксированная цель) Внутренний или гибридный
Тип системы Анкерная (Anchored) Дрейфующая или самореференциальная

Значение для индустрии

Работа, опубликованная 11 сентября 2026 года, закладывает принципальную основу для анализа и проектирования новых автономных систем. GAI делает RSI сопоставимым с классическим машинным обучением, позволяя исследователям формально описывать, где именно в цепи автономного развития возникает риск неконтролируемого дрейфа целей или деградации производительности.

Источник: arXiv cs.AI ↗