Релиз модели29 сентября 2026 г., 15:21 МСК🤖 Auto

Google RRSI: AI-агенты учатся без переобучения, меняя только промпты

Google Research открыл код RRSI — системы, где LLM-агент улучшает свой собственный «шасси» (промпты, инструменты, память), избегая типичной ловушки переобучения на тестовых данных.

Баннер новости 8510

Проблема самообучения: почему агенты «зависают»

Обычные циклы эволюции агентов предлагают правки, оценивают их на фиксированном наборе задач и оставляют лучшие. Проблема в том, что модель начинает запоминать эти конкретные задачи, а не учиться решать их эффективно. Исследователи из Google, UNC-Chapel Hill, Stanford и Washington University выделяют три главные ошибки таких систем:

  • Benchmark-specific fitting: подстройка под конкретные тесты.
  • Noise chasing: погоня за случайными флуктуациями метрик.
  • Complexity accumulation: накопление ненужной сложности в коде агента.

RRSI (Regularized Recursive Self-Improvement) решает это, не меняя веса модели (weights frozen), а регулируя сам процесс поиска улучшений в «шасси» агента.

Как работает RRSI: регуляризация вместо хаоса

Система использует три механизма, аналогичных классическим регуляризаторам в машинном обучении:

  • Аналог L0 (Edit Budget): Косинусное расписание бюджета правок. На ранних этапах агент может вносить несколько изменений сразу, чтобы найти механизм. На поздних — только одно, но обоснованное изменение.
  • Аналог Lasso/L1 (Pruning): Компоненты, которые перестали давать прирост, удаляются. Это держит код агента чистым.
  • Аналог Ridge/L2 (Cost Rule): Дополнительные токены, потраченные на инференс, должны окупаться измеренным приростом качества. Если улучшение есть, но оно слишком дорогое — правка отклоняется.

Также внедрен Leakage Critic, который отбрасывает правки, содержащие названия задач, сущности или логику, специфичную только для бенчмарка, еще до начала оценки.

Результаты: обобщение без переобучения

Главное достижение RRSI — рост метрик на данных, которые агент никогда не видел во время обучения (Out of Distribution). В отличие от конкурентов, которые могут показывать высокие результаты на обучающей выборке, RRSI сохраняет способность работать в новых условиях.

Метрика / Бенчмарк До RRSI После RRSI Примечание
Terminal-Bench 2.1 (Evolve) 74.2% 80.2% С Claude Opus 4.8
SWE-bench Verified (Never seen) 82.0% 83.8% Ключевой тест на обобщение
JobBench (OOD) — +4.7 Прирост в баллах
GDPval (OOD) — +3.5 Прирост в баллах
APEX-Agents (OOD) — +3.7 Прирост в баллах
Эффективность токенов 3.80M 2.42M Экономия до 36% токенов

Сравнение с конкурентами

RRSI демонстрирует лучший баланс между качеством на обучающей выборке и способностью работать в новых условиях. Метрика OOD (Out of Distribution) у RRSI выше, чем у всех сравнимых методов, что подтверждает отсутствие переобучения.

Метод Harvey LAB (Evolve) OOD Average (H0=39.7) Регуляризация (Cost/Pruning)
RRSI 90.5 43.6 Да
Meta-Harness 93.0 40.6 Нет
AHE 90.7 39.2 Нет
TTHE 91.1 38.0 Нет
Harvey LAB 91.8 39.7 Нет

Как запустить

Код доступен под лицензией Apache 2.0. Требуется Python 3.10+ и поддержка LiteLLM. По умолчанию система настроена на работу с Claude Opus 4.8 через Vertex AI, но поддерживает любые модели через строку LiteLLM. Для работы с доменом программирования также требуется Docker и Harbor.

RRSI — это исследовательский фреймворк, а не готовый продукт Google, но он открывает путь к созданию более надежных и эффективных автономных AI-агентов, которые не «зависают» на старых данных.

Бенчмарки

БенчмаркRRSIRRSI (Claude Opus 4.8)RRSI (Gemini 3.5 Flash)AHEMeta-HarnessTTHE
Terminal-Bench 2.1—80.2%78.7%———
SWE-bench Verified—83.8%79%———
Harvey LAB90.5%——90.7%93%91.1%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗