Проблема самообучения: почему агенты «зависают»
Обычные циклы эволюции агентов предлагают правки, оценивают их на фиксированном наборе задач и оставляют лучшие. Проблема в том, что модель начинает запоминать эти конкретные задачи, а не учиться решать их эффективно. Исследователи из Google, UNC-Chapel Hill, Stanford и Washington University выделяют три главные ошибки таких систем:
- Benchmark-specific fitting: подстройка под конкретные тесты.
- Noise chasing: погоня за случайными флуктуациями метрик.
- Complexity accumulation: накопление ненужной сложности в коде агента.
RRSI (Regularized Recursive Self-Improvement) решает это, не меняя веса модели (weights frozen), а регулируя сам процесс поиска улучшений в «шасси» агента.
Как работает RRSI: регуляризация вместо хаоса
Система использует три механизма, аналогичных классическим регуляризаторам в машинном обучении:
- Аналог L0 (Edit Budget): Косинусное расписание бюджета правок. На ранних этапах агент может вносить несколько изменений сразу, чтобы найти механизм. На поздних — только одно, но обоснованное изменение.
- Аналог Lasso/L1 (Pruning): Компоненты, которые перестали давать прирост, удаляются. Это держит код агента чистым.
- Аналог Ridge/L2 (Cost Rule): Дополнительные токены, потраченные на инференс, должны окупаться измеренным приростом качества. Если улучшение есть, но оно слишком дорогое — правка отклоняется.
Также внедрен Leakage Critic, который отбрасывает правки, содержащие названия задач, сущности или логику, специфичную только для бенчмарка, еще до начала оценки.
Результаты: обобщение без переобучения
Главное достижение RRSI — рост метрик на данных, которые агент никогда не видел во время обучения (Out of Distribution). В отличие от конкурентов, которые могут показывать высокие результаты на обучающей выборке, RRSI сохраняет способность работать в новых условиях.
| Метрика / Бенчмарк | До RRSI | После RRSI | Примечание |
|---|---|---|---|
| Terminal-Bench 2.1 (Evolve) | 74.2% | 80.2% | С Claude Opus 4.8 |
| SWE-bench Verified (Never seen) | 82.0% | 83.8% | Ключевой тест на обобщение |
| JobBench (OOD) | — | +4.7 | Прирост в баллах |
| GDPval (OOD) | — | +3.5 | Прирост в баллах |
| APEX-Agents (OOD) | — | +3.7 | Прирост в баллах |
| Эффективность токенов | 3.80M | 2.42M | Экономия до 36% токенов |
Сравнение с конкурентами
RRSI демонстрирует лучший баланс между качеством на обучающей выборке и способностью работать в новых условиях. Метрика OOD (Out of Distribution) у RRSI выше, чем у всех сравнимых методов, что подтверждает отсутствие переобучения.
| Метод | Harvey LAB (Evolve) | OOD Average (H0=39.7) | Регуляризация (Cost/Pruning) |
|---|---|---|---|
| RRSI | 90.5 | 43.6 | Да |
| Meta-Harness | 93.0 | 40.6 | Нет |
| AHE | 90.7 | 39.2 | Нет |
| TTHE | 91.1 | 38.0 | Нет |
| Harvey LAB | 91.8 | 39.7 | Нет |
Как запустить
Код доступен под лицензией Apache 2.0. Требуется Python 3.10+ и поддержка LiteLLM. По умолчанию система настроена на работу с Claude Opus 4.8 через Vertex AI, но поддерживает любые модели через строку LiteLLM. Для работы с доменом программирования также требуется Docker и Harbor.
RRSI — это исследовательский фреймворк, а не готовый продукт Google, но он открывает путь к созданию более надежных и эффективных автономных AI-агентов, которые не «зависают» на старых данных.
Бенчмарки
| Бенчмарк | RRSI | RRSI (Claude Opus 4.8) | RRSI (Gemini 3.5 Flash) | AHE | Meta-Harness | TTHE |
|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | — | 80.2% | 78.7% | — | — | — |
| SWE-bench Verified | — | 83.8% | 79% | — | — | — |
| Harvey LAB | 90.5% | — | — | 90.7% | 93% | 91.1% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
