В мире искусственного интеллекта, где гонка за производительностью моделей часто сводится к увеличению количества параметров и объема обучающих данных, появляется новый подход, который бросает вызов этой парадигме. Исследователи из Google Research совместно с Университетом Северной Каролины в Чапел-Хилл, Стэнфордом и Вашингтонским университетом в Сент-Луисе представили RRSI (Regularized Recursive Self-Improvement). Это не просто еще одна библиотека для автоматизации, а фундаментально новый механизм, позволяющий языковым моделям (LLM) переписывать собственный «инструментарий» (harness) — промпты, инструменты, память и логику управления — без изменения самих весов модели.
Почему это важно? Потому что традиционные методы самосовершенствования часто приводят к переобучению. Агент становится гением в решении конкретных задач из набора для обучения, но теряет способность справляться с новыми, неизвестными проблемами. RRSI решает эту проблему через строгую регуляризацию процесса улучшения. Это позволяет агенту становиться эффективнее, сохраняя при этом обобщающую способность. В этой статье мы подробно разберем, как работает эта технология, почему она превосходит аналоги и как ее можно применить на практике.
01Проблема самосовершенствования: почему агенты «зацикливаются»
Чтобы понять инновационность RRSI, нужно сначала разобраться в фундаментальной проблеме, которую она решает. Представьте себе процесс эволюции «инструментария» агента. Обычно он выглядит так: система предлагает правки в промпты или код инструментов, оценивает их эффективность на фиксированном наборе задач (evolve set) и оставляет лучшие варианты. Казалось бы, логичный путь к улучшению. Однако на практике этот подход сталкивается с тремя серьезными режимами отказа, которые исследователи RRSI называют «ловушками»:
- Специфичное для бенчмарка подстраивание (Benchmark-specific fitting): Агент начинает запоминать не общие паттерны решения задач, а конкретные формулировки или трюки, характерные для набора данных, на котором он обучается. Он учится «играть в игру», а не решать задачи.
- Погоня за шумом (Noise chasing): В процессе оценки производительности всегда присутствует случайная вариативность. Без строгих ограничений агент может принять случайное улучшение как закономерность и внедрить его, что в долгосрочной перспективе ухудшает результаты.
- Накопление сложности (Complexity accumulation): С каждым циклом улучшения инструмент становится все более запутанным и перегруженным. Это приводит к увеличению вычислительных затрат (количества токенов) без пропорционального роста полезности.
Именно эти три фактора создают разрыв между высокими баллами на тренировочных наборах и реальной способностью агента работать в новых условиях. RRSI был разработан специально для устранения этих разрывов через математически обоснованные ограничения.
02Как работает RRSI: архитектура регуляризации
RRSI не меняет веса самой языковой модели. Вместо этого он эволюционирует «инструментарий» — набор промптов, доступных инструментов, механизмов памяти и потоков управления. Ключевая инновация заключается в том, как система отбирает и применяет изменения. Процесс разделен на две основные части: предложение изменений (Proposal side) и их отбор (Selection side).
Стратегия предложений: от широкого поиска к точечным правкам
На этапе предложения RRSI использует три механизма, которые имитируют классические регуляризаторы в машинном обучении:
- Аннеалированный бюджет редактирования (Annealed edit budget): В ранних раундах система позволяет вносить несколько связанных изменений одновременно. Это помогает найти новые механизмы работы. По мере продвижения к концу процесса бюджет сужается, позволяя вносить только одно, четко обоснованное изменение за раз. Это аналог регуляризации L0, которая контролирует количество ненулевых элементов.
- Кредитование, основанное на доказательствах (Evidence-aware credit): Каждая кандидатура на изменение логируется с указанием компонента, гипотезы, разницы в коде, изменении балла и стоимости. Предлагатель (proposer) читает этот реестр, что предотвращает повторение заведомо провальных идей.
- Структурированное исследование (Structured exploration): Если прогресс застревает в пределах «шумовой зоны», бюджет перенаправляется на компоненты, которые ранее не использовались. Это стимулирует разнообразие решений.

Стратегия отбора: защита от утечек и шума
Даже если изменение предложено, оно должно пройти строгий контроль. RRSI использует следующие фильтры:
- Критик утечек (Leakage critic): Этот модуль отклоняет любые изменения, которые содержат названия задач, конкретные сущности или ответы, специфичные для бенчмарка. Это гарантирует, что агент не «подсматривает» ответы.
- Порог, скорректированный на шум (Noise-adjusted floor): Улучшение должно быть статистически значимым. Если прирост балла находится в пределах дисперсии, измеренной на базовом неизменном инструментарии, изменение отклоняется.
- Правило стоимости (Cost rule): Дополнительные затраты на токены должны быть оправданы измеренным приростом эффективности. Это аналог регуляризации Ridge (L2), которая штрафует за излишнюю сложность.
- Прuning (Обрезка): Компоненты, которые перестают приносить пользу, удаляются. Это аналог Lasso (L1), который обнуляет неважные веса.
03Результаты: эффективность и обобщение
Результаты тестирования RRSI демонстрируют не только рост производительности, но и, что более важно, улучшение способности к обобщению (generalization). Тестирование проводилось на восьми различных бенчмарках, включая как те, что использовались для обучения (evolve split), так и те, что были полностью скрыты от агента (held-out splits).
На бенчмарке Terminal-Bench 2.1 (набор для эволюции) результаты выросли с 74,2% до 80,2%. Но еще более впечатляющим является рост на бенчмарке SWE-bench Verified, который никогда не использовался для отбора изменений: с 82,0% до 83,8%. Это доказывает, что улучшения действительно переносятся на новые задачи.
Для оценки способности к обобщению (Out of Distribution, OOD) использовались JobBench, GDPval и APEX-Agents. RRSI показал прирост в +4,7, +3,5 и +3,7 балла соответственно. Все шесть скрытых наборов данных показали улучшение. Особенно интересно, что даже с более легкой моделью Gemini 3.5 Flash результаты на Terminal-Bench 2.1 выросли с 64,6% до 78,7%, а на SWE-bench Verified — с 76,8% до 79,0%.
Кроме того, RRSI делает процесс более эффективным. На экземпляре рабочего пространства агента RRSI использует 2,42 миллиона токенов политики за испытание, в то время как нерегуляризованная эволюция требует 3,80 миллиона. Это экономия от 30% до 36% вычислительных ресурсов.
04Сравнение с конкурентами
Чтобы оценить место RRSI в ландшафте технологий, сравним его с ближайшими аналогами: Meta-Harness, AHE, TTHE и HarnessX. Все методы используют один и тот же стартовый инструмент, политику и набор кандидатов, что делает сравнение справедливым.

Метод Meta-Harness показывает лучшие результаты на наборе Harvey LAB (93,0 против 90,5 у RRSI). Однако у него есть критический недостаток: он не имеет правил стоимости и обрезки, что приводит к переобучению. Средний балл RRSI на задачах вне распределения (OOD) составляет 43,6, что на более чем 1 балл выше базового уровня (H0 = 39,7). У конкурентов этот показатель либо ниже базового, либо незначительно выше, но без гарантии устойчивости.
05Практическое применение и развертывание
RRSI доступен как исследовательский фреймворк с лицензией Apache 2.0. Он написан на Python 3.10+ и совместим с любой моделью, поддерживаемой через LiteLLM. По умолчанию система настроена на использование Claude Opus 4.8 через Vertex AI, но это легко изменить.
Для запуска требуется Docker и инструмент harbor. Процесс включает клонирование репозитория, установку зависимостей и запуск скриптов для домена (например, программирования). Каждый раунд создает два кандидата в отдельных git-рабочих деревьях, проверяет их, оценивает и переключает ветку на победителя.
git clone https://github.com/google-research/rrsi.git && cd rrsi
pip install ".[dev]"
python3 rrsi.py --domain coding_baseline
python3 rrsi.py --domain coding_runНовые домены могут быть добавлены через единственный модуль-адаптер, что делает систему гибкой. Однако важно отметить, что это исследовательский проект, а не официальный продукт Google Cloud. Он требует технической экспертизы для настройки и интеграции в существующие пайплайны.
06Что это значит на практике
Для разработчиков и компаний, работающих с ИИ-агентами, RRSI открывает новые горизонты. Во-первых, он позволяет создавать более «умные» промпты и логику работы агентов без необходимости переобучения самих больших языковых моделей, что значительно дешевле и быстрее. Во-вторых, строгая регуляризация гарантирует, что улучшения не будут хрупкими. Агент, обученный с помощью RRSI, будет лучше справляться с нестандартными запросами клиентов или новыми типами задач, которые не были в обучающей выборке.
В контексте российского рынка, где доступ к некоторым облачным сервисам и моделям может быть ограничен, возможность использовать RRSI с любыми моделями через LiteLLM является большим плюсом. Локальный запуск на собственных серверах с открытыми моделями (такими как Llama или Qwen) становится технически осуществимым, что обеспечивает независимость от внешних поставщиков.
RRSI демонстрирует, что будущее ИИ — не только в увеличении размера моделей, но и в умении эффективно использовать их потенциал через правильную архитектуру взаимодействия. Это шаг к более автономным, надежным и экономичным ИИ-системам, которые могут самостоятельно адаптироваться к меняющемуся миру, не теряя своей сущности.
Источник: MarkTechPost ↗
