Главная/Блог/Гайд/Loop Engineering: Как автономные циклы…
Гайд9 мин чтения · 13 июля 2026 г.

Loop Engineering: Как автономные циклы меняют разработку AI

Откройте для себя Loop Engineering — новый подход к созданию AI-агентов, где модель сама итеративно улучшает код и результаты. Разбор архитектуры autoresearch и Bilevel Autoresearch.

Loop Engineering: Как автономные циклы меняют разработку AI

Большинство пользователей до сих пор взаимодействуют с искусственным интеллектом так, как это было принято в 2015 году: вы вводите запрос, читаете ответ, формулируете новый запрос и снова ждете. Это линейный, ручной процесс, требующий постоянного участия человека. Однако появляется новый паттерн, который заменяет это ручное перетасовывание на замкнутый цикл. Этот подход называется Loop Engineering (инженерия циклов). В этой статье мы подробно разберем, как работают такие системы, используя два проверенных артефакта: репозиторий autoresearch от Андрея Карпаша и научную статью Bilevel Autoresearch. Фреймворк объяснения базируется на материалах эксперта @0xCodila.

В отличие от обычного чат-бота, где вы управляете каждым шагом, в Loop Engineering вы один раз определяете цель, а система сама планирует действия, проверяет результаты и повторяет попытки до достижения успеха. Ключевой момент здесь заключается в том, что стоимость таких вычислений оправдана только тогда, когда работа измерима и имеет четкий критерий успеха. Давайте погрузимся в детали этой технологии.

Обложка статьи о Loop Engineering
Обложка статьи о Loop Engineering

01Что такое Loop Engineering?

Чтобы понять суть, сравните два режима работы. В традиционном промптинге вы даете одну инструкцию, а затем решаете, какой будет следующий шаг. В режиме цикла модель получает цель и преследует ее до тех пор, пока не достигнет результата. Модель планирует, действует, проверяет свой собственный результат, а затем повторяет процесс. Вы задаете объектив один раз, а цикл берет на себя итерации.

Важно отметить, что цикл оправдывает свои вычислительные затраты только тогда, когда работа поддается измерению. Без четкого метрического критерия система не может понять, улучшился ли результат или нет, превращаясь в бесконечный цикл самовнушения. Именно поэтому Loop Engineering требует строгой архитектуры, состоящей из трех ключевых компонентов.

Три части, которые заставляют цикл работать

Что отличает настоящий цикл от просто «чатбота на повторе»? Каждый надежный цикл состоит из трех обязательных элементов:

  1. Верификатор (Verifier): Он оценивает каждую попытку. Эта проверка может быть прохождением теста, изменением метрики или успешной сборкой проекта. Без верификатора агент просто соглашается сам с собой, повторяя одни и те же ошибки.
  2. Состояние (State): Записывает, что было尝试ено, что не сработало, а что осталось. Небольшой файл состояния позволяет следующему запуску продолжить работу, а не начинать с нуля.
  3. Условие остановки (Stop condition): Предотвращает неконтролируемые расходы. Цикл останавливается, когда цель достигнута или после N попыток.
💡
Совет. Не пытайтесь запустить цикл без верификатора. Это самый частый источник «галлюцинаций» в автономных агентах. Если вы не можете измерить успех, цикл не имеет смысла.

02Цикл Карпаша: Внутри проекта ‘autoresearch’

Эти три части — не просто теория. 7 марта 2026 года Андрей Карпаш выпустил autoresearch — репозиторий с открытым исходным кодом под лицензией MIT. Он содержит три основных файла и около 630 строк кода. Проект стал вирусным в течение нескольких дней и сейчас насчитывает около 90 000 звезд на GitHub. Позже этот паттерн получил название «Цикл Карпаша» (The Karpathy Loop).

Дизайн намеренно мал, но строг. Агент редактирует только файл train.py, который содержит модель GPT, оптимизаторы (Muon и AdamW) и цикл обучения. Он не может касаться утилит оценки в файле prepare.py. Это разделение предотвращает ситуацию, когда агент делает тест проще, вместо того чтобы улучшать модель. Тем временем человек пишет program.md — инструкции, которым агент должен следовать.

Каждый цикл запускает один эксперимент. Агент читает код, предлагает изменение, обучает модель в течение пяти минут, а затем сохраняет или откатывает изменения. Метрика оценки — val_bpb (validation bits per byte), где меньшее значение лучше. Этот бюджет позволяет проводить примерно 12 экспериментов в час, то есть около 100 за ночь.

Loop Engineering: Как автономные циклы меняют разработку AI

Конкретные результаты

Результаты, полученные Карпашем, являются конкретными. Он направил свой инструмент на уже оптимизированный код обучения GPT-2 под названием nanochat. Он работал в течение двух дней и выполнил около 700 экспериментов, сохранив 20 настоящих улучшений. В совокупности эти исправления сократили время обучения модели качества GPT-2 на 11%, с 2,02 до 1,80 часов. Одно из открытий касалось реализации QK-Norm, которая не имела скалярного множителя, из-за чего внимание было слишком рассеянным по всем головам (heads).

Примечательно, что люди устают примерно после десятка экспериментов, тогда как цикл не устает. Отдельно CEO Shopify Тоби Лютке запустил autoresearch на внутренней модели на ночь. Он сообщил об улучшении на 19% после 37 экспериментов. Вывод Карпаша прост: если у вас есть объективная метрика, вы становитесь узким местом, а не агент.

03Промпт против Цикла против Двухуровневого Цикла

Различия становятся очевидными при сравнении в таблице. Традиционный промпт требует от вас определения каждого шага и ручной проверки. Цикл Карпаша делегирует итерации внутреннему агенту, используя автоматический верификатор. Двухуровневый цикл (Bilevel) добавляет еще один уровень абстракции.

d>Отчетный результат
Аспект Одноразовый промпт Цикл Карпаша (autoresearch) Bilevel Autoresearch
Что вы определяете Каждый шаг Цель один раз Цель один раз
Кто итерирует Вы Внутренний агент Внутренний + внешний агент
Верификатор Вы, вручную prepare.py / val_bpb Та же метрика, два уровня
Состояние Только чат Журнал экспериментов Журнал + внедренный код
Роль человека Двигатель Автор program.md Автор program.md
Разный 700 запусков → 20 исправлений, ускорение на 11% Снижение val_bpb в 5 раз

04Пять строительных блоков Loop Engineering

Следовательно, команды AI-инженерии теперь собирают рабочие циклы из пяти переиспользуемых компонентов. Это позволяет стандартизировать процесс и сделать его масштабируемым.

  1. Автоматизация (Automation): Запускает цикл по расписанию, событию или триггеру. Это позволяет работать автономно, пока вы спите.
  2. Навык (Skill): Хранит знания проекта в файле markdown, который читается при каждом запуске. Это обеспечивает контекстную память.
  3. Под-агенты (Sub-agents): Разделяют писателя и рецензента, так как одна модель слишком щедро оценивает свою собственную работу.
  4. Коннекторы (Connectors): Позволяют циклу действовать внутри реальных инструментов, таких как трекер задач или Slack.
  5. Верификатор (Verifier): Остается воротами, которые отклоняют плохую работу. Claude Code и Codex теперь поставляются со всеми пятью компонентами.
⚠️ Важно.
Разделение ролей. Никогда не позволяйте одному и тому же агенту и писать код, и оценивать его. Всегда используйте отдельный верификатор или под-агент для проверки качества, иначе вы получите ложноположительные результаты.

05Bilevel Autoresearch: Цикл поверх Цикла

Затем исследователи задали более острый вопрос. Если autoresearch — это исследование, можно ли исследовать autoresearch? Научная статья Bilevel Autoresearch: Meta-Autoresearching Itself отвечает утвердительно.

Внутренний цикл совпадает с оригинальным Карпашем: предложить, обучить, оценить, сохранить или отбросить. Внешний цикл наблюдает за внутренним циклом, читает его код и трассировки. Он выявляет, где поиск застревает. Затем он пишет новые механизмы на Python, внедряет их во время выполнения и перезапускает внутренний цикл.

Loop Engineering: Как автономные циклы меняют разработку AI

Результат подтвердился на бенчмарке предварительного обучения GPT от Карпаша. Внешний цикл снизил val_bpb в 5 раз больше, чем одиночный цикл (-0.045 против -0.009). Примечательно, что оба цикла использовали одну и ту же LLM, поэтому прирост произошел за счет архитектуры, а не более умной модели. На практике дизайн разделяется на три уровня. Уровень 1 запускает базовый цикл. Уровень 1.5 настраивает параметры поиска каждые пять итераций. Уровень 2 генерирует механизмы через четырехраундовую сессию. Отчетные эксперименты использовали RTX 5090 32GB и бюджет в 300 секунд.

Причина этого успеха стоит внимания. Внутренний цикл постоянно возвращался к одним и тем же приоритетам, даже после того, как они перестали работать. Внешний цикл ломал эти паттерны, принуждая к незнакомому исследованию.

06Примеры использования

Эти идеи хорошо переносятся за пределы предварительного обучения. Для работы с моделями цикл ищет гиперпараметры до тех пор, пока val_bpb не упадет. Для программного обеспечения он рефакторит код до тех пор, пока тесты, типы и сборка не пройдут. Для контента он переписывает текст до тех пор, пока каждый балл по рубрике не превысит порог. Для данных он настраивает конвейер до тех пор, пока проверки схемы не будут выполнены. Каждый случай имеет одну общую черту: автоматические ворота, которые могут отклонить работу.

07Попробуйте сами: Цикл в одном промпте

Отбросив теорию, вы можете почувствовать механику без Claude Code или Codex. Вставьте этот промпт в любую способную модель и посмотрите, как она исправляет себя.

terminaltext
Use a different Browser
You will work in a loop until the task meets the bar

TASK
describe exactly what you want produced

SUCCESS CRITERIA
be strict
criterion
criterion
criterion

LOOP PROTOCOL
repeat every turn
1. PLAN
state the single next step
2. DO
produce or improve the work
3. VERIFY
score the result 10 on each criterion
Be honest
4. DECIDE
if every criterion is print FINAL and stop
Otherwise print ITERATING and fix the weakest point first

RULES
Never call it done until every criterion is or higher
Each pass must fix the weakest score from the last VERIFY
Do not ask questions
Make a sensible assumption and continue
Begin

Под капотом поток управления мал. Скелет ниже показывает эти три части на Python: верификатор, решение и два условия остановки.

terminalpython
current = baseline
best = evaluate(current)

# verifier: lower val_bpb is better
for step in range(MAX_STEPS):
    # stop condition 1: experiment budget
    candidate = propose_change(current)
    # agent edits train.py
    score = train_and_eval(candidate)
    # train 5 min, then verify
    
    if score < best:
        # keep only real improvements
        current = best = candidate
        score = best
        # commit
    else:
        # else: discard candidate, restore baseline
        pass
        
    if best <= TARGET:
        # stop condition 2: goal met
        break

Обе версии ограничены. Вы все еще являетесь триггером, а закрытие вкладки стирает состояние. Добавление автоматизации, файла состояния и реальных ворот превратит это в автономный цикл.

08Что это значит на практике

Loop Engineering — это не просто модное слово, это сдвиг парадигмы в разработке AI. Он переносит работу с написания промптов на проектирование систем и проверку результатов. Агенты не заменяют человеческое мышление, они освобождают его от рутины. Если вы можете измерить успех, вы можете автоматизировать улучшение. Начните с малого: добавьте простой верификатор к своему следующему проекту и посмотрите, как цикл найдет улучшения, которые вы могли бы пропустить.

📌 Факт.
Цикл Карпаша. За ночь было выполнено 700 экспериментов, сохранено 20 исправлений, что дало ускорение на 11%. Это доказывает, что масштаб итераций важнее сложности одного промпта.

09Ключевые выводы

  • Цикл требует трех частей: верификатор, постоянное состояние и условие остановки.
  • autoresearch позволяет агенту редактировать только train.py и никогда не трогать оценщик.
  • Ночные запуски Карпаша сохранили 20 исправлений из 700 экспериментов, обеспечив ускорение на 11%.
  • Bilevel Autoresearch добавляет внешний цикл для получения выигрыша в 5 раз по метрике val_bpb.
  • Циклы смещают работу в сторону дизайна и обзора; они не устраняют необходимость думать.

Источник: MarkTechPost ↗