От промпта к циклу: новая парадигма
Традиционное взаимодействие с ИИ напоминает поиск 2015 года: пользователь вводит запрос, читает ответ, вводит следующий. Loop Engineering (инженерия циклов) меняет этот паттерн. Вместо разовых инструкций создается замкнутый цикл, где модель самостоятельно планирует, действует, проверяет результат и повторяет процесс до достижения цели. Ключевое отличие: стоимость работы оплачивается только за измеримый прогресс, а не за время простоя.
Архитектура надежного цикла
Любой рабочий Loop состоит из трех обязательных компонентов, отделяющих его от бесконечного чат-бота:
- Verifier (Верификатор): автоматическая проверка, которая оценивает каждую попытку. Без него агент просто соглашается сам с собой.
- State (Состояние): файл журнала, фиксирующий успешные и неудачные эксперименты, позволяющий продолжить работу с места остановки.
- Stop condition (Условие остановки): механизм предотвращения бесконечных затрат, останавливающий цикл при достижении цели или исчерпании лимита итераций.
Карпашев цикл: внутри autoresearch
7 марта 2026 года Андреj Карпаши выпустил репозиторий autoresearch под лицензией MIT. Проект, набравший около 90 000 звезд на GitHub, работает строго: агент может редактировать только файл train.py (модель, оптимизатор, цикл обучения), но не имеет доступа к prepare.py (утилиты оценки). Это предотвращает «подкручивание» тестов.
Каждый цикл занимает 5 минут на обучение. При бюджете в 12 экспериментов в час, за ночь запускается около 100 итераций. Метрика успеха — val_bpb (validation bits per byte), где меньшее значение лучше.
Результаты: 11% ускорения и 5x прирост
На практике autoresearch показал впечатляющие результаты. За два дня было проведено ~700 экспериментов, из которых сохранено 20 реальных улучшений. Это сократило время обучения модели качества GPT-2 с 2.02 до 1.80 часов (экономия 11%). Одно из ключевых открытий — исправление отсутствия скалярного множителя в QK-Norm, что устранило излишнюю диффузию внимания.
CEO Shopify Тоби Лютке провел аналогичный эксперимент на внутренней модели, получив улучшение на 19% всего за 37 экспериментов. Карпаша делает вывод: если есть объективная метрика, главным ограничителем остается человек, а не ИИ.
| Аспект | Один промпт | Karpathy Loop (autoresearch) | Bilevel Autoresearch |
|---|---|---|---|
| Кто итерирует | Человек | Внутренний агент | Внутренний + внешний агент |
| Верификатор | Вручную | prepare.py / val_bpb | Та же метрика, два уровня |
| Состояние | Только чат | Лог экспериментов | Лог + внедренный код |
| Роль человека | Двигатель | Автор program.md | Автор program.md |
| Результат | Зависит от случая | 700 запусков → 20 фиксов, +11% скорости | Снижение val_bpb в 5 раз больше |
Bilevel Autoresearch: Мета-исследование
Исследователи пошли дальше, задав вопрос: можно ли исследовать само исследование? В работе Bilevel Autoresearch представлена архитектура с двумя уровнями. Внутренний цикл (как в autoresearch) предлагает изменения, а внешний цикл анализирует логи внутреннего, выявляет застой и внедряет новые Python-механизмы для принудительного исследования новых путей.
На бенчмарке предобучения GPT внешний цикл обеспечил снижение val_bpb в 5 раз больше, чем одиночный цикл (-0.045 против -0.009). Важно, что оба цикла использовали одну и ту же LLM, что доказывает: прирост достигнут за счет архитектуры поиска, а не более умной модели. Эксперименты проводились на RTX 5090 32GB с бюджетом 300 секунд на итерацию.
Пять блоков для создания Loop
Современные AI-инженерные команды собирают рабочие циклы из пяти переиспользуемых компонентов:
- Automation: запуск цикла по расписанию или триггеру.
- Skill: хранение знаний проекта в Markdown-файле.
- Sub-agents: разделение ролей писца и рецензента для объективности.
- Connectors: интеграция с реальными инструментами (Slack, Issue Tracker).
- Verifier: строгий фильтр, отклоняющий плохие решения.
Такие инструменты, как Claude Code и Codex, уже включают все пять блоков, позволяя инженерам сосредоточиться на дизайне целей, а не на рутинных итерациях.
Источник: MarkTechPost ↗
