Исследования13 июля 2026 г., 01:17 МСК🤖 Auto

Loop Engineering: Как autoresearch от Карпаша ускоряет ML на 11%

Andrej Karpathy представил open-source фреймворк autoresearch, превращающий AI-агентов в автономных исследователей. Новый подход к Loop Engineering демонстрирует, как автоматизация итераций превосходит человеческие возможности.

Баннер новости 3414

От промпта к циклу: новая парадигма

Традиционное взаимодействие с ИИ напоминает поиск 2015 года: пользователь вводит запрос, читает ответ, вводит следующий. Loop Engineering (инженерия циклов) меняет этот паттерн. Вместо разовых инструкций создается замкнутый цикл, где модель самостоятельно планирует, действует, проверяет результат и повторяет процесс до достижения цели. Ключевое отличие: стоимость работы оплачивается только за измеримый прогресс, а не за время простоя.

Архитектура надежного цикла

Любой рабочий Loop состоит из трех обязательных компонентов, отделяющих его от бесконечного чат-бота:

  • Verifier (Верификатор): автоматическая проверка, которая оценивает каждую попытку. Без него агент просто соглашается сам с собой.
  • State (Состояние): файл журнала, фиксирующий успешные и неудачные эксперименты, позволяющий продолжить работу с места остановки.
  • Stop condition (Условие остановки): механизм предотвращения бесконечных затрат, останавливающий цикл при достижении цели или исчерпании лимита итераций.

Карпашев цикл: внутри autoresearch

7 марта 2026 года Андреj Карпаши выпустил репозиторий autoresearch под лицензией MIT. Проект, набравший около 90 000 звезд на GitHub, работает строго: агент может редактировать только файл train.py (модель, оптимизатор, цикл обучения), но не имеет доступа к prepare.py (утилиты оценки). Это предотвращает «подкручивание» тестов.

Каждый цикл занимает 5 минут на обучение. При бюджете в 12 экспериментов в час, за ночь запускается около 100 итераций. Метрика успеха — val_bpb (validation bits per byte), где меньшее значение лучше.

Результаты: 11% ускорения и 5x прирост

На практике autoresearch показал впечатляющие результаты. За два дня было проведено ~700 экспериментов, из которых сохранено 20 реальных улучшений. Это сократило время обучения модели качества GPT-2 с 2.02 до 1.80 часов (экономия 11%). Одно из ключевых открытий — исправление отсутствия скалярного множителя в QK-Norm, что устранило излишнюю диффузию внимания.

CEO Shopify Тоби Лютке провел аналогичный эксперимент на внутренней модели, получив улучшение на 19% всего за 37 экспериментов. Карпаша делает вывод: если есть объективная метрика, главным ограничителем остается человек, а не ИИ.

Аспект Один промпт Karpathy Loop (autoresearch) Bilevel Autoresearch
Кто итерирует Человек Внутренний агент Внутренний + внешний агент
Верификатор Вручную prepare.py / val_bpb Та же метрика, два уровня
Состояние Только чат Лог экспериментов Лог + внедренный код
Роль человека Двигатель Автор program.md Автор program.md
Результат Зависит от случая 700 запусков → 20 фиксов, +11% скорости Снижение val_bpb в 5 раз больше

Bilevel Autoresearch: Мета-исследование

Исследователи пошли дальше, задав вопрос: можно ли исследовать само исследование? В работе Bilevel Autoresearch представлена архитектура с двумя уровнями. Внутренний цикл (как в autoresearch) предлагает изменения, а внешний цикл анализирует логи внутреннего, выявляет застой и внедряет новые Python-механизмы для принудительного исследования новых путей.

На бенчмарке предобучения GPT внешний цикл обеспечил снижение val_bpb в 5 раз больше, чем одиночный цикл (-0.045 против -0.009). Важно, что оба цикла использовали одну и ту же LLM, что доказывает: прирост достигнут за счет архитектуры поиска, а не более умной модели. Эксперименты проводились на RTX 5090 32GB с бюджетом 300 секунд на итерацию.

Пять блоков для создания Loop

Современные AI-инженерные команды собирают рабочие циклы из пяти переиспользуемых компонентов:

  • Automation: запуск цикла по расписанию или триггеру.
  • Skill: хранение знаний проекта в Markdown-файле.
  • Sub-agents: разделение ролей писца и рецензента для объективности.
  • Connectors: интеграция с реальными инструментами (Slack, Issue Tracker).
  • Verifier: строгий фильтр, отклоняющий плохие решения.

Такие инструменты, как Claude Code и Codex, уже включают все пять блоков, позволяя инженерам сосредоточиться на дизайне целей, а не на рутинных итерациях.

Источник: MarkTechPost ↗