Проблема: Токеноемкость самоусовершенствования
Развитие AI-агентов перешло от написания строк кода к автономному решению сложных задач в репозиториях. Однако масштабирование таких систем через рекурсивное самоусовершенствование (RSI) сталкивается с главной проблемой: каждый шаг улучшения требует огромных вычислительных ресурсов. Вопрос, который задали исследователи из NVLabs, звучит так: стоит ли сначала заставить AI оптимизировать сам процесс работы, прежде чем масштабировать его способности?
Ответом стал SoL-Pi (Scaling Auto-Research Loops for Efficient Agent Harnesses). Это не просто новая модель, а конвейер, где агенты исследуют публичные среды, анализируют траектории работы других моделей и создают механизмы, снижающие потребление токенов при сохранении функциональности.
Результаты: Конкретная экономия
SoL-Pi демонстрирует значительное снижение стоимости работы по сравнению с нативными решениями. Для профессионального исследователя, решающего одну задачу, оптимизированная система экономит:
- $8.75–$13.50 в час по сравнению с нативными harnesses для Codex и Claude Code.
- $4.36–$5.71 в час по сравнению с Pi (базовым легковесным harness).
Экономия рассчитана на основе официального API-ценообразования и актуальна для длительных автономных сессий, где накопленный эффект от оптимизации каждого токена становится критичным.
Методология: От 152 идей к 4 механизмам
Процесс создания SoL-Pi можно описать как «отбор выживших». Система сгенерировала 152 предложения по улучшению архитектуры агентов. Эти идеи проходили через независимые циклы валидации в различных публичных средах. В финальную сборку вошли только те механизмы, которые доказали свою эффективность и переносимость на новые задачи.
Ключевые выжившие механизмы (Surviving Mechanisms) можно разделить на несколько категорий:
| Категория | Примеры механизмов | Суть оптимизации |
|---|---|---|
| Контекст (C) | C1, C4, C19 | Использование давления контекста вместо глобальных лимитов, стабилизация префикса промпта, хранение журнала памяти только для добавления (append-only). |
| Прогресс (P) | P1, P7, P16 | Контроль прогресса на основе доказательств, добавление контроллера ремонта после сбоев, эскалация при блокировке выполнения. |
| Инструменты (T) | T2, T5, T23 | Ремонт некорректных полезной нагрузки инструментов, выполнение детерминированных последовательностей команд, использование языка-независимого менеджера задач. |
| Децентрализация (D) | D3, D12, D15 | Маршрутизация делегирования по необходимости в доказательствах, разделение ролей моделей по плотности принятия решений. |
Значение для индустрии
SoL-Pi указывает на сдвиг парадигмы: ценность RSI заключается не в создании одного идеального артефакта, а в разработке масштабируемого процесса поиска, который может применяться к публичным средам для обнаружения повторно используемых улучшений. Использование набора задач EdgeBench (51 задача долгосрочного выполнения) позволяет оценить эффективность агентов в условиях, близких к реальным, где важна не только скорость, но и стабильность результата.
Где найти код?
Полный код проекта и документация доступны на GitHub по адресу http://nvlabs.github.io/SoL-Pi/. Исследователи подчеркивают, что SoL-Pi — это фундамент для будущих оптимизаций, позволяющий снизить барьер входа в разработку сложных AI-систем.
Источник: Github ↗
