Автоматизация оптимизации через Auto-Research Loops
Команда из NVIDIA, Национального университета Сингапура (NTU) и MIT выпустила SoL-Pi — набор из четырех механизмов эффективности для open-source агента Pi (версия 0.85.1). В отличие от традиционных методов, которые оптимизируют стоимость отдельного токена (квантование, быстрые ядра), SoL-Pi сокращает общее количество токенов, потребляемых задачей, на уровне harness (слоя управления инструментами, контекстом и делегированием).
Ключевая инновация — использование авто-исследовательских циклов (auto-research loops). Исследовательский AI анализировал трассы выполнения базового агента Pi, предлагал изменения и тестировал их в 535 изолированных средах (495 на основе GitHub issue/PR и 40 синтетических задач). Были протестированы 152 направления оптимизации, выполнено более 3000 запусков и 60 000 взаимодействий «агент-среда».
4 механизма, прошедшие отбор
Из множества кандидатов выжили четыре механизма, которые работают без модификации ядра Pi:
- Action Fusion: Объединяет редактирование файла и последующую команду тестирования/запуска в один запрос к инструменту. Это устраняет лишний «круг» общения с моделью.
- Online Context Compact: Динамическая сжатие контекста. Система оценивает, выгоднее ли переписать кэш промпта сейчас, чем ждать заполнения окна контекста.
- ObservationPack: Выводы инструментов объемом более 10 КБ архивируются локально. Модель видит только стабильный хендл и краткую выдержку, получая полный доступ по запросу.
- Evidence-Preserving Reducer: Длинные логи сборки и тестирования (от 4 КБ) отправляются в более дешевую модель GPT-5.6 Luna для создания компактного чека. Детерминированный верификатор проверяет целостность данных, чтобы избежать галлюцинаций.
Результаты на бенчмарках
Оценка проводилась на наборе данных EdgeBench (51 задача). SoL-Pi демонстрирует значительное снижение потребления ресурсов при сохранении качества кода. Ниже приведено сравнение производительности и стоимости на базе моделей GPT-5.6 Sol и Opus 5:
| Backend | Harness | Токены (B) | Стоимость API | Средний балл |
|---|---|---|---|---|
| GPT-5.6 Sol | Codex | 3.05 | $1,787 | 34.7 |
| GPT-5.6 Sol | Pi (Base) | 2.15 | $1,339 | 44.8 |
| GPT-5.6 Sol | SoL-Pi [Efficiency] | 1.10 | $894 | 42.0 |
| GPT-5.6 Sol | SoL-Pi [Performance] | 2.02 | $1,271 | 47.2 |
| Opus 5 | Claude Code | 2.00 | $2,535 | 43.7 |
| Opus 5 | Pi (Base) | 2.37 | $1,741 | 44.8 |
| Opus 5 | SoL-Pi [Efficiency] | 1.31 | $1,158 | 42.2 |
| Opus 5 | SoL-Pi [Performance] | 2.10 | $1,605 | 50.5 |
Ключевые метрики:
- Снижение трафика токенов на 44.7% – 49.0% по сравнению с базовым Pi.
- Сокращение затрат на API примерно на 33%.
- Сохранение 93.7–94.3% от качества базового Pi.
- В режиме Performance (использование лучшего механизма для каждой модели) SoL-Pi даже превосходит базовый Pi по качеству: +5.3% на GPT-5.6 Sol и +12.8% на Opus 5.
Практическое применение и переносимость
Решение доступно на GitHub под лицензией MIT и работает с Node.js 22.19+. В тестах Terminal-Bench 4 SoL-Pi решил 15 задач (против 18 у конкурентов), но сэкономил 26.3% стоимости. В сложных задачах по математике (IMO 2026, Lean 4) он показал себя на уровне Pi, но с минимальной стоимостью за решение ($20.90).
Исследователи отмечают, что механизмы, найденные на траекториях GPT-5.6 Sol, успешно перенесены на Opus 5 без дополнительной настройки, хотя триггеры срабатывают реже. Это открывает путь к созданию универсальных оптимизаторов для агентов, не зависящих от конкретной LLM.
Бенчмарки
| Бенчмарк | Pi | SoL-Pi | SoL-Pi [Efficiency] (GPT-5.6 Sol) | SoL-Pi [Efficiency] (Opus 5) | SoL-Pi [Performance] (GPT-5.6 Sol) | SoL-Pi [Performance] (Opus 5) | Claude Code (Opus 5) | Codex | Codex (GPT-5.6 Sol) | Pi (GPT-5.6 Sol) | Pi (Opus 5) |
|---|---|---|---|---|---|---|---|---|---|---|---|
| EdgeBench | — | — | 42% | — | 47.2% | — | — | — | 34.7% | 44.8% | — |
| EdgeBench | — | — | — | 42.2% | — | 50.5% | 43.7% | — | — | — | 44.8% |
| Terminal-Bench 4 | 18count | 15count | — | — | — | — | — | 18count | — | — | — |
| IMO 2026, Lean 4-verified | 3count | 3count | — | — | — | — | — | 5count | — | — | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
