Проблема масштабируемости автономных агентов
По мере перехода кодовых агентов от простого завершения кода к автономному исследованию, их работа превращается в длинные траектории рассуждений, использования инструментов и обратной связи. Ключевой проблемой при масштабировании таких систем (особенно с использованием подхода Recursive Self-Improvement) становится эффективность использования токенов. Исследователи из Nvidia, включая Song Han и Ligeng Zhu, представили решение — SoL-Pi (System of Loops for Pi), которое оптимизирует работу на уровне «харнесса» (harness layer).
Четыре механизма оптимизации
SoL-Pi использует рекурсивные циклы авто-исследований для поиска улучшений в различных средах. В финальную архитектуру вошли четыре механизма, прошедшие отбор:
- Выполнение действий (Action execution): Оптимизация того, как агент взаимодействует с окружением.
- Компактизация контекста (Context compaction): Сжатие истории диалога для экономии памяти.
- Обработка наблюдений (Observation handling): Умная фильтрация входящих данных.
- Делегированное чтение (Delegated reading): Оптимизация доступа к внешним источникам информации.
Результаты бенчмарка EdgeBench
Эффективность SoL-Pi была протестирована на наборе данных EdgeBench, состоящем из 51 задачи. Система показала результаты, сопоставимые с нативными решениями Pi, работающими на мощных моделях GPT-5.6 Sol и Opus 5. При этом удалось существенно сократить затраты ресурсов.
| Метрика | Показатель SoL-Pi | Сравнение с базовыми решениями |
|---|---|---|
| Снижение трафика токенов | 44.7% – 49.0% | Прямая экономия API-запросов |
| Снижение стоимости API | ~33% | Относительно нативных харнессей |
| Экономия в час (vs Codex/Claude) | $8.75 – $13.50 | Для нативных решений Codex и Claude Code |
| Экономия в час (vs Pi) | $4.36 – $5.71 | Для нативного решения Pi |
Почему это важно
SoL-Pi демонстрирует, что автоматическое открытие улучшений для харнессов может достигать уровня, пригодного для продакшена. Система не просто экономит деньги, но и делает возможным долгосрочное автономное функционирование агентов, где каждый сэкономленный токен критичен. Код проекта уже доступен в открытом доступе, что позволяет разработчикам интегрировать эти методы в свои пайплайны.
Источник: Arxiv ↗
