Релиз модели22 сентября 2026 г., 09:21 МСК🤖 Auto

NVIDIA SoL-Pi: как AI-агенты экономят 49% токенов без потери качества

Исследователи NVIDIA, MIT и NTU представили SoL-Pi — оптимизированный «шасси» для кодинговых AI-агентов, который снижает затраты на API на треть за счет автоматического поиска архитектурных решений.

Баннер новости 8018

Автоматизация оптимизации через Auto-Research Loops

Команда из NVIDIA, Национального университета Сингапура (NTU) и MIT выпустила SoL-Pi — набор из четырех механизмов эффективности для open-source агента Pi (версия 0.85.1). В отличие от традиционных методов, которые оптимизируют стоимость отдельного токена (квантование, быстрые ядра), SoL-Pi сокращает общее количество токенов, потребляемых задачей, на уровне harness (слоя управления инструментами, контекстом и делегированием).

Ключевая инновация — использование авто-исследовательских циклов (auto-research loops). Исследовательский AI анализировал трассы выполнения базового агента Pi, предлагал изменения и тестировал их в 535 изолированных средах (495 на основе GitHub issue/PR и 40 синтетических задач). Были протестированы 152 направления оптимизации, выполнено более 3000 запусков и 60 000 взаимодействий «агент-среда».

4 механизма, прошедшие отбор

Из множества кандидатов выжили четыре механизма, которые работают без модификации ядра Pi:

  • Action Fusion: Объединяет редактирование файла и последующую команду тестирования/запуска в один запрос к инструменту. Это устраняет лишний «круг» общения с моделью.
  • Online Context Compact: Динамическая сжатие контекста. Система оценивает, выгоднее ли переписать кэш промпта сейчас, чем ждать заполнения окна контекста.
  • ObservationPack: Выводы инструментов объемом более 10 КБ архивируются локально. Модель видит только стабильный хендл и краткую выдержку, получая полный доступ по запросу.
  • Evidence-Preserving Reducer: Длинные логи сборки и тестирования (от 4 КБ) отправляются в более дешевую модель GPT-5.6 Luna для создания компактного чека. Детерминированный верификатор проверяет целостность данных, чтобы избежать галлюцинаций.

Результаты на бенчмарках

Оценка проводилась на наборе данных EdgeBench (51 задача). SoL-Pi демонстрирует значительное снижение потребления ресурсов при сохранении качества кода. Ниже приведено сравнение производительности и стоимости на базе моделей GPT-5.6 Sol и Opus 5:

Backend Harness Токены (B) Стоимость API Средний балл
GPT-5.6 Sol Codex 3.05 $1,787 34.7
GPT-5.6 Sol Pi (Base) 2.15 $1,339 44.8
GPT-5.6 Sol SoL-Pi [Efficiency] 1.10 $894 42.0
GPT-5.6 Sol SoL-Pi [Performance] 2.02 $1,271 47.2
Opus 5 Claude Code 2.00 $2,535 43.7
Opus 5 Pi (Base) 2.37 $1,741 44.8
Opus 5 SoL-Pi [Efficiency] 1.31 $1,158 42.2
Opus 5 SoL-Pi [Performance] 2.10 $1,605 50.5

Ключевые метрики:

  • Снижение трафика токенов на 44.7% – 49.0% по сравнению с базовым Pi.
  • Сокращение затрат на API примерно на 33%.
  • Сохранение 93.7–94.3% от качества базового Pi.
  • В режиме Performance (использование лучшего механизма для каждой модели) SoL-Pi даже превосходит базовый Pi по качеству: +5.3% на GPT-5.6 Sol и +12.8% на Opus 5.

Практическое применение и переносимость

Решение доступно на GitHub под лицензией MIT и работает с Node.js 22.19+. В тестах Terminal-Bench 4 SoL-Pi решил 15 задач (против 18 у конкурентов), но сэкономил 26.3% стоимости. В сложных задачах по математике (IMO 2026, Lean 4) он показал себя на уровне Pi, но с минимальной стоимостью за решение ($20.90).

Исследователи отмечают, что механизмы, найденные на траекториях GPT-5.6 Sol, успешно перенесены на Opus 5 без дополнительной настройки, хотя триггеры срабатывают реже. Это открывает путь к созданию универсальных оптимизаторов для агентов, не зависящих от конкретной LLM.

Бенчмарки

БенчмаркPiSoL-PiSoL-Pi [Efficiency] (GPT-5.6 Sol)SoL-Pi [Efficiency] (Opus 5)SoL-Pi [Performance] (GPT-5.6 Sol)SoL-Pi [Performance] (Opus 5)Claude Code (Opus 5)CodexCodex (GPT-5.6 Sol)Pi (GPT-5.6 Sol)Pi (Opus 5)
EdgeBench——42%—47.2%———34.7%44.8%—
EdgeBench———42.2%—50.5%43.7%———44.8%
Terminal-Bench 418count15count—————18count———
IMO 2026, Lean 4-verified3count3count—————5count———

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗