Исследования11 сентября 2026 г., 15:19 МСК🤖 Auto

RobustSGPO: Эволюция AI-агентов с контролем пространства поиска

Исследователи представили RobustSGPO — метод оптимизации промптов, который повышает успешность выполнения задач AI-агентов с 60% до 80% за счет контроля пространства поиска и управления разрешениями.

Баннер новости 7272

Проблема локальных обновлений в SGPO

Существующие методы оптимизации промптов на основе семантических градиентов (SGPO) улучшают работу агентов через обратную связь от выполнения, но страдают от неопределенности в выборе масштаба и типа правок. Авторы работы, опубликованной в arXiv (2609.09646), предлагают решение — RobustSGPO. Этот метод не просто применяет правки, а явно задает требуемое изменение, конструирует и проверяет патч, а затем продолжает поиск, начиная либо от текущей лучшей версии, либо от сохраненных снимков состояния (snapshots).

Масштабное тестирование и метрики

Эксперименты проводились в рабочем процессе AgentX с использованием 120 задач, 95 запусков и 7 350 кандидатных попыток. Ключевые результаты демонстрируют значительный прирост эффективности:

  • Успешность завершения (Completion Rate): На 30 скрытых тестовых задачах показатель вырос с 60.0% до 80.0%.
  • Качество ответа (Test Quality): Оценено по шкале, улучшилось с 3.77 до 4.14 при бюджете в 20 миллионов токенов.
  • Эффективность планирования: Периодическое планирование разрешений ($1 \to 2 \to 3$) превзошло фиксированное максимальное разрешение на 0.28 балла по тестовому счету.

Механизмы удержания и перенос навыков

Важной особенностью RobustSGPO является стратегия удержания моделей (retention). Исследование показало, что категорийное удержание (category retention) снижает деградацию исходных задач при смене контекста, тогда как случайное удержание (random retention) позволяет достичь более высокой конечной точки на целевой задаче. Это подтверждает, что контроль пространства поиска через исполняемые правки и альтернативные точки старта дает измеримое преимущество в качестве, несмотря на накладные расходы на удержание.

Метрика / Параметр Базовый уровень / Контроль Результат RobustSGPO Прирост / Эффект
Completion Rate (30 задач) 60.0% 80.0% +20.0%
Test Quality Score 3.77 4.14 +0.37
Планирование разрешений Фиксированное макс. Периодическое $1 \to 2 \to 3$ +0.28 балла
Бюджет токенов 20,000,000 (фиксировано)

Значение для индустрии

Работа Zibo Zhao и коллег демонстрирует переход от «черного ящика» оптимизации промптов к детерминированному контролю пространства поиска. Для разработчиков AI-агентов это означает возможность более стабильного масштабирования систем: вместо хаотичных итераций предлагается структурированный подход к эволюции harness-ов, где каждый шаг правки обоснован и верифицирован.

Источник: arXiv cs.AI ↗