Проблема: локальные правки имеют глобальные последствия
Авторы работы (Manqing Mao и соавторы) выявили две критические проблемы при persistent prompt editing (постоянном редактировании промптов) для агентов, синтезирующих исполняемые рабочие процессы (workflows). Во-первых, локальность редактирования не гарантирует локальности эффекта: изменение в одном сегменте политики может вызвать цепную реакцию, изменив поведение агента в downstream-задачах. Во-вторых, эффекты редактирования чувствительны к композиции: правки, эффективные изолированно, могут стать вредными при объединении с другими изменениями.
Решение: RIPPLE (Replay-Informed Persistent Policy Localization and Editing)
Предложенный метод RIPPLE разделяет процесс на два этапа: локализация (где вносить изменения) и валидация композиции (безопасно ли изменение после объединения). Алгоритм работает следующим образом:
- Диагностика: Анализ неудачных траекторий выполнения для выявления конкретных сбоев.
- Маппинг: Привязка каждого сбоя к заранее определенному сегменту политики (policy segment).
- Изолированная оценка: Сравнение кандидатов на основе их изолированной пользы относительно исходной политики.
- Replay-тестирование: Воспроизведение успешных правок в контексте уже принятых обновлений для выявления скрытых взаимодействий и побочных эффектов.
Результаты на бенчмарке Flow-HO
Оценка проводилась на синтетическом held-out бенчмарке Flow-HO, предназначенном для синтеза исполняемых рабочих процессов. Метод демонстрирует значительное улучшение метрик успеха при сохранении эффективности вычислений.
| Метрика / Характеристика | Результат / Описание |
|---|---|
| Улучшение валидационного успеха | До +23.1% |
| Поддержка бэкбонных моделей | Положительные приросты на двух дополнительных замороженных LLM |
| Эффективность редактирования | Сохранена (низкие затраты на выполнение) |
| Ключевое открытие | Локальное изменение использования инструмента влияет на разрешение ресурсов downstream; изолированно полезная правка может стать вредной при композиции |
Почему это важно
Работа RIPPLE предлагает практический путь улучшения агентов без дорогостоящего дообучения базовых моделей (fine-tuning). Ключевой вклад — валидация безопасности изменений через replay-механизм, что позволяет разработчикам внедрять сложные workflow-цепочки с меньшим риском регрессии поведения модели. Это особенно актуально для enterprise-сегмента, где стабильность и предсказуемость агентов критичны.
Источник: arXiv cs.CL ↗
