Исследования14 сентября 2026 г., 08:17 МСК🤖 Auto

RIPPLE: Как локальные правки промптов влияют на глобальные workflow

Исследователи представили RIPPLE — метод адаптации политик LLM без дообучения, который использует replay-тестирование для предотвращения побочных эффектов при редактировании промптов.

Баннер новости 7423

Проблема: локальные правки имеют глобальные последствия

Авторы работы (Manqing Mao и соавторы) выявили две критические проблемы при persistent prompt editing (постоянном редактировании промптов) для агентов, синтезирующих исполняемые рабочие процессы (workflows). Во-первых, локальность редактирования не гарантирует локальности эффекта: изменение в одном сегменте политики может вызвать цепную реакцию, изменив поведение агента в downstream-задачах. Во-вторых, эффекты редактирования чувствительны к композиции: правки, эффективные изолированно, могут стать вредными при объединении с другими изменениями.

Решение: RIPPLE (Replay-Informed Persistent Policy Localization and Editing)

Предложенный метод RIPPLE разделяет процесс на два этапа: локализация (где вносить изменения) и валидация композиции (безопасно ли изменение после объединения). Алгоритм работает следующим образом:

  • Диагностика: Анализ неудачных траекторий выполнения для выявления конкретных сбоев.
  • Маппинг: Привязка каждого сбоя к заранее определенному сегменту политики (policy segment).
  • Изолированная оценка: Сравнение кандидатов на основе их изолированной пользы относительно исходной политики.
  • Replay-тестирование: Воспроизведение успешных правок в контексте уже принятых обновлений для выявления скрытых взаимодействий и побочных эффектов.

Результаты на бенчмарке Flow-HO

Оценка проводилась на синтетическом held-out бенчмарке Flow-HO, предназначенном для синтеза исполняемых рабочих процессов. Метод демонстрирует значительное улучшение метрик успеха при сохранении эффективности вычислений.

Метрика / Характеристика Результат / Описание
Улучшение валидационного успеха До +23.1%
Поддержка бэкбонных моделей Положительные приросты на двух дополнительных замороженных LLM
Эффективность редактирования Сохранена (низкие затраты на выполнение)
Ключевое открытие Локальное изменение использования инструмента влияет на разрешение ресурсов downstream; изолированно полезная правка может стать вредной при композиции

Почему это важно

Работа RIPPLE предлагает практический путь улучшения агентов без дорогостоящего дообучения базовых моделей (fine-tuning). Ключевой вклад — валидация безопасности изменений через replay-механизм, что позволяет разработчикам внедрять сложные workflow-цепочки с меньшим риском регрессии поведения модели. Это особенно актуально для enterprise-сегмента, где стабильность и предсказуемость агентов критичны.

Источник: arXiv cs.CL ↗