Проблема: от слепого поиска к отладке
Оптимизация промптов для LLM-агентов в задачах информационного поиска (IR) часто превращается в сложный процесс отладки. Инженерам недостаточно просто «улучшить» промпт — им нужно понять, какое именно поведение привело к ошибке, какие соседние примеры работают корректно, и чем они отличаются. Традиционные методы оптимизации часто действуют вслепую, что приводит к регрессии качества.
Решение: цикл контрастивного рефлексивного анализа
Авторы предлагают фреймворк Contrastive Reflection, который строит итеративный цикл оптимизации на основе структурированных трейсов (следов) работы агентов. Метод включает три ключевых этапа:
- Выявление ошибок: QA-агенты предоставляют цепочки рассуждений, а агенты оценки (grading agents) выдают баллы по конкретным измерениям с обоснованием.
- Контрастивный выбор: Система находит «якоря ошибок» и подбирает рядом успешные примеры из той же области данных (с использованием дерева-селектора срезов).
- Целевое редактирование: Teacher LLM предлагает правку промпта, основанную на различиях между неудачным и успешным примером. Изменение принимается только если валидационная метрика растет, без ухудшения других показателей.
Результаты на HotpotQA
Эксперименты проводились на публичном наборе данных HotpotQA в задаче retrieval-augmented QA. Метод демонстрирует значительный прирост точности (Exact Match) по сравнению с базовыми вариантами и современными аналогами.
| Метод / Вариант | Exact Match (EM) | Комментарий |
|---|---|---|
| Базовый промпт (до оптимизации) | 51.4% | Исходная точка |
| Contrastive Reflection (один срез) | 60.4% | Основной результат метода |
| MIPROv2 | 59.4% | Современный оптимизатор промптов |
| GEPA | 57.0% | Современный оптимизатор промптов |
| Failure-only (только ошибки) | Ниже 60.4% | Менее эффективен, ломает корректные ответы |
| Random evidence (случайные примеры) | Ниже 60.4% | Менее эффективен, ломает корректные ответы |
Почему это важно
Главное преимущество Contrastive Reflection — интерпретируемость. В отличие от «черных ящиков», этот метод позволяет инженерам видеть, какие именно поведенческие слайсы были исправлены и почему. Работа будет представлена на воркшопе Agent4IR @ KDD 2026, что подчеркивает актуальность темы для сообщества AI-агентов и информационного поиска.
Источник: arXiv cs.AI ↗
