Исследования1 июля 2026 г., 12:16 МСК🤖 Auto

Contrastive Reflection: как ИИ-агенты учатся исправлять свои ошибки в IR

Исследователи представили метод Contrastive Reflection для итеративной оптимизации промптов. Подход использует контрастивный анализ для точечного исправления ошибок агентов поиска, повышая точность ответов на HotpotQA с 51.4% до 60.4%.

Баннер новости 2722

Проблема: от слепого поиска к отладке

Оптимизация промптов для LLM-агентов в задачах информационного поиска (IR) часто превращается в сложный процесс отладки. Инженерам недостаточно просто «улучшить» промпт — им нужно понять, какое именно поведение привело к ошибке, какие соседние примеры работают корректно, и чем они отличаются. Традиционные методы оптимизации часто действуют вслепую, что приводит к регрессии качества.

Решение: цикл контрастивного рефлексивного анализа

Авторы предлагают фреймворк Contrastive Reflection, который строит итеративный цикл оптимизации на основе структурированных трейсов (следов) работы агентов. Метод включает три ключевых этапа:

  • Выявление ошибок: QA-агенты предоставляют цепочки рассуждений, а агенты оценки (grading agents) выдают баллы по конкретным измерениям с обоснованием.
  • Контрастивный выбор: Система находит «якоря ошибок» и подбирает рядом успешные примеры из той же области данных (с использованием дерева-селектора срезов).
  • Целевое редактирование: Teacher LLM предлагает правку промпта, основанную на различиях между неудачным и успешным примером. Изменение принимается только если валидационная метрика растет, без ухудшения других показателей.

Результаты на HotpotQA

Эксперименты проводились на публичном наборе данных HotpotQA в задаче retrieval-augmented QA. Метод демонстрирует значительный прирост точности (Exact Match) по сравнению с базовыми вариантами и современными аналогами.

Метод / Вариант Exact Match (EM) Комментарий
Базовый промпт (до оптимизации) 51.4% Исходная точка
Contrastive Reflection (один срез) 60.4% Основной результат метода
MIPROv2 59.4% Современный оптимизатор промптов
GEPA 57.0% Современный оптимизатор промптов
Failure-only (только ошибки) Ниже 60.4% Менее эффективен, ломает корректные ответы
Random evidence (случайные примеры) Ниже 60.4% Менее эффективен, ломает корректные ответы

Почему это важно

Главное преимущество Contrastive Reflection — интерпретируемость. В отличие от «черных ящиков», этот метод позволяет инженерам видеть, какие именно поведенческие слайсы были исправлены и почему. Работа будет представлена на воркшопе Agent4IR @ KDD 2026, что подчеркивает актуальность темы для сообщества AI-агентов и информационного поиска.

Источник: arXiv cs.AI ↗