Проблема накопления ошибок в RAG
Retrieval-Augmented Generation (RAG) часто страдает от проблемы распространения ошибок (error propagation) в многошаговых рассуждениях. Если модель на раннем этапе извлекает неверную информацию, последующие шаги строятся на ложной базе, что приводит к ошибочному финальному выводу. Стандартные методы оптимизации, основанные на результате (outcome-based), поощряют только правильный ответ, игнорируя промежуточные ошибки. Это создает ситуацию, когда модель получает награду за «случайное» совпадение: неверные данные могут случайно привести к верному ответу, что не учитывает логическую корректность процесса.
Суть метода PRO-Step
Авторы (MinKeon Kim, Namjun Lee, Jaekwang Kim) предлагают подход PRO-Step, который внедряет пошаговый контроль качества. Ключевые компоненты системы:
- Генеративный PRM (Process Reward Model): Обученная модель оценивает каждый шаг на два параметра: логическую валидность и наличие доказательной базы (evidential grounding).
- Tree Search с guidance PRM: Используется для создания пар предпочтений (preference pairs), где корректные шаги противопоставляются ошибочным.
- Step-level DPO: Оптимизация политики модели через прямое предпочтительное обучение (Direct Preference Optimization) на уровне отдельных шагов, а не всего ответа.
Результаты и бенчмарки
Эксперименты проводились на наборах данных для вопросов с одним и несколькими шагами (single and multi-hop QA). PRO-Step показал лучшие средние результаты по метрикам Exact Match (EM) и F1 на пяти различных бенчмарках. Метод позволяет выявлять и исправлять ошибки на этапе извлечения знаний, а не только на этапе генерации ответа.
| Аспект | Стандартный RAG (Outcome-based) | PRO-Step (Process-based) |
|---|---|---|
| Объект оценки | Только финальный ответ | Каждый шаг рассуждения и извлечения |
| Обработка ошибок | Игнорирует промежуточные сбои | Выявляет логические и фактические ошибки на каждом шаге |
| Механизм обучения | Награда за совпадение с эталоном | Step-level DPO с использованием PRM-guided tree search |
| Результат | Риск «случайных» правильных ответов | Повышенная надежность и точность (EM/F1) |
Значение для индустрии
Принятие работы в конференцию EMNLP 2026 подтверждает актуальность подхода. Публикация кода, моделей и обучающих данных (доступных по ссылке в статье) позволяет разработчикам внедрять более надежные RAG-системы, критически важные для приложений, требующих высокой точности фактов (например, юридические или медицинские помощники). PRO-Step демонстрирует, что контроль процесса так же важен, как и контроль результата.
Источник: arXiv cs.CL ↗
