Исследования4 сентября 2026 г., 06:18 МСК🤖 Auto

PRO-Step: Как шаг за шагом обучать RAG-модели избегать ошибок

Исследователи представили PRO-Step — метод оптимизации процессов для RAG-систем, который оценивает каждый шаг рассуждения, а не только финальный ответ, повышая точность на сложных задачах.

Баннер новости 6741

Проблема накопления ошибок в RAG

Retrieval-Augmented Generation (RAG) часто страдает от проблемы распространения ошибок (error propagation) в многошаговых рассуждениях. Если модель на раннем этапе извлекает неверную информацию, последующие шаги строятся на ложной базе, что приводит к ошибочному финальному выводу. Стандартные методы оптимизации, основанные на результате (outcome-based), поощряют только правильный ответ, игнорируя промежуточные ошибки. Это создает ситуацию, когда модель получает награду за «случайное» совпадение: неверные данные могут случайно привести к верному ответу, что не учитывает логическую корректность процесса.

Суть метода PRO-Step

Авторы (MinKeon Kim, Namjun Lee, Jaekwang Kim) предлагают подход PRO-Step, который внедряет пошаговый контроль качества. Ключевые компоненты системы:

  • Генеративный PRM (Process Reward Model): Обученная модель оценивает каждый шаг на два параметра: логическую валидность и наличие доказательной базы (evidential grounding).
  • Tree Search с guidance PRM: Используется для создания пар предпочтений (preference pairs), где корректные шаги противопоставляются ошибочным.
  • Step-level DPO: Оптимизация политики модели через прямое предпочтительное обучение (Direct Preference Optimization) на уровне отдельных шагов, а не всего ответа.

Результаты и бенчмарки

Эксперименты проводились на наборах данных для вопросов с одним и несколькими шагами (single and multi-hop QA). PRO-Step показал лучшие средние результаты по метрикам Exact Match (EM) и F1 на пяти различных бенчмарках. Метод позволяет выявлять и исправлять ошибки на этапе извлечения знаний, а не только на этапе генерации ответа.

Аспект Стандартный RAG (Outcome-based) PRO-Step (Process-based)
Объект оценки Только финальный ответ Каждый шаг рассуждения и извлечения
Обработка ошибок Игнорирует промежуточные сбои Выявляет логические и фактические ошибки на каждом шаге
Механизм обучения Награда за совпадение с эталоном Step-level DPO с использованием PRM-guided tree search
Результат Риск «случайных» правильных ответов Повышенная надежность и точность (EM/F1)

Значение для индустрии

Принятие работы в конференцию EMNLP 2026 подтверждает актуальность подхода. Публикация кода, моделей и обучающих данных (доступных по ссылке в статье) позволяет разработчикам внедрять более надежные RAG-системы, критически важные для приложений, требующих высокой точности фактов (например, юридические или медицинские помощники). PRO-Step демонстрирует, что контроль процесса так же важен, как и контроль результата.

Источник: arXiv cs.CL ↗