Исследования29 июля 2026 г., 05:17 МСК🤖 Auto

RAG-реранкинг: как надежность источника повышает точность на 50%

Исследователи из Milwaukee School of Engineering представили метод Source-Aware Reranking, который интегрирует приоритеты надежности источников в RAG-пайплайны, повышая Precision@5 с 0.48 до 0.72.

Баннер новости 4597

Стандартные системы Retrieval-Augmented Generation (RAG) часто ранжируют документы исключительно на основе семантического сходства, игнорируя происхождение и достоверность информации. Это приводит к тому, что высококачественные источники могут быть вытеснены низкокачественными, если последние лучше подходят по ключевым словам. Новая работа Yuktha Tata Koganti и Hugo Garrido-Lestache Belinchon предлагает простое, но эффективное решение — добавление «приоритета надежности» (Reliability Prior) в процесс ранжирования.

Математика доверия

Авторы предлагают модифицировать стандартную формулу релевантности, умножая семантическое сходство на коэффициент надежности источника. Формула выглядит следующим образом:

score(q, d) = sim(q, d) * lambda(s)

Где lambda(s) — это априорная вероятность надежности источника s. Этот подход позволяет системе «понимать», что документ из рецензируемого медицинского журнала или официального регулятора должен иметь больший вес, чем пост в личном блоге, даже при схожем семантическом совпадении с запросом.

Результаты на медицинском датасете

Эксперименты проводились на корпусе из 120 документов в медицинской тематике. Выборка была сделана намеренно узкой, чтобы контролировать переменные и четко оценить влияние метаданных источника. Тестирование выполнялось на кластере Rosie (Milwaukee School of Engineering) с использованием GPU-ускорения для воспроизводимости результатов.

Ключевые метрики эффективности метода Source-Aware Reranking по сравнению с базовым подходом (только семантическое сходство) приведены в таблице ниже:

Метрика Базовый RAG (только sim) Source-Aware Reranking Прирост
Precision@5 0.48 0.72 +50%
Риск adversarial-документов Высокий Снижен Зависит от метаданных

Помимо роста точности, метод демонстрирует устойчивость к «adversarial» сценариям, когда злоумышленники пытаются внедрить ложную информацию, маскирующуюся под релевантную. При наличии метаданных, позволяющих идентифицировать низкокредитные источники, система успешно их отфильтровывает.

Почему это важно для индустрии

Проблема деградации качества источников в RAG-системах становится критической по мере роста объема данных в интернете. Предложенный подход не требует переобучения больших языковых моделей или изменения архитектуры векторных баз данных. Это легковесная надстройка, которая может быть внедрена в существующие пайплайны для повышения доверия к ответам ИИ, особенно в чувствительных областях, таких как медицина, юриспруденция и финансы.

Источник: arXiv cs.AI ↗