Стандартные системы Retrieval-Augmented Generation (RAG) часто ранжируют документы исключительно на основе семантического сходства, игнорируя происхождение и достоверность информации. Это приводит к тому, что высококачественные источники могут быть вытеснены низкокачественными, если последние лучше подходят по ключевым словам. Новая работа Yuktha Tata Koganti и Hugo Garrido-Lestache Belinchon предлагает простое, но эффективное решение — добавление «приоритета надежности» (Reliability Prior) в процесс ранжирования.
Математика доверия
Авторы предлагают модифицировать стандартную формулу релевантности, умножая семантическое сходство на коэффициент надежности источника. Формула выглядит следующим образом:
score(q, d) = sim(q, d) * lambda(s)
Где lambda(s) — это априорная вероятность надежности источника s. Этот подход позволяет системе «понимать», что документ из рецензируемого медицинского журнала или официального регулятора должен иметь больший вес, чем пост в личном блоге, даже при схожем семантическом совпадении с запросом.
Результаты на медицинском датасете
Эксперименты проводились на корпусе из 120 документов в медицинской тематике. Выборка была сделана намеренно узкой, чтобы контролировать переменные и четко оценить влияние метаданных источника. Тестирование выполнялось на кластере Rosie (Milwaukee School of Engineering) с использованием GPU-ускорения для воспроизводимости результатов.
Ключевые метрики эффективности метода Source-Aware Reranking по сравнению с базовым подходом (только семантическое сходство) приведены в таблице ниже:
| Метрика | Базовый RAG (только sim) | Source-Aware Reranking | Прирост |
|---|---|---|---|
| Precision@5 | 0.48 | 0.72 | +50% |
| Риск adversarial-документов | Высокий | Снижен | Зависит от метаданных |
Помимо роста точности, метод демонстрирует устойчивость к «adversarial» сценариям, когда злоумышленники пытаются внедрить ложную информацию, маскирующуюся под релевантную. При наличии метаданных, позволяющих идентифицировать низкокредитные источники, система успешно их отфильтровывает.
Почему это важно для индустрии
Проблема деградации качества источников в RAG-системах становится критической по мере роста объема данных в интернете. Предложенный подход не требует переобучения больших языковых моделей или изменения архитектуры векторных баз данных. Это легковесная надстройка, которая может быть внедрена в существующие пайплайны для повышения доверия к ответам ИИ, особенно в чувствительных областях, таких как медицина, юриспруденция и финансы.
Источник: arXiv cs.AI ↗
