Исследования14 сентября 2026 г., 07:18 МСК🤖 Auto

R2VC: Модульная проверка фактов с калибровкой уверенности

Исследователи представили R2VC — архитектуру для проверки фактов, которая повышает точность на 13.74% и устраняет проблему «галлюцинаций» через калибровку уверенности.

Баннер новости 7420

Проблема монолитных LLM

Большие языковые модели (LLM) всё чаще используются для автоматической проверки фактов, но стандартный подход end-to-end (сквозное промптирование) смешивает извлечение доказательств, рассуждения и оценку неопределенности. Это делает ошибки труднодиагностируемыми, а уверенность модели — ненадежной. Авторы работы R2VC (Dhruv Dixit, Paritosh Pandey) предлагают модульную архитектуру, которая разделяет эти этапы для повышения прозрачности и точности.

Архитектура R2VC: 4 ключевых модуля

Система R2VC (Retrieve, Reason, Verify, Calibrate) состоит из четырех независимых компонентов:

  • Гибридный поиск: Комбинация sparse (редких) и dense (плотных) векторных индексов по базе Wikipedia для извлечения релевантных фрагментов.
  • Генератор вердиктов: Модель, дообученная методом SFT и выровненная через DPO (Direct Preference Optimization), которая генерирует разнообразные структурированные кандидаты на ответ.
  • Верификатор (NLI): Внешний кросс-энкодер на основе Natural Language Inference, который выбирает лучший кандидат на основе извлеченных доказательств.
  • Калибратор уверенности: Легковесный модуль на уровне последовательности, оценивающий достоверность ответа и позволяющий модели «воздержаться» от ответа при низкой уверенности.

Результаты на датасете FEVER

Эксперименты проводились на базе модели с 8 миллиардами параметров. Модульный подход R2VC демонстрирует значительное превосходство над базовыми методами:

Метрика / Сценарий Результат Комментарий
Прирост точности (Accuracy) +13.74% По сравнению с базовой моделью без модулей R2VC
Точность без выбора кандидатов 76.24% Падение производительности при удалении модуля верификатора
Brier Score без калибровки 0.161 Показатель ошибки вероятностных прогнозов удваивается без калибратора

Главный вывод: где «спотыкаются» модели

Анализ 250 ошибок показал, что главной проблемой остаются сбои на этапе извлечения доказательств (retrieval failures), особенно когда система находит доказательства по неверной сущности. Однако, даже при таких ошибках, модуль калибровки уверенности позволяет системе корректно отказаться от ответа, что критически важно для доверия к AI в фактчекинге.

Почему это важно

R2VC доказывает, что разделение задачи проверки фактов на модули позволяет не только повысить точность, но и сделать модель «осознанной» в своих ошибках. Это шаг от «черного ящика», который просто выдает ответ, к системе, которая может сказать: «Я не уверена, поэтому лучше не отвечать».

Источник: arXiv cs.CL ↗