Проблема монолитных LLM
Большие языковые модели (LLM) всё чаще используются для автоматической проверки фактов, но стандартный подход end-to-end (сквозное промптирование) смешивает извлечение доказательств, рассуждения и оценку неопределенности. Это делает ошибки труднодиагностируемыми, а уверенность модели — ненадежной. Авторы работы R2VC (Dhruv Dixit, Paritosh Pandey) предлагают модульную архитектуру, которая разделяет эти этапы для повышения прозрачности и точности.
Архитектура R2VC: 4 ключевых модуля
Система R2VC (Retrieve, Reason, Verify, Calibrate) состоит из четырех независимых компонентов:
- Гибридный поиск: Комбинация sparse (редких) и dense (плотных) векторных индексов по базе Wikipedia для извлечения релевантных фрагментов.
- Генератор вердиктов: Модель, дообученная методом SFT и выровненная через DPO (Direct Preference Optimization), которая генерирует разнообразные структурированные кандидаты на ответ.
- Верификатор (NLI): Внешний кросс-энкодер на основе Natural Language Inference, который выбирает лучший кандидат на основе извлеченных доказательств.
- Калибратор уверенности: Легковесный модуль на уровне последовательности, оценивающий достоверность ответа и позволяющий модели «воздержаться» от ответа при низкой уверенности.
Результаты на датасете FEVER
Эксперименты проводились на базе модели с 8 миллиардами параметров. Модульный подход R2VC демонстрирует значительное превосходство над базовыми методами:
| Метрика / Сценарий | Результат | Комментарий |
|---|---|---|
| Прирост точности (Accuracy) | +13.74% | По сравнению с базовой моделью без модулей R2VC |
| Точность без выбора кандидатов | 76.24% | Падение производительности при удалении модуля верификатора |
| Brier Score без калибровки | 0.161 | Показатель ошибки вероятностных прогнозов удваивается без калибратора |
Главный вывод: где «спотыкаются» модели
Анализ 250 ошибок показал, что главной проблемой остаются сбои на этапе извлечения доказательств (retrieval failures), особенно когда система находит доказательства по неверной сущности. Однако, даже при таких ошибках, модуль калибровки уверенности позволяет системе корректно отказаться от ответа, что критически важно для доверия к AI в фактчекинге.
Почему это важно
R2VC доказывает, что разделение задачи проверки фактов на модули позволяет не только повысить точность, но и сделать модель «осознанной» в своих ошибках. Это шаг от «черного ящика», который просто выдает ответ, к системе, которая может сказать: «Я не уверена, поэтому лучше не отвечать».
Источник: arXiv cs.CL ↗
