Проблема частичной достоверности
В задачах Grounded Multi-Hop QA (многошаговый поиск ответов с опорой на документы) ключевая проблема — не просто найти ответ, а понять, когда его нельзя найти. Частично релевантные документы часто делают ложный ответ правдоподобным. Авторы работы из Японии (Haruto Sato, Yuki Tanaka и др.) предлагают решать это через обучение границам достаточности доказательств (Evidence Sufficiency Boundaries). Суть метода: модель должна уметь воздерживаться от ответа, пока контекст неполон, и переключаться на генерацию ответа ровно в тот момент, когда доказательств становится достаточно, сохраняя стабильность при добавлении избыточной информации.
Методология ESBT
Предложенный фреймворк Evidence Sufficiency Boundary Training (ESBT) работает нативно с генерацией текста. Он строит упорядоченные цепочки доказательств (evidence chains) на основе датасетов HotpotQA, 2WikiMultiHopQA и MuSiQue. Обучение опирается на четыре ключевых компонента:
- Level supervision: контроль на уровне уровней достаточности.
- Boundary flip margin: маржин для четкого перехода от отказа к ответу.
- Post-boundary stability: стабильность ответа после точки принятия решения.
- Answer recall protection: защита от потери полноты ответов.
Результаты на Qwen2.5-3B-Instruct
Эксперименты проводились с использованием модели Qwen2.5-3B-Instruct и адаптации через LoRA. Метод ESBT показал лучшие результаты по локализации границ отказа/ответа среди всех протестированных систем. Ниже приведено сравнение ключевых метрик с базовым подходом (token-level abstention baseline):
| Метрика | ESBT (Qwen2.5-3B) | Baseline (Token-level) | Разница |
|---|---|---|---|
| Flip Accuracy (Точность перехода) | 0.807 | 0.781 | +0.026 |
| Unsupported Answer Rate (Уровень ложных ответов) | 0.095 | 0.101 | -0.006 |
| Raw QA F1 | Конкурентный | Конкурентный | Без потерь |
Почему это важно
Снижение уровня unsupported-answer rate до 0.095 критически важно для внедрения LLM в чувствительные сферы, где ложная информация недопустима. Метод демонстрирует, что обучение модели «умению молчать» в нужный момент не только повышает надежность, но и не снижает общую полезность системы (F1 score остается на высоком уровне). Это шаг к созданию более доверенных (trustworthy) систем поиска ответов, которые не пытаются угадать ответ там, где данных недостаточно.
Источник: arXiv cs.CL ↗
