Исследования4 сентября 2026 г., 06:19 МСК🤖 Auto

Qwen2.5-3B учится молчать: новый метод для точного Grounded QA

Исследователи представили Evidence Sufficiency Boundary Training (ESBT) — метод, позволяющий моделям типа Qwen2.5-3B точно определять момент, когда контекст становится достаточным для ответа, снижая галлюцинации на 6%.

Баннер новости 6742

Проблема частичной достоверности

В задачах Grounded Multi-Hop QA (многошаговый поиск ответов с опорой на документы) ключевая проблема — не просто найти ответ, а понять, когда его нельзя найти. Частично релевантные документы часто делают ложный ответ правдоподобным. Авторы работы из Японии (Haruto Sato, Yuki Tanaka и др.) предлагают решать это через обучение границам достаточности доказательств (Evidence Sufficiency Boundaries). Суть метода: модель должна уметь воздерживаться от ответа, пока контекст неполон, и переключаться на генерацию ответа ровно в тот момент, когда доказательств становится достаточно, сохраняя стабильность при добавлении избыточной информации.

Методология ESBT

Предложенный фреймворк Evidence Sufficiency Boundary Training (ESBT) работает нативно с генерацией текста. Он строит упорядоченные цепочки доказательств (evidence chains) на основе датасетов HotpotQA, 2WikiMultiHopQA и MuSiQue. Обучение опирается на четыре ключевых компонента:

  • Level supervision: контроль на уровне уровней достаточности.
  • Boundary flip margin: маржин для четкого перехода от отказа к ответу.
  • Post-boundary stability: стабильность ответа после точки принятия решения.
  • Answer recall protection: защита от потери полноты ответов.

Результаты на Qwen2.5-3B-Instruct

Эксперименты проводились с использованием модели Qwen2.5-3B-Instruct и адаптации через LoRA. Метод ESBT показал лучшие результаты по локализации границ отказа/ответа среди всех протестированных систем. Ниже приведено сравнение ключевых метрик с базовым подходом (token-level abstention baseline):

Метрика ESBT (Qwen2.5-3B) Baseline (Token-level) Разница
Flip Accuracy (Точность перехода) 0.807 0.781 +0.026
Unsupported Answer Rate (Уровень ложных ответов) 0.095 0.101 -0.006
Raw QA F1 Конкурентный Конкурентный Без потерь

Почему это важно

Снижение уровня unsupported-answer rate до 0.095 критически важно для внедрения LLM в чувствительные сферы, где ложная информация недопустима. Метод демонстрирует, что обучение модели «умению молчать» в нужный момент не только повышает надежность, но и не снижает общую полезность системы (F1 score остается на высоком уровне). Это шаг к созданию более доверенных (trustworthy) систем поиска ответов, которые не пытаются угадать ответ там, где данных недостаточно.

Источник: arXiv cs.CL ↗