Проблема скрытых ошибок в Deep Research
Стандартные рубричные оценки (rubric-based evaluations) систем глубокого исследования (Deep Research, DR) часто маскируют критические фактические ошибки. Авторы исследования, опубликованного в arXiv (12 августа 2026 года), вводят метод CLAIMPROBE — аудит на уровне отдельных утверждений (claims). Этот инструмент декомпозирует отчеты на изолированные факты и измеряет галлюцинации, неверные атрибуции, качество цитирования и полноту извлечения необходимых фактов по отношению к извлеченным доказательствам.
Решение: CLAIMWRITER
Для исправления выявленных проблем предложена архитектура CLAIMWRITER. Это иерархический генератор, который:
- Извлекает факты из источников;
- Сопоставляет их с планом, сгенерированным на основе запроса;
- Составляет каждый раздел отчета, опираясь на представление утверждений, напрямую связанное с источниками.
Результаты внедрения
Замена только модуля генерации отчета на CLAIMWRITER в трех существующих фреймворках DR дала следующие результаты:
| Метрика | Показатель улучшения | Примечание |
|---|---|---|
| Снижение галлюцинаций | в 2.6 – 4.5 раза | Значительное уменьшение вымышленных фактов |
| Recall необходимых фактов | в 1.2 – 1.7 раза | Лучшее покрытие ключевой информации |
| Качество отчета | Сохранено | Общая читаемость и структура не пострадали |
Локальные правки и экономия
CLAIMWRITER также решает проблему обновления данных. При изменении исходных источников система способна распространять изменения в пересмотренные отчеты с наивысшей эффективностью среди существующих методов, при этом оставаясь более экономичной по затратам на вычисления.
Источник: arXiv cs.CL ↗
