Проблема длинного контекста в реальных задачах
В профессиональной среде (финансы, юриспруденция, медицина) от ИИ требуется не просто генерация текста, а точный поиск информации в отчетах, регламентах и руководствах, объем которых может достигать сотен или тысяч страниц. Ошибка здесь стоит дорого: решение должно быть обосновано конкретными цитатами. Большинство существующих бенчмарков тестируют модели на коротких контекстах или одностраничных вопросах, что не отражает реальных потребностей.
Что такое XL-DocBench
Авторы из команды Microsoft Research и других институтов представили XL-DocBench — полностью верифицированный человеком набор данных для оценки понимания сверхдлинных документов. Ключевые характеристики датасета:
- Объем контекста: до 2 303 страниц на один запрос.
- Количество вопросов: 1 519 сохраненных вопросов после фильтрации.
- Домены: 6 профессиональных областей (включая клинические руководства и технические мануалы).
- Верификация: 194 эксперта-человека проверили каждый пример.
Сложность задач: не просто поиск по странице
Главное отличие XL-DocBench от предыдущих тестов — необходимость агрегации информации. Большинство вопросов требуют анализа нескольких страниц одновременно. Более трети задач опираются на структурированные данные (таблицы, графики), а некоторые требуют сравнения нескольких документов.
| Характеристика задачи | Количество примеров | Доля от общего числа | Суть сложности |
|---|---|---|---|
| Использование нескольких страниц-источников | 1 103 | 72.6% | Модель должна связать разрозненные факты из разных частей документа |
| Работа с таблицами, графиками, фигурами | 556 | 36.6% | Необходимость визуального или табличного рендеринга и анализа |
| Сравнение нескольких документов | 165 | 10.9% | Кросс-документальный анализ (cross-document reasoning) |
| Отсутствие ответа в тексте (None-answer) | 218 | ~14.4%* | Модель должна уметь сказать «не знаю», а не галлюцинировать |
*Расчетная доля на основе оставшихся вопросов после вычета основных категорий.
Методология и результаты
Датасет создан с использованием «деревовидного конвейера синтеза» (tree-guided synthesis pipeline) с последующей фильтрацией артефактов. Каждый вопрос имеет 12 меток рассуждения, аннотированные экспертами страницы-источники и строгие правила проверки.
Результаты тестирования показывают, что современные LLM все еще испытывают серьезные трудности с:
- Удержанием внимания в контексте длиной в тысячи страниц.
- Корректным использованием нескольких страниц-доказательств.
- Структурированным рассуждением над профессиональными документами.
XL-DocBench позволяет не просто дать оценку «точность», а диагностировать, где именно система дает сбой: на этапе извлечения (retrieval), использования доказательств (evidence use) или следования правилам (rule following).
Источник: arXiv cs.CL ↗
