Исследования4 августа 2026 г., 10:17 МСК🤖 Auto

XL-DocBench: Тест на выживание LLM для документов в 2300 страниц

Исследователи представили XL-DocBench — первый бенчмарк для оценки способности моделей работать с сверхдлинными профессиональными документами, где требуется поиск доказательств на десятках страниц.

Баннер новости 5023

Проблема длинного контекста в реальных задачах

В профессиональной среде (финансы, юриспруденция, медицина) от ИИ требуется не просто генерация текста, а точный поиск информации в отчетах, регламентах и руководствах, объем которых может достигать сотен или тысяч страниц. Ошибка здесь стоит дорого: решение должно быть обосновано конкретными цитатами. Большинство существующих бенчмарков тестируют модели на коротких контекстах или одностраничных вопросах, что не отражает реальных потребностей.

Что такое XL-DocBench

Авторы из команды Microsoft Research и других институтов представили XL-DocBench — полностью верифицированный человеком набор данных для оценки понимания сверхдлинных документов. Ключевые характеристики датасета:

  • Объем контекста: до 2 303 страниц на один запрос.
  • Количество вопросов: 1 519 сохраненных вопросов после фильтрации.
  • Домены: 6 профессиональных областей (включая клинические руководства и технические мануалы).
  • Верификация: 194 эксперта-человека проверили каждый пример.

Сложность задач: не просто поиск по странице

Главное отличие XL-DocBench от предыдущих тестов — необходимость агрегации информации. Большинство вопросов требуют анализа нескольких страниц одновременно. Более трети задач опираются на структурированные данные (таблицы, графики), а некоторые требуют сравнения нескольких документов.

Характеристика задачи Количество примеров Доля от общего числа Суть сложности
Использование нескольких страниц-источников 1 103 72.6% Модель должна связать разрозненные факты из разных частей документа
Работа с таблицами, графиками, фигурами 556 36.6% Необходимость визуального или табличного рендеринга и анализа
Сравнение нескольких документов 165 10.9% Кросс-документальный анализ (cross-document reasoning)
Отсутствие ответа в тексте (None-answer) 218 ~14.4%* Модель должна уметь сказать «не знаю», а не галлюцинировать

*Расчетная доля на основе оставшихся вопросов после вычета основных категорий.

Методология и результаты

Датасет создан с использованием «деревовидного конвейера синтеза» (tree-guided synthesis pipeline) с последующей фильтрацией артефактов. Каждый вопрос имеет 12 меток рассуждения, аннотированные экспертами страницы-источники и строгие правила проверки.

Результаты тестирования показывают, что современные LLM все еще испытывают серьезные трудности с:

  1. Удержанием внимания в контексте длиной в тысячи страниц.
  2. Корректным использованием нескольких страниц-доказательств.
  3. Структурированным рассуждением над профессиональными документами.

XL-DocBench позволяет не просто дать оценку «точность», а диагностировать, где именно система дает сбой: на этапе извлечения (retrieval), использования доказательств (evidence use) или следования правилам (rule following).

Источник: arXiv cs.CL ↗