Проблема «слепоты» к форматам
Исследователи из Microsoft и других лабораторий представили Office Comprehension Benchmark (OCB). В отличие от предыдущих датасетов, которые часто используют текстовые выгрузки или упрощенные форматы, OCB работает с нативными файлами .docx, .xlsx и .pptx. Цель — проверить, действительно ли модели «видят» структуру документа, или просто угадывают ответы на основе тренировочных данных.
Два трека оценки
Бенчмарк разделен на два ключевых направления, проверяющих разные аспекты интеллекта:
- File Fidelity Q&A: Тест на визуальное и структурное восприятие. Модель должна находить таблицы, графики, встроенные изображения, формулы, заголовки, заметки докладчика (speaker notes) и именованные диапазоны в Excel.
- Domain Q&A: Тест на экспертное рассуждение. Запросы требуют многошагового анализа и синтеза информации из реальных отраслевых документов по 12 профессиональным доменам (финансы, юриспруденция, медицина и др.).
Методология: атомарные утверждения
Ключевая инновация оценки — декомпозиция эталонных ответов на атомарные, бинарно оцениваемые утверждения (atomic, binary-gradable claims). Ответ модели проверяется не как единое целое, а по каждому факту отдельно с помощью ансамбля LLM-судей. Это исключает ложноположительные срабатывания, когда модель угадывает часть ответа.
Результаты: потолок производительности
Даже самые передовые системы в режиме стандартного рассуждения (default reasoning mode) показали скромные результаты. Увеличение «глубины мышления» (thinking depth) в рамках одного тарифного уровня не дало существенного прироста, а переход на более мощную версию модели принес лишь modest gains.
| Метрика / Аспект | Значение / Описание |
|---|---|
| Лучший результат (Domain Q&A) | ~59.3% |
| Форматы файлов | .docx, .xlsx, .pptx (нативные) |
| Количество доменов | 12 профессиональных сфер |
| Влияние «мышления» | Увеличение глубины не улучшает результат materially |
| Влияние мощности модели | Переход на высший тарифный уровень дает modest gains |
Почему это важно
Результат в 59.3% для лучших моделей указывает на то, что текущие LLM все еще плохо справляют с точным извлечением данных из сложных, структурированных офисных документов. Для бизнеса, автоматизирующего обработку отчетов, контрактов и презентаций, это критический барьер. Исследователи опубликовали датасет, инструменты оценки и лидерборд, чтобы стимулировать развитие именно структурного понимания документов, а не только лингвистических паттернов.
Источник: arXiv cs.CL ↗
