Исследования3 июля 2026 г., 21:20 МСК🤖 Auto

OCB: LLM провалили тест на понимание офисных документов

Представлен Office Comprehension Benchmark (OCB) — первый публичный тест, оценивающий способность LLM работать с реальными файлами Word, Excel и PowerPoint. Лучшие модели набрали лишь 59.3%.

Баннер новости 2874

Проблема «слепоты» к форматам

Исследователи из Microsoft и других лабораторий представили Office Comprehension Benchmark (OCB). В отличие от предыдущих датасетов, которые часто используют текстовые выгрузки или упрощенные форматы, OCB работает с нативными файлами .docx, .xlsx и .pptx. Цель — проверить, действительно ли модели «видят» структуру документа, или просто угадывают ответы на основе тренировочных данных.

Два трека оценки

Бенчмарк разделен на два ключевых направления, проверяющих разные аспекты интеллекта:

  • File Fidelity Q&A: Тест на визуальное и структурное восприятие. Модель должна находить таблицы, графики, встроенные изображения, формулы, заголовки, заметки докладчика (speaker notes) и именованные диапазоны в Excel.
  • Domain Q&A: Тест на экспертное рассуждение. Запросы требуют многошагового анализа и синтеза информации из реальных отраслевых документов по 12 профессиональным доменам (финансы, юриспруденция, медицина и др.).

Методология: атомарные утверждения

Ключевая инновация оценки — декомпозиция эталонных ответов на атомарные, бинарно оцениваемые утверждения (atomic, binary-gradable claims). Ответ модели проверяется не как единое целое, а по каждому факту отдельно с помощью ансамбля LLM-судей. Это исключает ложноположительные срабатывания, когда модель угадывает часть ответа.

Результаты: потолок производительности

Даже самые передовые системы в режиме стандартного рассуждения (default reasoning mode) показали скромные результаты. Увеличение «глубины мышления» (thinking depth) в рамках одного тарифного уровня не дало существенного прироста, а переход на более мощную версию модели принес лишь modest gains.

Метрика / Аспект Значение / Описание
Лучший результат (Domain Q&A) ~59.3%
Форматы файлов .docx, .xlsx, .pptx (нативные)
Количество доменов 12 профессиональных сфер
Влияние «мышления» Увеличение глубины не улучшает результат materially
Влияние мощности модели Переход на высший тарифный уровень дает modest gains

Почему это важно

Результат в 59.3% для лучших моделей указывает на то, что текущие LLM все еще плохо справляют с точным извлечением данных из сложных, структурированных офисных документов. Для бизнеса, автоматизирующего обработку отчетов, контрактов и презентаций, это критический барьер. Исследователи опубликовали датасет, инструменты оценки и лидерборд, чтобы стимулировать развитие именно структурного понимания документов, а не только лингвистических паттернов.

Источник: arXiv cs.CL ↗