Проблема: почему старые бенчмарки не работают
Рынок инструментов для извлечения структурированных данных из документов (OCR, RAG, Agentic AI) перенасыщен, но сравнение их эффективности затруднено. Datalab указывает на четыре критических недостатка существующих лидербордов:
- Предвзятость (Bias): Документы и метрики часто оптимизированы под пропущенные паттерны конкретного вендора.
- Непрозрачность (Opacity): Низкий балл может быть следствием ошибки в коде тестирования, а не слабости модели.
- Отсутствие объяснимости: Пользователь не видит, почему конкретное значение было оценено низко.
- Узкая специализация: Многие наборы данных содержат либо только плотные таблицы, либо только чистые сканы, что не отражает реальность.
Решение: OmniExtractBench и 620 документов
Новый бенчмарк объединяет данные из четырех источников, создавая репрезентативную выборку. Всего в датасет вошло 620 документов, включая формы, отчеты и сложные таблицы. Ключевая особенность — использование детерминированного скорера, который оценивает каждое значение отдельно и выдает один из шести вердиктов:
- matched (совпадение), misread (ошибка чтения), unfound (пропуск), fabricated (вымысел), invented_item (лишняя строка), invented_field (лишнее поле).
Для решения проблемы сдвига строк в таблицах применяется алгоритм Хунгарии (Hungarian algorithm), который сопоставляет строки по содержанию, а не по позиции. Это предотвращает ситуацию, когда пропущенная одна строка обнуляет оценку всей таблицы.
Сравнение с конкурентами
OmniExtractBench позиционируется как более прозрачная альтернатива таким известным бенчмаркам, как ExtractBench (LlamaIndex) и LongExtractBench. Ниже приведено сравнение ключевых характеристик:
| Характеристика | OmniExtractBench | ExtractBench | LongExtractBench |
|---|---|---|---|
| Издатель | Datalab | LlamaIndex | micro1 (Reducto) |
| Количество документов | 620 | 370 | 225 (50 публичных) |
| Выравнивание строк | По контенту (Hungarian) | По контенту | По ключу строки |
| Объяснимость (вердикты) | Да (6 типов) | Да (HTML отчет) | Нет |
| Лицензия данных | CC BY 4.0 | Apache 2.0 | CC BY 4.0 |
Результаты тестирования: кто лидирует?
Datalab протестировал 10 конфигураций систем на полном корпусе данных. Лидерство разделили решения Datalab и Reducto. Однако анализ метрик Precision и Recall выявил разные стратегии ошибок у моделей:
| Система | Accuracy | Тренд ошибок | Проблема |
|---|---|---|---|
| Datalab (accurate) | 93.85% | — | Лидер по точности |
| Datalab (balanced) | 93.48% | Баланс | Стабильные метрики |
| Reducto deep_extract v2 | 93.47% | Баланс | Стабильные метрики |
| GPT 5.6-sol | 95.11% (Prec) | Пропуски | Recall 84.99%: много unfound |
| LlamaExtract | 93.13% (Rec) | Галлюцинации | Prec 86.57%: много fabricated |
| Mistral OCR 4.1 | Низкие | Оба | Слабые показатели по всем метрикам |
Как запустить и зачем это нужно
Инструмент доступен для самостоятельного запуска через PyPI (версия v0.1.7, Python 3.11+). Код распространяется под лицензией Apache 2.0, датасет — CC BY 4.0. Особое внимание уделено правилу «null»: пустые строки и пробелы не учитываются, что блокирует манипуляции с оценками через добавление пустых опциональных полей в схему.
Для разработчиков это означает возможность не просто получить «балл», а получить детальный отчет о том, где именно система ошибается: путает даты, пропускает строки в таблицах или выдумывает несуществующие данные. Это критически важно для внедрения AI в финансовые и юридические процессы, где цена ошибки высока.
Источник: MarkTechPost ↗
