Проблема нехватки данных решена синтезом
Основная сложность в обучении моделей для извлечения структуры документов (OCR, анализ макета, распознавание таблиц) — дефицит качественных размеченных корпусов. Команда авторов Infinity-Parser2 решила эту проблему, создав масштабируемый конвейер синтеза данных. Они разработали контролируемую систему рендеринга с итеративным циклом уточнения, что позволило сгенерировать корпус Infinity-Doc2-5M.
Этот датасет содержит 5 миллионов примеров на двух языках (китайском и английском). Аннотации включают не только боксы элементов, но и канонические формы контента (Markdown, HTML, LaTeX, SMILES, структурированные графики) и полный порядок чтения по странице. Открытый доступ к таким данным ускоряет развитие отрасли.
Совместное обучение с подкреплением (Joint RL)
Вместо того чтобы обучать модель на отдельных задачах, авторы внедрили систему вознаграждений, верифицируемую для нескольких задач одновременно. Это позволило применить Joint Reinforcement Learning для оптимизации восьми целей в рамках одной архитектуры:
- Парсинг документов и анализ макета;
- Распознавание таблиц, математических формул, графиков и химических формул;
- Документальный VQA (вопросно-ответные системы) и общее мультимодальное понимание.
Такой подход объединяет восприятие, структуру и рассуждение в едином сигнале оптимизации, что критически важно для сложных документов, где ошибки в одной области (например, в таблице) влияют на другие.
Две версии: скорость против точности
Модель выпущена в двух вариантах, оптимизированных под разные сценарии использования:
- Infinity-Parser2-Flash: ориентирована на низкую задержку. Показала прирост пропускной способности (throughput) в 3.68 раза по сравнению с предыдущей версией Infinity-Parser-7B.
- Infinity-Parser2-Pro: создана для задач, требующих максимальной точности, где задержка менее критична.
Рекордные метрики
Infinity-Parser2-Pro демонстрирует state-of-the-art результаты на ключевых бенчмарках, превосходя таких игроков, как DeepSeek-OCR-2, PaddleOCR-VL-1.5 и MinerU2.5. Особая сила модели — в обобщении на сложные типы данных: графики, химические формулы и VQA.
| Бенчмарк | Infinity-Parser2-Pro | DeepSeek-OCR-2 | PaddleOCR-VL-1.5 | MinerU2.5 |
|---|---|---|---|---|
| olmOCR-Bench | 87.6% | — | — | — |
| ParseBench | 74.3% | — | — | — |
Данные результаты подтверждают эффективность подхода с совместным RL и масштабированием данных. Исследование опубликовано 8 июля 2026 года в arXiv (cs.AI).
Источник: arXiv cs.AI ↗
