Релиз модели10 июля 2026 г., 09:17 МСК🤖 Auto

Infinity-Parser2: 5 млн данных и RL для лучшего парсинга документов

Исследователи представили Infinity-Parser2 — мультимодельную модель для парсинга документов, которая бьет рекорды на olmOCR-Bench и ParseBench благодаря синтезу 5 млн аннотированных примеров и совместному обучению с подкреплением.

Баннер новости 3277

Проблема нехватки данных решена синтезом

Основная сложность в обучении моделей для извлечения структуры документов (OCR, анализ макета, распознавание таблиц) — дефицит качественных размеченных корпусов. Команда авторов Infinity-Parser2 решила эту проблему, создав масштабируемый конвейер синтеза данных. Они разработали контролируемую систему рендеринга с итеративным циклом уточнения, что позволило сгенерировать корпус Infinity-Doc2-5M.

Этот датасет содержит 5 миллионов примеров на двух языках (китайском и английском). Аннотации включают не только боксы элементов, но и канонические формы контента (Markdown, HTML, LaTeX, SMILES, структурированные графики) и полный порядок чтения по странице. Открытый доступ к таким данным ускоряет развитие отрасли.

Совместное обучение с подкреплением (Joint RL)

Вместо того чтобы обучать модель на отдельных задачах, авторы внедрили систему вознаграждений, верифицируемую для нескольких задач одновременно. Это позволило применить Joint Reinforcement Learning для оптимизации восьми целей в рамках одной архитектуры:

  • Парсинг документов и анализ макета;
  • Распознавание таблиц, математических формул, графиков и химических формул;
  • Документальный VQA (вопросно-ответные системы) и общее мультимодальное понимание.

Такой подход объединяет восприятие, структуру и рассуждение в едином сигнале оптимизации, что критически важно для сложных документов, где ошибки в одной области (например, в таблице) влияют на другие.

Две версии: скорость против точности

Модель выпущена в двух вариантах, оптимизированных под разные сценарии использования:

  • Infinity-Parser2-Flash: ориентирована на низкую задержку. Показала прирост пропускной способности (throughput) в 3.68 раза по сравнению с предыдущей версией Infinity-Parser-7B.
  • Infinity-Parser2-Pro: создана для задач, требующих максимальной точности, где задержка менее критична.

Рекордные метрики

Infinity-Parser2-Pro демонстрирует state-of-the-art результаты на ключевых бенчмарках, превосходя таких игроков, как DeepSeek-OCR-2, PaddleOCR-VL-1.5 и MinerU2.5. Особая сила модели — в обобщении на сложные типы данных: графики, химические формулы и VQA.

Бенчмарк Infinity-Parser2-Pro DeepSeek-OCR-2 PaddleOCR-VL-1.5 MinerU2.5
olmOCR-Bench 87.6%
ParseBench 74.3%

Данные результаты подтверждают эффективность подхода с совместным RL и масштабированием данных. Исследование опубликовано 8 июля 2026 года в arXiv (cs.AI).

Источник: arXiv cs.AI ↗