Новый стандарт точности в OCR
Компания Tencent опубликовала в открытом доступе модель WeVisDoc (We-VisDoc), предназначенную для задач оптического распознавания документов (OCR). Ключевой особенностью разработки стала демонстрация выдающихся результатов на бенчмарке OmniDocBench версии 1.6, который оценивает способность моделей работать с разнообразными типами документов, включая сложные макеты и рукописный текст.
Сравнение с существующими решениями
WeVisDoc не просто улучшила показатели, но и установила новый лидерский результат. Согласно опубликованным данным, модель превзошла предыдущего лидера рынка — HunyuanOCR-1.5 — на значимую величину. Это свидетельствует о существенном прогрессе в архитектуре обработки визуальных данных от Tencent.
| Модель / Метрика | Результат (OmniDocBench v1.6) | Примечание |
|---|---|---|
| WeVisDoc (OURS) | 95.38% | Новый лидер рейтинга |
| Prior (Предыдущий SOTA) | 94.74% | Базовый уровень сравнения |
| HunyuanOCR-1.5 | +0.64% | Отставание от WeVisDoc |
Почему это важно
Рост точности на 0.64% относительно сильного конкурента HunyuanOCR-1.5 в задачах работы с «разнообразными документами» (diverse documents) критичен для промышленных внедрений. Высокая точность на OmniDocBench v1.6 означает лучшую устойчивость модели к шумам, сложным фонам и нестандартным шрифтам, что напрямую влияет на качество автоматизации документооборота и цифровизации архивов.
Доступность
Проект WeVisDoc доступен на платформе GitHub по адресу tencent.github.io/WeVisDoc/. Исследователи и разработчики могут изучить архитектуру модели и использовать её для улучшения своих решений в области компьютерного зрения и обработки естественного языка.
Источник: Github ↗
