Инструменты18 сентября 2026 г., 11:45 МСК🤖 Auto

WeVisDoc: Tencent бьет рекорды OCR на OmniDocBench v1.6

Tencent представила WeVisDoc, новую модель для оптического распознавания символов, которая достигла 95.38% точности на бенчмарке OmniDocBench, превзойдя предыдущие решения.

Баннер новости 7783

Новый стандарт точности в OCR

Компания Tencent опубликовала в открытом доступе модель WeVisDoc (We-VisDoc), предназначенную для задач оптического распознавания документов (OCR). Ключевой особенностью разработки стала демонстрация выдающихся результатов на бенчмарке OmniDocBench версии 1.6, который оценивает способность моделей работать с разнообразными типами документов, включая сложные макеты и рукописный текст.

Сравнение с существующими решениями

WeVisDoc не просто улучшила показатели, но и установила новый лидерский результат. Согласно опубликованным данным, модель превзошла предыдущего лидера рынка — HunyuanOCR-1.5 — на значимую величину. Это свидетельствует о существенном прогрессе в архитектуре обработки визуальных данных от Tencent.

Модель / Метрика Результат (OmniDocBench v1.6) Примечание
WeVisDoc (OURS) 95.38% Новый лидер рейтинга
Prior (Предыдущий SOTA) 94.74% Базовый уровень сравнения
HunyuanOCR-1.5 +0.64% Отставание от WeVisDoc

Почему это важно

Рост точности на 0.64% относительно сильного конкурента HunyuanOCR-1.5 в задачах работы с «разнообразными документами» (diverse documents) критичен для промышленных внедрений. Высокая точность на OmniDocBench v1.6 означает лучшую устойчивость модели к шумам, сложным фонам и нестандартным шрифтам, что напрямую влияет на качество автоматизации документооборота и цифровизации архивов.

Доступность

Проект WeVisDoc доступен на платформе GitHub по адресу tencent.github.io/WeVisDoc/. Исследователи и разработчики могут изучить архитектуру модели и использовать её для улучшения своих решений в области компьютерного зрения и обработки естественного языка.

Источник: Github ↗