Прорыв в распознавании сложных документов
Лаборатория ATH-MaaS представила модель OvisOCR2, разработанную для решения ключевых проблем современных систем оптического распознавания символов (OCR). В отличие от предыдущих версий, новая архитектура специально оптимизирована для работы с «шумными» данными: сложными макетами, рукописным текстом и изображениями низкого качества. Это критически важно для автоматизации документооборота в финансах, юриспруденции и логистике.
Лидерство в бенчмарках
Модель показала выдающиеся результаты на стандартных наборах данных для оценки OCR-систем. OvisOCR2 не просто улучшает метрики, но и меняет баланс между скоростью и точностью, что позволяет использовать её в реальном времени. Ниже приведены сравнительные характеристики на ключевых датасетах:
| Датасет | Метрика | OvisOCR2 | Предыдущий SOTA |
|---|---|---|---|
| TextVQA | Accuracy | 78.5% | 74.2% |
| DocVQA | Accuracy | 82.1% | 79.8% |
| Real-World Documents | WER (Word Error Rate) | 4.3% | 6.7% |
Архитектурные улучшения
В основе OvisOCR2 лежит улучшенная мультимодальная архитектура, способная одновременно анализировать визуальные паттерны и семантический контекст. Модель эффективно справляется с:
- Деформированным текстом (изогнутые линии, перспективные искажения).
- Многоязычными документами (поддержка кириллицы, латиницы и азиатских языков в одном потоке).
- Слабоконтрастными изображениями (размытие, плохое освещение).
Доступность и интеграция
Модель доступна на платформе Hugging Face под идентификатором ATH-MaaS/OvisOCR2. Разработчики предоставляют готовые веса для загрузки, что позволяет интегрировать OvisOCR2 в существующие пайплайны обработки данных с минимальными усилиями. Обновление вышло 2 дня назад, что делает его одним из самых свежих решений в области компьютерного зрения.
Источник: Huggingface ↗
