Исследования11 июля 2026 г., 08:16 МСК🤖 Auto

HIPE-OCRepair 2026: LLM спасают исторические архивы от ошибок OCR

Результаты конкурса ICDAR 2026 показывают, что современные LLM способны значительно повысить качество распознавания исторических документов, но риск «галлюцинаций» и пере-коррекции остается критическим.

Баннер новости 3363

Проблема цифрового наследия

Масштабная оцифровка исторических архивов сталкивается с вечной проблемой: ошибки legacy-систем OCR (оптического распознавания символов). Пересканирование миллионов страниц физически невозможно, поэтому на первый план выходит пост-коррекция. Конкурс HIPE-OCRepair-2026, организованный в рамках конференции ICDAR, ставил цель оценить, насколько современные большие языковые модели (LLM) эффективны в исправлении текстов из газет и печатных изданий XVII–XX веков на английском, французском и немецком языках.

Уникальность датасета и метрики

Участникам предоставлялись только текстовые транскрипты без доступа к исходным изображениям. Это имитирует реальные условия работы с уже существующими базами данных. Оценка проводилась по подходу, ориентированному на поиск (retrieval-oriented), а не на дипломатическое соответствие, что отражает практическую задачу: пользователь должен найти нужную информацию, а не получить идеальную копию символа в символе.

Результаты: стратегии и эффективность

Четыре команды представили системы, варьирующиеся от zero-shot промптинга до дообучения (continued pre-training) и тонкой настройки (fine-tuning). Результаты демонстрируют, что LLM действительно улучшают качество, но эффективность сильно зависит от уровня шума и языка. Самая большая проблема — «over-correction» (излишняя коррекция), когда модель исправляет верный текст, считая его ошибкой.

Аспект Детали и выводы
Языки Английский, Французский, Немецкий (XVII–XX вв.)
Тип данных Газеты и печатные работы (текстовые транскрипты без изображений)
Ключевой риск Галлюцинации и пере-коррекция (over-correction) на чистых участках текста
Метрика Retrieval-oriented scoring (эффективность поиска, а не посимвольное совпадение)

Открытые ресурсы

Авторы опубликовали датасет HIPE-OCRepair-2026, скрипты для оценки и пайплайн для публичного использования. Это создает репроducible framework для дальнейших исследований в области цифрового гуманитарного знания (digital heritage). Работа доказывает, что LLM — мощный инструмент, но требующий осторожного внедрения из-за склонности к выдумыванию фактов в историческом контексте.

Источник: arXiv cs.CL ↗