Проблема цифрового наследия
Масштабная оцифровка исторических архивов сталкивается с вечной проблемой: ошибки legacy-систем OCR (оптического распознавания символов). Пересканирование миллионов страниц физически невозможно, поэтому на первый план выходит пост-коррекция. Конкурс HIPE-OCRepair-2026, организованный в рамках конференции ICDAR, ставил цель оценить, насколько современные большие языковые модели (LLM) эффективны в исправлении текстов из газет и печатных изданий XVII–XX веков на английском, французском и немецком языках.
Уникальность датасета и метрики
Участникам предоставлялись только текстовые транскрипты без доступа к исходным изображениям. Это имитирует реальные условия работы с уже существующими базами данных. Оценка проводилась по подходу, ориентированному на поиск (retrieval-oriented), а не на дипломатическое соответствие, что отражает практическую задачу: пользователь должен найти нужную информацию, а не получить идеальную копию символа в символе.
Результаты: стратегии и эффективность
Четыре команды представили системы, варьирующиеся от zero-shot промптинга до дообучения (continued pre-training) и тонкой настройки (fine-tuning). Результаты демонстрируют, что LLM действительно улучшают качество, но эффективность сильно зависит от уровня шума и языка. Самая большая проблема — «over-correction» (излишняя коррекция), когда модель исправляет верный текст, считая его ошибкой.
| Аспект | Детали и выводы |
|---|---|
| Языки | Английский, Французский, Немецкий (XVII–XX вв.) |
| Тип данных | Газеты и печатные работы (текстовые транскрипты без изображений) |
| Ключевой риск | Галлюцинации и пере-коррекция (over-correction) на чистых участках текста |
| Метрика | Retrieval-oriented scoring (эффективность поиска, а не посимвольное совпадение) |
Открытые ресурсы
Авторы опубликовали датасет HIPE-OCRepair-2026, скрипты для оценки и пайплайн для публичного использования. Это создает репроducible framework для дальнейших исследований в области цифрового гуманитарного знания (digital heritage). Работа доказывает, что LLM — мощный инструмент, но требующий осторожного внедрения из-за склонности к выдумыванию фактов в историческом контексте.
Источник: arXiv cs.CL ↗
