Проблема цифровизации истории
Цифровизация средневековых документов сталкивается с серьезной проблемой: гетерогенность оцифровки и различия в практиках транскрипции создают корпуса с «жидким» набором символов. Рукописные тексты часто содержат архаичные шрифты, сокращения и упрощения, которые затрудняют машинное чтение. Авторы работы, опубликованной в arXiv (cs.CL), предлагают решение, основанное на нейросетевом сопоставлении символов.
Техническое ядро: One-to-one и Banded RNNs
Метод Letter Lemmatization использует два подхода на базе рекуррентных нейронных сетей (RNN) на уровне символов:
- One-to-one RNNs: Обучаются с самонадзором для обратного преобразования упрощений набора символов. Модель способна восстановить половину ошибок распознавания (CER) всего на 20 строках текста.
- Banded RNNs: Используют выравнивание символов из параллельных корпусов для успешного развертывания (expansion) сокращений в средневековых хартиях.
Ключевые метрики и результаты
Исследование демонстрирует высокую эффективность метода даже при ограниченных данных. Ниже приведены основные показатели работы предложенных архитектур:
| Метрика / Параметр | Значение / Описание |
|---|---|
| Снижение CER (Character Error Rate) | Восстановление 50% ошибок распознавания |
| Объем обучающих данных | Всего 20 строк текста для One-to-one модели |
| Обработка вставок/удалений | Модели полностью игнорируют ins-dels, фокусируясь на замене символов |
| Результат для сокращений | Успешное развертывание аббревиатур в хартиях |
Инструментарий и семантическое сходство
Авторы ввели эвристический метод для вычисления метрики семантического сходства символов из произвольных наборов. Это позволяет автоматически строить маппинги между историческими и современными шрифтами. Для внедрения метода в практику представлена богатая библиотека на Python, которая эффективно выполняет все описанные операции.
Значимость для HTR
Метод интегрируется в пост-коррекцию Handwritten Text Recognition (HTR). Игнорируя вставки и удаления, сети фокусируются на точной замене символов, что дает значительное улучшение качества транскрипции сложных исторических документов. Работа принята к публикации на воркшопе ICDAR 2026 «VINALDO».
Источник: arXiv cs.CL ↗
