Исследования14 июля 2026 г., 06:16 МСК🤖 Auto

Letter Lemmatization: AI расшифровывает средневековые рукописи

Исследователи представили метод Letter Lemmatization, использующий RNN-сети для автоматического восстановления оригинального текста средневековых документов, сокращений и упрощения шрифтов.

Баннер новости 3507

Проблема цифровизации истории

Цифровизация средневековых документов сталкивается с серьезной проблемой: гетерогенность оцифровки и различия в практиках транскрипции создают корпуса с «жидким» набором символов. Рукописные тексты часто содержат архаичные шрифты, сокращения и упрощения, которые затрудняют машинное чтение. Авторы работы, опубликованной в arXiv (cs.CL), предлагают решение, основанное на нейросетевом сопоставлении символов.

Техническое ядро: One-to-one и Banded RNNs

Метод Letter Lemmatization использует два подхода на базе рекуррентных нейронных сетей (RNN) на уровне символов:

  • One-to-one RNNs: Обучаются с самонадзором для обратного преобразования упрощений набора символов. Модель способна восстановить половину ошибок распознавания (CER) всего на 20 строках текста.
  • Banded RNNs: Используют выравнивание символов из параллельных корпусов для успешного развертывания (expansion) сокращений в средневековых хартиях.

Ключевые метрики и результаты

Исследование демонстрирует высокую эффективность метода даже при ограниченных данных. Ниже приведены основные показатели работы предложенных архитектур:

Метрика / Параметр Значение / Описание
Снижение CER (Character Error Rate) Восстановление 50% ошибок распознавания
Объем обучающих данных Всего 20 строк текста для One-to-one модели
Обработка вставок/удалений Модели полностью игнорируют ins-dels, фокусируясь на замене символов
Результат для сокращений Успешное развертывание аббревиатур в хартиях

Инструментарий и семантическое сходство

Авторы ввели эвристический метод для вычисления метрики семантического сходства символов из произвольных наборов. Это позволяет автоматически строить маппинги между историческими и современными шрифтами. Для внедрения метода в практику представлена богатая библиотека на Python, которая эффективно выполняет все описанные операции.

Значимость для HTR

Метод интегрируется в пост-коррекцию Handwritten Text Recognition (HTR). Игнорируя вставки и удаления, сети фокусируются на точной замене символов, что дает значительное улучшение качества транскрипции сложных исторических документов. Работа принята к публикации на воркшопе ICDAR 2026 «VINALDO».

Источник: arXiv cs.CL ↗