Победа на EvaLatin 2026
В ходе конференции EvaLatin 2026 (в рамках LT4HALA@LREC, Пальма-де-Майорка, май 2026 года) команда uOttawa под руководством Каллума Чана (Callum Chan) продемонстрировала прорыв в обработке древних языков. Используя методы transfer learning и промпт-инжиниринга, исследователи заняли первое место в обоих подзадачах распознавания именованных сущностей (NER) для классической латыни, превзойдя все остальные заявки.
Детали эксперимента и модели
Задача была разделена на два уровня детализации: грубое (coarse-grained) с 11 классами сущностей и тонкое (fine-grained) с 28 классами. Оценка проводилась в двух режимах: строгом (strict) и допустимом (fuzzy). В качестве базовых моделей использовались коммерческие Large Language Models, которые не были дообучены на латыни, а применялись через продуманные промпты, использующие их кросс-лингвальные способности.
Ключевые модели, участвовавшие в сравнении:
- Google Gemini 2.5 Pro
- Anthropic Claude Sonnet 4.5
Результаты: абсолютное лидерство
Методика показала «очень сильные результаты» (very strong results), достигнув лучших показателей по всем метрикам и во всех режимах оценки среди всех участников соревнования. Это доказывает, что современные LLM способны эффективно переносить знания с высокоресурсных языков на древние, даже без специализированного дообучения (fine-tuning) на малых корпусах латинских текстов.
| Метрика / Режим | Результат команды uOttawa | Статус |
|---|---|---|
| NER (Coarse-grained, 11 классов) | Лучший результат | 1-е место |
| NER (Fine-grained, 28 классов) | Лучший результат | 1-е место |
| Strict Regime | Максимальные баллы | Лидер |
| Fuzzy Regime | Максимальные баллы | Лидер |
Почему это важно
Работа демонстрирует потенциал «zero-shot» или «few-shot» подходов в цифровой гуманитаристике. Цифровизация классических текстов растет, но ресурсов для обучения специализированных моделей часто недостаточно. Успех Gemini 2.5 Pro и Claude Sonnet 4.5 открывает путь к быстрой и качественной автоматизации анализа исторических документов, библиографических данных и архивов на латыни, используя доступные коммерческие API.
Источник: arXiv cs.CL ↗
