Проблема «черного ящика» в китайском NLP
Традиционные токенизированные модели, такие как BERT, рассматривают китайские иероглифы как атомарные идентификаторы. Это игнорирует их рекурсивную орфографическую структуру. В результате модели вынуждены полагаться исключительно на контекстуальное совпадение, что критически снижает эффективность при работе с редкими иероглифами и словами, отсутствующими в словаре (OOV).
Решение: Compositional Network Model (CNM)
Авторы Thomas Sing-wing Wu и Liqian Yan предлагают CNM-BERT — архитектурное дополнение, которое внедряет дискретную композиционную структуру в трансформеры. Метод работает по принципу «Drop-In» (вставь и работай), не требуя изменения основного бэкбона модели. Процесс включает три этапа:
- Парсинг: Иероглифы разбиваются на последовательности идеографического описания (IDS) и преобразуются в деревья.
- Кодирование: Структура обрабатывается через рекурсивный Tree-MLP.
- Фьюжн: Полученные структурные эмбеддинги сливаются с обычными токенами BERT.
Результаты бенчмарков
Оценка проводилась на структурированном бенчмарке Wu et al. (2025) и стандартных наборах данных CLUE, MRC и NER. CNM-BERT демонстрирует стабильное превосходство над сильнейшим базовым решением — ChineseBERT, особенно в задачах, требующих понимания редких символов.
| Метрика | Модель | Результат |
|---|---|---|
| Structure Accuracy (Long-tail/OOV) | CNM-BERT | +9.8 (относительно baseline) |
| Radical F1 (Long-tail/OOV) | CNM-BERT | +7.7 (относительно baseline) |
| Downstream Tasks (CLUE, MRC, NER) | CNM-BERT (Base & Large) | Consistent gains (стабильный рост) |
Почему это важно
Работа доказывает, что явное внедрение структурных знаний (радикалов и компонентов) дает измеримый прирост качества в downstream-задачах. Это позволяет моделям лучше «понимать» смысл редких иероглифов через их состав, а не просто запоминать их контекст, что критично для медицинских, юридических и исторических текстов, где часто встречаются специфические символы.
Источник: arXiv cs.CL ↗
