Исследования31 августа 2026 г., 11:17 МСК🤖 Auto

Byte-Level Chunking: Zero-Shot прорыв для языков без ресурсов

Исследователи представили метод инициализации байтовых эмбеддингов из замороженных моделей, обеспечивший рост точности POS-тегирования до 13.3% без дообучения.

Баннер новости 6402

Проблема: когда токенизация мешает

Субсловная токенизация (subword tokenization) часто навязывает языковые паттерны доминирующих языков (например, английского) вариантам с общим письмом, что критически снижает качество обработки языков с малым объемом данных (low-resource). Альтернатива — байтовые модели, работающие с сырыми UTF-8 символами, решает проблему переноса паттернов, но создает «разрыв гранулярности» для задач на уровне слов в нелатинских скриптах. Иерархические архитектуры, пытающиеся сгладить этот разрыв, требуют огромных объемов данных для обучения, что недоступно для многих языков.

Решение: Zero-Shot перенос через замороженную модель

Команда исследователей (Sanjeev Kumar, Atsuki Yamaguchi, Nikolaos Aletras) предложила адаптивную иерархическую сеть, которая устраняет этот разрыв модальностей без масштабного обучения. Ключевые технические инновации:

  • Инициализация: Байтовые эмбеддинги инициализируются напрямую из представлений субслов замороженной базовой модели.
  • Выравнивание: Применяется функция потерь chunk alignment loss, проецирующая динамически сгруппированные байтовые чанки на предварительно вычисленные целевые субслова.
  • Супервизия: Легковесный контроль частей речи (POS) используется для направления обнаружения границ слов.

Результаты: рост точности до 13.3%

Эксперименты проводились на шести языках. Метод показал значительное улучшение производительности в задачах морфологического анализа на уровне слов. Ниже приведены ключевые метрики эффективности предложенного подхода по сравнению с базовыми байтовыми моделями:

Метрика Результат Значение
Улучшение POS-тегирования +13.3% Максимальный прирост точности на тестовых языках
Количество языков 6 Включая языки с нелатинскими скриптами
Требования к данным Zero-Shot Отсутствие необходимости в дообучении на целевом языке

Почему это важно для NLP

Работа, принятая к публикации в EMNLP 2026, демонстрирует, что можно обойти необходимость сбора больших размеченных датасетов для редких языков. Используя знания, уже закодированные в крупных многоязычных моделях (через замороженные субсловные представления), исследователи создают мост между байтовым уровнем и семантикой слов. Это открывает путь к созданию более доступных NLP-решений для десятков языков, которые ранее считались «трудными» из-за отсутствия ресурсов.

Источник: arXiv cs.CL ↗