Исследования20 августа 2026 г., 08:18 МСК🤖 Auto

LoRA против Zero-Shot: как обучить LLM распознавать ненависть на Roman Urdu

Исследование arXiv:2608.18142 показывает, что адаптация больших языковых моделей через PEFT (LoRA) повышает F1-меру обнаружения токсичности с 0.56 до 0.93 на датасете из 72 000 комментариев.

Баннер новости 6139

Проблема низкоресурсных языков

Обнаружение языка вражды (Hate Speech Detection, HSD) в низкоресурсных языках (Low-Resource Languages, LRL) сталкивается с тремя главными барьерами: отсутствием размеченных данных, неформальной структурой и отсутствием стандартизированной грамматики. Яркий пример — Roman Urdu (урду, записанное латиницей), широко используемый в Южной Азии в социальных сетях. Этот диалект характеризуется высокой вариативностью написания и отсутствием контекстуально согласованных орфографических норм, что делает его сложным для традиционных NLP-моделей.

Методология и датасет PURUTT

Авторы (Toneema Zubair, Muhammad Junaid Asif и соавторы) провели сравнительное исследование эффективности различных архитектур трансформеров. Для оценки использовался датасет PURUTT (Parallel Urdu and Roman Urdu Corpus for Toxic Comments and Transliteration), содержащий более 72 000 аннотированных комментариев. В эксперименте сравнивались подходы Zero-Shot (без дообучения) и Parameter-Efficient Fine-Tuning (PEFT) с использованием метода Low-Rank Adaptation (LoRA) на следующих моделях:

  • Mistral
  • LLaMA
  • Falcon
  • Multilingual BERT

Ключевые метрики: разрыв в эффективности

Результаты демонстрируют критическую разницу между использованием моделей «как есть» и их адаптацией. Zero-Shot инференс показал лишь умеренные результаты, в то время как дообучение даже малой доли параметров через LoRA привело к значительному скачку качества классификации.

Метод адаптации Метрика F1 Комментарий
Zero-Shot Inference 0.56 Умеренная производительность без дообучения
PEFT (LoRA) > 0.93 Высокая точность при обновлении малого числа параметров

Почему это важно для индустрии

Исследование подтверждает, что PEFT (в частности, LoRA) является оптимальным решением для обработки низкоресурсных языков. Метод обеспечивает не только выдающееся качество классификации (F1 > 0.93), но и отличную вычислительную эффективность. Это позволяет разработчикам внедрять мощные LLM для модерации контента на специфических диалектах, избегая затрат на полное переобучение моделей, что особенно актуально для рынков с ограниченной вычислительной инфраструктурой.

Источник: arXiv cs.AI ↗