Проблема «чистого текста» в NLP
Системы обнаружения событий (Event Detection, ED) традиционно оцениваются на отфильтрованных новостных корпусах. Однако в реальных сценариях данные часто содержат ошибки распознавания речи (ASR) или орфографические искажения. Для малообеспеченных языков, таких как бенгальский, этот пробел особенно критичен. Авторы работы представили первый бенчмарк, оценивающий устойчивость моделей к таким шумам.
Новый датасет: 9 979 аннотированных предложений
Команда разработала обобщенную онтологию событий для бенгальского языка и создала набор данных из 9 979 предложений, охватывающих 40 подтипов событий. Датасет включает три типа данных:
- Чистый новостной текст;
- Реальные транскрипты автоматического распознавания речи (ASR);
- Текст с искусственно внесенными орфографическими искажениями.
Сравнение архитектур: Энкодеры против Декодеров
В исследовании сравнивались fine-tuned модели на основе энкодеров (BanglaBERT, XLM-R) и instruction-tuned декодерные LLM (Llama 3, Gemma 3). Результаты выявили четкий архитектурный компромисс: энкодеры превосходят декодеры на чистых данных, но их производительность резко падает при появлении шума. Декодерные модели демонстрируют высокую робастность, особенно когда искажены триггеры событий.
| Модель | Архитектура | Поведение на чистом тексте | Устойчивость к шуму |
|---|---|---|---|
| BanglaBERT / XLM-R | Encoder-only | Высокая точность | Существенная деградация |
| Llama 3 / Gemma 3 | Decoder-only (LLM) | Хорошая точность | Высокая устойчивость |
Стратегии улучшения робастности
Исследование показало два эффективных пути повышения устойчивости:
- Масштабирование: Увеличение размера декодерных LLM последовательно повышает их устойчивость к шуму.
- Смешанное обучение: Обучение на комбинации чистых и зашумленных данных служит эффективной стратегией регуляризации. Этот подход непропорционально сильно помогает энкодерным архитектурам, значительно сужая разрыв в робастности по сравнению с LLM.
Влияние инструкций
Внедрение аннотационных руководств в процесс instruction tuning устанавливает более высокий базовый уровень производительности на зашумленных данных. Однако авторы отмечают, что это не всегда приводит к стабильному снижению деградации результатов во всех условиях зашумленности, что указывает на сложность взаимодействия между инструкциями и шумом.
Источник: arXiv cs.CL ↗
