Исследования1 июля 2026 г., 20:17 МСК🤖 Auto

Шум против точности: Llama 3 и Gemma 3 выигрывают у BERT в распознавании событий на бенгали

Исследование arXiv:2606.30914 показало, что декодерные LLM (Llama 3, Gemma 3) значительно устойчивее к шуму в тексте, чем энкодерные модели (BanglaBERT, XLM-R), при распознавании событий на бенгальском языке.

Баннер новости 2757

Проблема «чистого текста» в NLP

Системы обнаружения событий (Event Detection, ED) традиционно оцениваются на отфильтрованных новостных корпусах. Однако в реальных сценариях данные часто содержат ошибки распознавания речи (ASR) или орфографические искажения. Для малообеспеченных языков, таких как бенгальский, этот пробел особенно критичен. Авторы работы представили первый бенчмарк, оценивающий устойчивость моделей к таким шумам.

Новый датасет: 9 979 аннотированных предложений

Команда разработала обобщенную онтологию событий для бенгальского языка и создала набор данных из 9 979 предложений, охватывающих 40 подтипов событий. Датасет включает три типа данных:

  • Чистый новостной текст;
  • Реальные транскрипты автоматического распознавания речи (ASR);
  • Текст с искусственно внесенными орфографическими искажениями.

Сравнение архитектур: Энкодеры против Декодеров

В исследовании сравнивались fine-tuned модели на основе энкодеров (BanglaBERT, XLM-R) и instruction-tuned декодерные LLM (Llama 3, Gemma 3). Результаты выявили четкий архитектурный компромисс: энкодеры превосходят декодеры на чистых данных, но их производительность резко падает при появлении шума. Декодерные модели демонстрируют высокую робастность, особенно когда искажены триггеры событий.

Модель Архитектура Поведение на чистом тексте Устойчивость к шуму
BanglaBERT / XLM-R Encoder-only Высокая точность Существенная деградация
Llama 3 / Gemma 3 Decoder-only (LLM) Хорошая точность Высокая устойчивость

Стратегии улучшения робастности

Исследование показало два эффективных пути повышения устойчивости:

  1. Масштабирование: Увеличение размера декодерных LLM последовательно повышает их устойчивость к шуму.
  2. Смешанное обучение: Обучение на комбинации чистых и зашумленных данных служит эффективной стратегией регуляризации. Этот подход непропорционально сильно помогает энкодерным архитектурам, значительно сужая разрыв в робастности по сравнению с LLM.

Влияние инструкций

Внедрение аннотационных руководств в процесс instruction tuning устанавливает более высокий базовый уровень производительности на зашумленных данных. Однако авторы отмечают, что это не всегда приводит к стабильному снижению деградации результатов во всех условиях зашумленности, что указывает на сложность взаимодействия между инструкциями и шумом.

Источник: arXiv cs.CL ↗