Проблема «нейтрального коллапса»
Традиционные модели анализа тональности (Sentiment Analysis, SA), такие как RoBERTa, эффективны для простой бинарной классификации (позитив/негатив), но совершенно не справляются с многомерным анализом политического дискурса. В статье, принятой к публикации на PoliticalNLP 2026 (в рамках LREC 2026), авторы вводят термин "neutral collapse" (нейтральный коллапс).
Суть проблемы: RoBERTa классифицирует 70% проанализированных статей как нейтральные. Это не означает, что тексты действительно лишены эмоций или позиции. Напротив, 23% из этих «нейтральных» статей имеют вероятность негативной тональности выше 0.30, что свидетельствует о скрытой критике или поляризации, которую модель игнорирует.
Методология и сравнение подходов
Для проверки гипотезы исследователи использовали корпус из 50 политических новостей, собранных из 17 международных медиа. Были сопоставлены два подхода:
- RoBERTa (Traditional NLP): Фокус на полярности (polarity classification). Результат: упрощение сложного контента до аналитически бесполезной категории «нейтрально».
- LLM-based Multi-Dimensional Analysis: Платформа на базе больших языковых моделей, оценивающая направление политического предвзятого мнения, интенсивность, сенсационность, эмоциональный призыв и фрейминг.
Результаты: почему LLM выигрывают
LLM-подход не просто определяет «хорошо» или «плохо», а предоставляет данные, соответствующие эпистемологии социальных наук (SSH). Он выявляет нюансы, которые RoBERTa сглаживает. Ниже приведено сравнение ключевых характеристик анализа:
| Критерий | RoBERTa (Традиционный NLP) | LLM-платформа (Многомерный анализ) |
|---|---|---|
| Основной вывод | Полярность (Позитив/Негатив/Нейтрально) | Многомерный профиль (Фрейминг, Тон, Предвзятость) |
| Доля «Нейтральных» текстов | 70% (Критический коллапс) | Информативная детализация каждого случая |
| Скрытая негативность | Игнорируется (в 23% случаев score > 0.30) | Выявляется через анализ контекста и фреймов |
| Применимость для SSH | Низкая (слишком грубо) | Высокая (соответствует научным запросам) |
Вывод для исследователей
Авторы подчеркивают: для анализа политических медиа традиционный SA недостаточен. LLM-фреймворки предлагают более адекватное вычислительное линзу для нужд гуманитарных и социальных наук, так как способны улавливать риторические и идеологические измерения, которые критически важны для понимания политической повестки.
Источник: arXiv cs.CL ↗
