Разрыв между «пониманием» и «прогнозом»
Стандартная парадигма в Financial NLP предполагает линейную логику: если инструмент сентимент-анализа хорошо совпадает с человеческой оценкой (конструктная валидность), он должен успешно предсказывать рыночные сигналы (предиктивная валидность). Авторы исследования — A. Aravinthkakshan, L. Srivastava и H. Nandwani — опровергают это допущение. Они доказывают, что высокая точность классификации тональности текста не гарантирует способности модели выявлять аномальные доходности акций.
Масштаб данных и бенчмарки
Для проверки гипотезы команда использовала уникальный корпус данных по искам о ценных бумагах (securities class actions) за период с 2002 по 2025 год. В выборку вошли 70 500 сообщений X (Twitter), связанных с конкретными компаниями. Для калибровки использовалась «золотая выборка» с ручной аннотацией одного эксперта. Пять различных инструментов прошли через идентичный пайплайн оценки:
- VADER (лексико-статистический метод)
- Loughran-McDonald (специализированный финансовый словарь)
- FinBERT (дообученная BERT-модель)
- Twitter-RoBERTa (модель, обученная на соцсетях)
- LLM annotator (аннотатор на базе большой языковой модели)
Ключевые метрики и результаты
Исследование показало, что корреляция между человеческой оценкой и предсказательной силой зависит от метода выборки. При стандартном подходе согласованность с человеком лучше отражает внутридневные ассоциации, чем прогнозы на следующий день. Однако при использовании фиксированной панели (fixed-n panel) ранговые корреляции становятся схожими на обоих горизонтах, хотя грубое упорядочивание остается слабым. Это означает, что модели могут точно определять «хорошо/плохо», но не способны ранжировать интенсивность влияния на рынок.
| Инструмент | Тип модели | Ключевая находка |
|---|---|---|
| VADER | Лексико-статистический | Хорошо коррелирует с человеческой оценкой, но слабо предсказывает аномальные доходности |
| Loughran-McDonald | Финансовый словарь | Высокая семантическая валидность, низкая предиктивная сила на горизонте 1 день |
| FinBERT | Transformer (NLP) | Показал схожие ранговые корреляции с LLM, но без улучшения в прогнозировании объема ущерба |
| LLM annotator | Генеративная модель | Не превзошел традиционные методы в предсказании рыночных последствий |
Шум данных и практический вывод
Отдельно авторы отмечают проблему качества данных: 17,6% сообщений в выборке были классифицированы как спам. Объем сообщений (volume) не предсказал ни размер рыночного ущерба, ни размер урегулирования иска (settlement size). Главный вывод статьи: бенчмарк-согласованность с человеком устанавливает только семантическую валидность, но не определяет предиктивные ранги. Для создания торговых стратегий или юридических аналитических систем полагаться только на точность классификации тональности недостаточно — необходим отдельный валидационный этап на реальных рыночных данных.
Источник: arXiv cs.AI ↗
