Исследования12 сентября 2026 г., 13:17 МСК🤖 Auto

Финансовый сентимент: почему валидность не равна прогнозу

Исследование arXiv:2609.11144 вскрывает критический разрыв между семантической точностью NLP-моделей и их реальной способностью предсказывать движение рынка.

Баннер новости 7351

Разрыв между «пониманием» и «прогнозом»

Стандартная парадигма в Financial NLP предполагает линейную логику: если инструмент сентимент-анализа хорошо совпадает с человеческой оценкой (конструктная валидность), он должен успешно предсказывать рыночные сигналы (предиктивная валидность). Авторы исследования — A. Aravinthkakshan, L. Srivastava и H. Nandwani — опровергают это допущение. Они доказывают, что высокая точность классификации тональности текста не гарантирует способности модели выявлять аномальные доходности акций.

Масштаб данных и бенчмарки

Для проверки гипотезы команда использовала уникальный корпус данных по искам о ценных бумагах (securities class actions) за период с 2002 по 2025 год. В выборку вошли 70 500 сообщений X (Twitter), связанных с конкретными компаниями. Для калибровки использовалась «золотая выборка» с ручной аннотацией одного эксперта. Пять различных инструментов прошли через идентичный пайплайн оценки:

  • VADER (лексико-статистический метод)
  • Loughran-McDonald (специализированный финансовый словарь)
  • FinBERT (дообученная BERT-модель)
  • Twitter-RoBERTa (модель, обученная на соцсетях)
  • LLM annotator (аннотатор на базе большой языковой модели)

Ключевые метрики и результаты

Исследование показало, что корреляция между человеческой оценкой и предсказательной силой зависит от метода выборки. При стандартном подходе согласованность с человеком лучше отражает внутридневные ассоциации, чем прогнозы на следующий день. Однако при использовании фиксированной панели (fixed-n panel) ранговые корреляции становятся схожими на обоих горизонтах, хотя грубое упорядочивание остается слабым. Это означает, что модели могут точно определять «хорошо/плохо», но не способны ранжировать интенсивность влияния на рынок.

Инструмент Тип модели Ключевая находка
VADER Лексико-статистический Хорошо коррелирует с человеческой оценкой, но слабо предсказывает аномальные доходности
Loughran-McDonald Финансовый словарь Высокая семантическая валидность, низкая предиктивная сила на горизонте 1 день
FinBERT Transformer (NLP) Показал схожие ранговые корреляции с LLM, но без улучшения в прогнозировании объема ущерба
LLM annotator Генеративная модель Не превзошел традиционные методы в предсказании рыночных последствий

Шум данных и практический вывод

Отдельно авторы отмечают проблему качества данных: 17,6% сообщений в выборке были классифицированы как спам. Объем сообщений (volume) не предсказал ни размер рыночного ущерба, ни размер урегулирования иска (settlement size). Главный вывод статьи: бенчмарк-согласованность с человеком устанавливает только семантическую валидность, но не определяет предиктивные ранги. Для создания торговых стратегий или юридических аналитических систем полагаться только на точность классификации тональности недостаточно — необходим отдельный валидационный этап на реальных рыночных данных.

Источник: arXiv cs.AI ↗