Проблема: разрыв между обучением и реальностью
Финансовые ИИ-системы часто обучаются на структурированных отчетах SEC, но развертываются в новостях и соцсетях. Стандартная метрика F1-score не показывает, какие именно предсказания безопасны для автоматизации при изменении распределения данных. Авторы исследования (Zihao Zheng, Baichuan Li, Junyi Yao, Jiayu Long) провели стресс-тест на трех уровнях: отчеты SEC, финансовые новости и социальные медиа общего профиля.
Методология: 5 сигналов уверенности
Команда оценивала BERT-теггер и LoRA-дообученные модели Qwen2.5-0.5B и Qwen2.5-1.5B. Использовались 5 методов оценки уверенности на этапе инференса, 3 начальных семплирования и бутстрап-интервалы. Ключевой вопрос: как меняются ранги уверенности при сдвиге домена?
Ключевые результаты: что работает, а что нет
Общая вероятность вывода (whole-output probability) оказалась лучшим детектором ошибок внутри домена, но резко деградировала вне его. Напротив, вероятность по сущности (entity-span probability) и самосогласованность (self-consistency) показали большую устойчивость. Самосогласованность также лучше калибрована без пост-обработки.
| Метрика уверенности | Внутри домена (SEC) | Вне домена (Новости/Соцсети) |
|---|---|---|
| Whole-output probability | Сильный детектор ошибок | Резкая деградация |
| Entity-span probability | Стабильно | Более устойчиво |
| Self-consistency | Хорошая калибровка | Лучшая калибровка без пост-фиттинга |
Практическое применение: стратегия отказа
Механизм отказа от предсказания (abstention) позволил снизить ошибку предложения с 34.3% до менее 2% на 40% самых уверенных входных данных внутри домена. Однако при экстремальном сдвиге (соцсети) метод не смог выделить достаточно чистое подмножество для автоматизации. Это доказывает необходимость многоступенчатой стратегии развертывания: сначала детектировать сильный сдвиг домена, и только затем применять пороговые значения уверенности на уровне предсказаний.
Источник: arXiv cs.CL ↗
