Проблема верификации в русском языке
Существующие бенчмарки, такие как FINCHAIN, ограничены английским языком, а русскоязычные аналоги (например, FINESSE-Bench) часто полагаются на тесты с множественным выбором без проверки промежуточных шагов. Это скрывает истинную способность модели к цепочечному мышлению (Chain-of-Thought, CoT). Авторы RusFinChain заполнили этот пробел, создав первый специализированный датасет для верифицируемого символического рассуждения на русском языке.
Архитектура датасета: 5280 задач без утечек
Ключевая особенность RusFinChain — использование исполняемых Python-шаблонов для генерации примеров. Это гарантирует отсутствие «загрязнения» данных (contamination-free), так как задачи генерируются параметрически, а не копируются из интернета. Датасет охватывает 17 финансовых доменов и 172 темы. Каждая задача содержит «золотой стандарт» — полную цепочку рассуждений с промежуточными числовыми значениями, что позволяет автоматически проверять каждый шаг логики модели.
Результаты тестирования: разрыв в логике
Авторы протестировали 8 открытых LLM-моделей, получив 8100 ответов. Результаты выявили серьезный разрыв в навыках рассуждения:
- Hard F1 (~0.65): Модели относительно хорошо справляются с выравниванием промежуточных шагов рассуждения.
- Точность финального ответа (~29%): Лишь треть ответов является полностью верной, несмотря на правильные промежуточные выкладки.
Это означает, что модели часто делают логические ошибки на финальных этапах агрегации данных, даже если отдельные шаги вычислений верны.
Новые метрики: Fuzzy и Soft Alignment
Стандартные метрики оценки часто не учитывают семантическую близость числовых ответов. Авторы внедрили метрики Fuzzy Numeric Alignment и Soft-Attention Alignment. Они показали более высокую корреляцию с правильностью финального ответа (Spearman rho ≈ 0.48) по сравнению с оригинальным ChainEval (rho ≈ 0.38–0.46). Это делает новые метрики более надежным инструментом диагностики слабых мест финансовых ИИ.
| Метрика / Показатель | Значение / Характеристика | Значимость |
|---|---|---|
| Объем датасета | 5,280 примеров | Покрытие 17 доменов, 172 темы |
| Hard F1 (выравнивание шагов) | ~0.65 | Базовый уровень понимания логики |
| Точность финального ответа | ~29% | Критический разрыв в надежности |
| Корреляция (Spearman rho) | 0.48 (новые метрики) | Лучше предсказывает успех, чем ChainEval (0.38-0.46) |
Открытый доступ
Авторы опубликовали датасет, код для генерации задач и фреймворк оценки. Это позволяет исследователям и разработчикам внедрять строгую верификацию финансовых рассуждений в русскоязычные LLM, что критически важно для создания надежных финансовых ассистентов и аналитических систем.
Источник: arXiv cs.CL ↗
