Проблема: не просто конфликт, а его тип
В финансовых раскрытиях (financial disclosures) противоречия бывают разными: числовые, временные, ссылочные, фактические и нормативные. Простого обнаружения конфликта недостаточно — для каждого типа нужны разные доказательства и проверки. Авторы работы из arXiv:2607.26368 предлагают задачу тонкой классификации противоречий (fine-grained inconsistency classification) и тестируют, как с ней справляются современные AI-системы.
Методология и датасет
Для оценки использован синтетический бенчмарк SBID-FD с фиксированным набором из 5 940 примеров. Каждый пример содержит 11 меток типов противоречий и парные фрагменты-доказательства (evidence spans). В исследовании сравниваются:
- Замороженные классификаторы на эмбеддингах (frozen embedding classifiers),
- Дообученные энкодеры (fine-tuned encoders),
- Классификаторы с добавлением доказательств (evidence-augmented),
- Промпт-модели (LLM),
- Генеративные модели с адаптацией LoRA.
Результаты: компактность побеждает масштаб?
Главный инсайт — дообученный энкодер на 300 миллионов параметров показал точность 61.9%, что выше, чем у:
- Qwen3.5-9B с адаптацией LoRA — 61.5%,
- GPT-5.4 — 61.3%.
Авторы подчеркивают, что это не доказательство превосходства малых моделей, а демонстрация практической эффективности компактных дообученных энкодеров при сопоставимых условиях оценки.
| Модель / Подход | Параметры | Точность (Accuracy) | Примечание |
|---|---|---|---|
| Дообученный энкодер | 300M | 61.9% | Лучший результат |
| Qwen3.5-9B (LoRA) | 9B | 61.5% | Генеративная модель |
| GPT-5.4 | — | 61.3% | Промпт-модель |
| Дообученный энкодер + gold evidence | 300M | 65.3% | С идеальными доказательствами |
Роль доказательств (evidence) и узкие места
Предоставление идеальных фрагментов-доказательств (gold evidence spans) повышает точность дообученного энкодера до 65.3%. Автоматически предсказанные фрагменты дают частичный прирост, но качество локализации остается бутылочным горлышком.
Анализ по классам выявил:
- Ссылочные противоречия (Referential) сильно зависят от качества локализации доказательств.
- Фактические и логические противоречия остаются сложными даже при наличии правильных доказательств.
Вывод для индустрии
Прогресс в автоматическом аудите финансовой отчетности требует двух направлений:
- Улучшение извлечения доказательств (evidence extraction),
- Более точное различение близких категорий противоречий.
Для компаний, внедряющих AI в комплаенс и аудит, это означает, что дообученные компактные модели могут быть более рентабельным решением, чем крупные LLM, при условии качественной подготовки данных и доказательств.
Источник: arXiv cs.CL ↗
