Исследования30 июля 2026 г., 12:17 МСК🤖 Auto

Малые модели vs GPT-5.4: кто лучше находит противоречия в финотчетности?

Исследование показывает, что компактный 300M-модель с дообучением достигает точности 61.9% в классификации тонких противоречий, обогнав GPT-5.4 и Qwen3.5-9B.

Баннер новости 4709

Проблема: не просто конфликт, а его тип

В финансовых раскрытиях (financial disclosures) противоречия бывают разными: числовые, временные, ссылочные, фактические и нормативные. Простого обнаружения конфликта недостаточно — для каждого типа нужны разные доказательства и проверки. Авторы работы из arXiv:2607.26368 предлагают задачу тонкой классификации противоречий (fine-grained inconsistency classification) и тестируют, как с ней справляются современные AI-системы.

Методология и датасет

Для оценки использован синтетический бенчмарк SBID-FD с фиксированным набором из 5 940 примеров. Каждый пример содержит 11 меток типов противоречий и парные фрагменты-доказательства (evidence spans). В исследовании сравниваются:

  • Замороженные классификаторы на эмбеддингах (frozen embedding classifiers),
  • Дообученные энкодеры (fine-tuned encoders),
  • Классификаторы с добавлением доказательств (evidence-augmented),
  • Промпт-модели (LLM),
  • Генеративные модели с адаптацией LoRA.

Результаты: компактность побеждает масштаб?

Главный инсайт — дообученный энкодер на 300 миллионов параметров показал точность 61.9%, что выше, чем у:

  • Qwen3.5-9B с адаптацией LoRA — 61.5%,
  • GPT-5.4 — 61.3%.

Авторы подчеркивают, что это не доказательство превосходства малых моделей, а демонстрация практической эффективности компактных дообученных энкодеров при сопоставимых условиях оценки.

Модель / Подход Параметры Точность (Accuracy) Примечание
Дообученный энкодер 300M 61.9% Лучший результат
Qwen3.5-9B (LoRA) 9B 61.5% Генеративная модель
GPT-5.4 61.3% Промпт-модель
Дообученный энкодер + gold evidence 300M 65.3% С идеальными доказательствами

Роль доказательств (evidence) и узкие места

Предоставление идеальных фрагментов-доказательств (gold evidence spans) повышает точность дообученного энкодера до 65.3%. Автоматически предсказанные фрагменты дают частичный прирост, но качество локализации остается бутылочным горлышком.

Анализ по классам выявил:

  • Ссылочные противоречия (Referential) сильно зависят от качества локализации доказательств.
  • Фактические и логические противоречия остаются сложными даже при наличии правильных доказательств.

Вывод для индустрии

Прогресс в автоматическом аудите финансовой отчетности требует двух направлений:

  1. Улучшение извлечения доказательств (evidence extraction),
  2. Более точное различение близких категорий противоречий.

Для компаний, внедряющих AI в комплаенс и аудит, это означает, что дообученные компактные модели могут быть более рентабельным решением, чем крупные LLM, при условии качественной подготовки данных и доказательств.

Источник: arXiv cs.CL ↗