Исследования6 августа 2026 г., 07:17 МСК🤖 Auto

FinProBench: AI-агенты против людей в финансах. Новые метрики качества

Исследователи представили FinProBench — первый бенчмарк для оценки финансовых AI-агентов, использующий рубрики, извлеченные из реальных профессиональных документов. Люди пока выигрывают, но разница минимальна.

Баннер новости 5185

Проблема существующих метрик

Традиционные методы оценки AI часто опираются на промпты или выходные данные моделей, игнорируя «неявные стандарты» качества, которые видны только в реальных документах, создаваемых практикующими специалистами. Это приводит к тому, что модели могут показывать высокие баллы по формальным признакам, но проигрывать в реальной профессиональной ценности.

Решение: FinProBench и RGRC

Авторы (Ben Wang, Kang Zhou и соавторы) представили FinProBench — набор данных для оценки финансовых AI-агентов. Ключевая инновация — метод Role-Grounded Rubric Construction (RGRC). Этот пайплайн извлекает критерии оценки непосредственно из деловых документов (deliverables), созданных профессионалами того же профиля. Процесс включает четыре этапа: сбор документов, извлечение компетенций, синтез рубрик и валидацию.

Масштаб данных и структура

FinProBench базируется на огромном массиве реальных данных, что делает его одним из самых детализированных бенчмарков в нише:

  • 1 723 курируемых профессиональных документа;
  • 57 различных профессий;
  • 8 финансовых субиндустрий;
  • 161 тип документа;
  • Первоначальный набор для тестирования: 20 полных задач, охватывающих 20 ролей.

Сравнение людей и AI: кто лучше?

При тестировании с использованием гетерогенных LLM-судей и рубрик на уровне ролей, человеческие специалисты показали лучший средний результат. Однако разрыв невелик, а у AI-систем есть свои сильные стороны.

Категория Средний балл (из 100) Примечание
Человеческие специалисты 73.7 Лидер по среднему баллу
AI-система 1 70.3 95% доверительный интервал пересекается с людьми
AI-система 2 70.2 95% доверительный интервал пересекается с людьми
AI-система 3 69.6 95% доверительный интервал пересекается с людьми

Эффективность метода RGRC

Использование рубрик, привязанных к роли, а не к отдельной задаче, значительно снижает трудозатраты. Повторное использование рубрик на уровне роли сокращает оценочные усилия по созданию каждой новой рубрики в 6.7 раза по сравнению с написанием их с нуля для каждой задачи.

Важное открытие: Prior-rich vs Prior-sparse

Исследователи разделили 57 профессий на две группы. Для «традиционных ролей» (prior-rich), где стандарты хорошо известны модели, простой промптинг (Prompt-only) почти догнал RGRC (89.2% vs 90.7%). Однако для «специализированных ролей» (prior-sparse), где знания менее представлены в обучающих данных, RGRC превзошел простой промптинг с огромным отрывом: 99.1% против 78.0%. Это доказывает, что для сложных нишевых задач финансовое «заземление» (professional grounding) критически важно.

Источник: arXiv cs.AI ↗