Проблема существующих метрик
Традиционные методы оценки AI часто опираются на промпты или выходные данные моделей, игнорируя «неявные стандарты» качества, которые видны только в реальных документах, создаваемых практикующими специалистами. Это приводит к тому, что модели могут показывать высокие баллы по формальным признакам, но проигрывать в реальной профессиональной ценности.
Решение: FinProBench и RGRC
Авторы (Ben Wang, Kang Zhou и соавторы) представили FinProBench — набор данных для оценки финансовых AI-агентов. Ключевая инновация — метод Role-Grounded Rubric Construction (RGRC). Этот пайплайн извлекает критерии оценки непосредственно из деловых документов (deliverables), созданных профессионалами того же профиля. Процесс включает четыре этапа: сбор документов, извлечение компетенций, синтез рубрик и валидацию.
Масштаб данных и структура
FinProBench базируется на огромном массиве реальных данных, что делает его одним из самых детализированных бенчмарков в нише:
- 1 723 курируемых профессиональных документа;
- 57 различных профессий;
- 8 финансовых субиндустрий;
- 161 тип документа;
- Первоначальный набор для тестирования: 20 полных задач, охватывающих 20 ролей.
Сравнение людей и AI: кто лучше?
При тестировании с использованием гетерогенных LLM-судей и рубрик на уровне ролей, человеческие специалисты показали лучший средний результат. Однако разрыв невелик, а у AI-систем есть свои сильные стороны.
| Категория | Средний балл (из 100) | Примечание |
|---|---|---|
| Человеческие специалисты | 73.7 | Лидер по среднему баллу |
| AI-система 1 | 70.3 | 95% доверительный интервал пересекается с людьми |
| AI-система 2 | 70.2 | 95% доверительный интервал пересекается с людьми |
| AI-система 3 | 69.6 | 95% доверительный интервал пересекается с людьми |
Эффективность метода RGRC
Использование рубрик, привязанных к роли, а не к отдельной задаче, значительно снижает трудозатраты. Повторное использование рубрик на уровне роли сокращает оценочные усилия по созданию каждой новой рубрики в 6.7 раза по сравнению с написанием их с нуля для каждой задачи.
Важное открытие: Prior-rich vs Prior-sparse
Исследователи разделили 57 профессий на две группы. Для «традиционных ролей» (prior-rich), где стандарты хорошо известны модели, простой промптинг (Prompt-only) почти догнал RGRC (89.2% vs 90.7%). Однако для «специализированных ролей» (prior-sparse), где знания менее представлены в обучающих данных, RGRC превзошел простой промптинг с огромным отрывом: 99.1% против 78.0%. Это доказывает, что для сложных нишевых задач финансовое «заземление» (professional grounding) критически важно.
Источник: arXiv cs.AI ↗
