Проблема масштабируемости экспертных суждений
Принятие решений часто опирается на экспертные заключения, сопровождаемые текстовыми обоснованиями. Однако измерить качество этих объяснений в масштабе крайне сложно. Традиционные методы анализа текста (до эры LLM) и человеческие оценки часто дают противоречивые результаты. Авторы исследования, опубликованного в arXiv (29 июня 2026 г.), предлагают решение: Explanation Quality Markers (EQM) — набор из 60 теоретически обоснованных паттернов рассуждений, которые оцениваются с помощью больших языковых моделей.
Масштаб данных и методология
Авторы провели пререгистрированный анализ данных многолетнего турнира по прогнозированию. В выборку вошли более 55 000 пар «прогноз-обоснование». Для оценки использовались LLM, которые сканировали тексты на наличие конкретных когнитивных паттернов. Ключевая особенность метода — его теоретическая база: более 90% статистически значимых корреляций между EQM и точностью прогнозов совпали с заранее сформулированными гипотезами авторов.
EQM против традиционных метрик
Исследование сравнило новые маркеры с традиционными индикаторами навыка прогнозирования и человеческими оценками. Результаты показали асимметрию сигнала: EQM лучше выявляют потенциальных аутсайдеров, чем выделяют лучших экспертов. Тем не менее, на уровне отдельного прогноза EQM стали самым сильным предиктором точности.
| Метрика оценки | Точность предсказания (уровень прогноза) | Точность предсказания (уровень эксперта) | Ключевые ограничения |
|---|---|---|---|
| EQM (LLM-оценка) | Самый сильный предиктор | Конкурентоспособный (уступает прошлой точности) | Слабее различает топ-экспертов |
| Человеческая оценка | Низкая корреляция | Низкая корреляция | Смещение в пользу длины текста |
| Традиционный анализ текста | Уступает EQM | Уступает EQM | Мало учитывает контекст и логику |
Почему человеческая оценка проигрывает?
Один из самых интригующих выводов — люди склонны переоценивать качество объяснений, основываясь на их длине. В то время как длинные тексты часто кажутся более убедительными, они не всегда коррелируют с фактической точностью прогноза. EQM, напротив, игнорируют «воду» и фокусируются на структурных элементах аргументации.
Значение для индустрии
Метод EQM демонстрирует высокую переносимость: результаты подтвердились на независимом наборе данных прогнозов. Это открывает путь к автоматизированному аудиту экспертных мнений в финансах, политике и стратегическом планировании, позволяя отсекать шум и выделять действительно качественные аналитические обоснования.
Источник: arXiv cs.CL ↗
