Проблема: AI-судьи не идеальны для статистики
Использование больших языковых моделей (LLM) в качестве «судей» для оценки качества данных или вывода систем становится стандартом. Однако простое использование AI-оценок как истины в последней инстанции опасно для статистического вывода. AI-модели подвержены шуму и системным смещениям, что требует строгого контроля ошибок первого (Type-I) и второго (Type-II) рода. Традиционные методы либо полагаются на дорогую ручную проверку всех данных, либо на дешевые, но неточные AI-оценки.
Решение: SCALE и информационная граница
Команда исследователей во главе с Дэем Вунгом Хэмом (Dae Woong Ham) разработала алгоритм SCALE (Sequential Cost-Aware Selective AI Scoring and Escalation). Метод основан на выводе информационной нижней границы, которая определяет минимально необходимую стоимость для достижения заданных вероятностей ошибок. Ключевая идея — использование report-dependent information frontier (информационной границы, зависящей от отчета AI), что позволяет количественно оценить ценность информации от AI по сравнению с человеческой верификацией.
Как работает SCALE: три режима взаимодействия
Алгоритм работает с популяцией элементов со скрытыми бинарными метками. Принятие решений происходит последовательно:
- Селективная оценка AI: Система отправляет элемент на проверку в LLM, если это экономически целесообразно.
- Адаптивная эскалация: Если AI-оценка неубедительна или рискованна, элемент перенаправляется человеку-эксперту.
- Ранняя остановка: Процесс прекращается, как только накоплено достаточно статистических доказательств для принятия решения.
Результаты: точность и экономия
SCALE демонстрирует строгие статистические гарантии (valid at finite sample sizes) и асимптотически достигает информационной нижней границы. В сравнении с чистыми стратегиями, алгоритм показывает следующую эффективность:
| Стратегия | Характеристика | Результат/Применение |
|---|---|---|
| Human-only | Только ручная проверка | Максимальная точность, но максимальная стоимость. SCALE приближается к этой стратегии, когда AI неэффективен. |
| AI-only | Только оценка LLM | Минимальная стоимость, высокий риск ошибок. SCALE использует этот режим, когда AI доминирует. |
| SCALE (Hybrid) | Гибридный подход | Максимальная экономия достигается в сценариях, где дешевый AI и точный человек взаимодополняемы. |
Исследование также расширяет фреймворк на случай неизвестной модели вывода AI, используя данные пилотных парных проверок (AI-human pilot data). Это делает метод применимым на практике, где характеристики конкретной LLM могут быть заранее неизвестны.
Источник: arXiv cs.AI ↗
