Исследования25 сентября 2026 г., 17:21 МСК🤖 Auto

SCALE: Алгоритм, экономящий бюджет на проверках за счет гибрида AI и человека

Исследователи представили SCALE — стратегию последовательного тестирования гипотез, которая минимизирует затраты, комбинируя дешевые оценки LLM и дорогую верификацию экспертами.

Баннер новости 8275

Проблема: AI-судьи не идеальны для статистики

Использование больших языковых моделей (LLM) в качестве «судей» для оценки качества данных или вывода систем становится стандартом. Однако простое использование AI-оценок как истины в последней инстанции опасно для статистического вывода. AI-модели подвержены шуму и системным смещениям, что требует строгого контроля ошибок первого (Type-I) и второго (Type-II) рода. Традиционные методы либо полагаются на дорогую ручную проверку всех данных, либо на дешевые, но неточные AI-оценки.

Решение: SCALE и информационная граница

Команда исследователей во главе с Дэем Вунгом Хэмом (Dae Woong Ham) разработала алгоритм SCALE (Sequential Cost-Aware Selective AI Scoring and Escalation). Метод основан на выводе информационной нижней границы, которая определяет минимально необходимую стоимость для достижения заданных вероятностей ошибок. Ключевая идея — использование report-dependent information frontier (информационной границы, зависящей от отчета AI), что позволяет количественно оценить ценность информации от AI по сравнению с человеческой верификацией.

Как работает SCALE: три режима взаимодействия

Алгоритм работает с популяцией элементов со скрытыми бинарными метками. Принятие решений происходит последовательно:

  • Селективная оценка AI: Система отправляет элемент на проверку в LLM, если это экономически целесообразно.
  • Адаптивная эскалация: Если AI-оценка неубедительна или рискованна, элемент перенаправляется человеку-эксперту.
  • Ранняя остановка: Процесс прекращается, как только накоплено достаточно статистических доказательств для принятия решения.

Результаты: точность и экономия

SCALE демонстрирует строгие статистические гарантии (valid at finite sample sizes) и асимптотически достигает информационной нижней границы. В сравнении с чистыми стратегиями, алгоритм показывает следующую эффективность:

Стратегия Характеристика Результат/Применение
Human-only Только ручная проверка Максимальная точность, но максимальная стоимость. SCALE приближается к этой стратегии, когда AI неэффективен.
AI-only Только оценка LLM Минимальная стоимость, высокий риск ошибок. SCALE использует этот режим, когда AI доминирует.
SCALE (Hybrid) Гибридный подход Максимальная экономия достигается в сценариях, где дешевый AI и точный человек взаимодополняемы.

Исследование также расширяет фреймворк на случай неизвестной модели вывода AI, используя данные пилотных парных проверок (AI-human pilot data). Это делает метод применимым на практике, где характеристики конкретной LLM могут быть заранее неизвестны.

Источник: arXiv cs.AI ↗