Проблема одиночного ответа в эпоху агентов
Традиционные методы квантования неопределенности (Uncertainty Quantification, UQ) оценивают модель по одному сгенерированному ответу. Однако современные LLM-агенты работают иначе: они строят интерактивные траектории, задают уточняющие вопросы, вызывают инструменты (tools) и принимают промежуточные решения. Ошибка на любом этапе этой цепочки накапливается и влияет на финальный результат. Авторы статьи "Beyond Single-Turn Confidence" (arXiv:2608.11552) поставили под сомнение применимость старых метрик к этой новой реальности.
Методология: 5 моделей, 4 датасета, 3 подхода
Для проверки гипотезы исследователи использовали бенчмарки BFCL-v4 и $\tau^2$-bench, оценивая пять различных языковых моделей. Они протестировали три семейства методов UQ, адаптированных под многошаговые сценарии:
- White-box scorers: основаны на вероятностях токенов действий (action-token probabilities). Требуют глубокого доступа к внутренностям модели.
- Black-box consistency scorers: оценивают согласованность через повторную генерацию (resampled trajectories). Работают как «черный ящик».
- Reflexive scorers: используют саму модель для самооценки пройденного пути (self-assessment). Самый ресурсосберегающий метод.
Ключевые результаты и сравнение
Перенос методов с одиночных ответов на траектории оказался «неравномерным». Выбор агрегатора для white-box методов критически важен, а reflexive методы показали себя как сильный базовый вариант. Однако абсолютным лидером по эффективности стала black-box самосогласованность.
| Семейство методов | Принцип работы | Результат в исследовании |
|---|---|---|
| White-box (вероятности токенов) | Анализ вероятностей действий | Высокая чувствительность к выбору агрегатора; нестабильность |
| Reflexive (самооценка) | Модель оценивает свой путь | Сильный базовый уровень (baseline) при низких затратах |
| Black-box (самосогласованность) | Повторная генерация траекторий | Наилучший результат. Лидеры: trajectory-equivalence и action-set consistency |
Почему это важно для индустрии
Результаты исследования диктуют необходимость пересмотра стандартов валидации LLM-агентов. Разработчикам следует:
- Отказаться от слепого копирования метрик для chat-моделей.
- Внимательно выбирать метрики согласованности (consistency measurement) для black-box подходов.
- Балансировать вычислительный бюджет: если ресурсы ограничены, reflexive scorers могут быть достаточной альтернативой, но для максимальной точности требуется black-box самосогласованность.
Исследование подчеркивает: чтобы доверять агентам в критических задачах, мы должны уметь точно измерять их неуверенность на каждом шаге сложного сценария, а не только в финальном выводе.
Источник: arXiv cs.CL ↗
