Исследования14 августа 2026 г., 06:18 МСК🤖 Auto

Неуверенность агентов: почему старые метрики лгут при многошаговых сценариях

Исследование авторов Dylan Bouchard и Mohit Singh Chauhan показало, что методы оценки уверенности LLM, созданные для одиночных ответов, неэффективны для многошаговых агентов. Разработаны новые подходы к квантованию неопределенности.

Баннер новости 5766

Проблема одиночного ответа в эпоху агентов

Традиционные методы квантования неопределенности (Uncertainty Quantification, UQ) оценивают модель по одному сгенерированному ответу. Однако современные LLM-агенты работают иначе: они строят интерактивные траектории, задают уточняющие вопросы, вызывают инструменты (tools) и принимают промежуточные решения. Ошибка на любом этапе этой цепочки накапливается и влияет на финальный результат. Авторы статьи "Beyond Single-Turn Confidence" (arXiv:2608.11552) поставили под сомнение применимость старых метрик к этой новой реальности.

Методология: 5 моделей, 4 датасета, 3 подхода

Для проверки гипотезы исследователи использовали бенчмарки BFCL-v4 и $\tau^2$-bench, оценивая пять различных языковых моделей. Они протестировали три семейства методов UQ, адаптированных под многошаговые сценарии:

  • White-box scorers: основаны на вероятностях токенов действий (action-token probabilities). Требуют глубокого доступа к внутренностям модели.
  • Black-box consistency scorers: оценивают согласованность через повторную генерацию (resampled trajectories). Работают как «черный ящик».
  • Reflexive scorers: используют саму модель для самооценки пройденного пути (self-assessment). Самый ресурсосберегающий метод.

Ключевые результаты и сравнение

Перенос методов с одиночных ответов на траектории оказался «неравномерным». Выбор агрегатора для white-box методов критически важен, а reflexive методы показали себя как сильный базовый вариант. Однако абсолютным лидером по эффективности стала black-box самосогласованность.

Семейство методов Принцип работы Результат в исследовании
White-box (вероятности токенов) Анализ вероятностей действий Высокая чувствительность к выбору агрегатора; нестабильность
Reflexive (самооценка) Модель оценивает свой путь Сильный базовый уровень (baseline) при низких затратах
Black-box (самосогласованность) Повторная генерация траекторий Наилучший результат. Лидеры: trajectory-equivalence и action-set consistency

Почему это важно для индустрии

Результаты исследования диктуют необходимость пересмотра стандартов валидации LLM-агентов. Разработчикам следует:

  1. Отказаться от слепого копирования метрик для chat-моделей.
  2. Внимательно выбирать метрики согласованности (consistency measurement) для black-box подходов.
  3. Балансировать вычислительный бюджет: если ресурсы ограничены, reflexive scorers могут быть достаточной альтернативой, но для максимальной точности требуется black-box самосогласованность.

Исследование подчеркивает: чтобы доверять агентам в критических задачах, мы должны уметь точно измерять их неуверенность на каждом шаге сложного сценария, а не только в финальном выводе.

Источник: arXiv cs.CL ↗