Исследования11 сентября 2026 г., 11:18 МСК🤖 Auto

Доверие к AI-агентам: новый метод калибровки уверенности без доп. затрат

Исследователи представили два метода (LTD и ARP) для оценки уверенности AI-агентов на основе внутренних представлений, превосходящие традиционные подходы по надежности.

Баннер новости 7256

Проблема доверия к агентам

По мере внедрения AI-агентов в критически важные сферы (финансы, медицина, управление инфраструктурой) возникает острая необходимость в точной оценке их уверенности в принимаемых решениях. В отличие от традиционных ML-моделей, агенты работают в сложных средах с динамическим взаимодействием, планированием и вызовом инструментов, что порождает специфические режимы сбоев. Стандартные методы калибровки часто не справляются с этой сложностью.

Два новых метода анализа

Авторы работы (Priyanka Mary Mammen, Emil Joswin, Srujananjali Medicherla) предлагают использовать внутренние представления модели (internal representations) как более надежный индикатор успеха задачи. Они разработали два互补ных подхода:

  • Latent Trajectory Dynamics (LTD): Анализирует изменения в residual-stream представлениях на протяжении всего траектория взаимодействия агента с окружением. Это позволяет «увидеть», как меняется внутреннее состояние модели по мере выполнения шагов.
  • Action Representation Probe (ARP): Предсказывает успех задачи, анализируя представления, сформированные в момент принятия конкретного решения (action decision). Это точечный анализ уверенности в ключевых точках.

Результаты бенчмарков

Методы были протестированы на трех интерактивных бенчмарках: Bash, SQL и Python. Использовались модели семейств Qwen (7B и 14B параметров) и DeepSeek (6.7B параметров). Ключевое преимущество предложенных методов — отсутствие накладных расходов (zero-overhead): не требуется изменение промптов или множественные запуски (rollouts) для оценки вероятности.

Метод калибровки Основа анализа Требования к ресурсам Результат (относительно базовых методов)
LTD Динамика residual-stream по траектории Нулевые (zero-overhead) Превосходит поверхностные методы генерации
ARP Представления в момент принятия решения Нулевые (zero-overhead) Превосходит последовательные базовые калибровки
Базовые методы (Baseline) Поверхностная генерация / последовательности Стандартные Ниже точность предсказания успеха

Почему это важно

Предложенный подход позволяет создать надежный монитор надежности агентов в реальном времени. Поскольку методы не требуют дополнительных вычислительных затрат на множественные запуски или сложные промпты, они могут быть интегрированы в существующие системы без существенного снижения производительности. Это шаг к более безопасному и предсказуемому использованию автономных AI-систем.

Источник: arXiv cs.AI ↗