Проблема: три типа провалов агентов
Агентные LLM часто ошибаются при взаимодействии с внешними инструментами. Авторы выделяют три критических типа сбоев:
- Invalid arguments (validity): невалидные аргументы в вызове.
- Over-calling: избыточные вызовы, когда инструмент не нужен.
- Missing: пропущенные вызовы, когда инструмент необходим.
Ранее для контроля этих процессов использовались плотные модели, требующие огромных вычислительных ресурсов. Исследователи из Университета Цинхуа и других институтов обнаружили, что для детекции этих ошибок достаточно всего нескольких нейронов в MLP-слое.
Решение: PRISMS и сверхредкие детекторы
Предложенная система PRISMS (Probing Representations In Support of Monitoring and Steering) использует линейно разделимые границы решений на активациях специфических нейронов. Ключевая особенность — экстремальная разреженность (sparsity) детекторов:
- Для обнаружения пропущенных вызовов (missing) достаточно 1-2 нейронов.
- Для избыточных вызовов (over-calling) требуется 2-16 нейронов.
- Для проверки валидности аргументов (validity) используется около 128 нейронов.
Результаты: точность и эффективность
Тестирование проводилось на шести моделях семейств Qwen3, Llama и Gemma. Система демонстрирует высокую точность на границе генерации (pre-generation) или в процессе вызова:
| Метрика | Over-calling / Missing | Validity |
|---|---|---|
| ROC-AUC | 0.90 - 1.00 | 0.86 - 0.90 |
| Точка детекции | До генерации (prompt boundary) | В процессе вызова (span) |
| Сравнение с плотными базами | Использует в 23-627 раз меньше признаков | |
Практическая польза: селективное управление
PRISMS не просто обнаруживает ошибки, но и позволяет корректировать поведение модели через activation steering. Система вмешивается только при высоком риске ошибки, что минимизирует побочные эффекты.
В итоговых тестах PRISMS:
- Сократила долю избыточных вызовов на 80% (с 0.131 до 0.026).
- Повысила точность использования необходимых инструментов на 14.2 процентных пункта (с 0.689 до 0.831).
Это делает PRISMS легковесным и эффективным решением для повышения надежности LLM-агентов без необходимости переобучения самих моделей.
Источник: arXiv cs.CL ↗
