Исследования5 августа 2026 г., 03:18 МСК🤖 Auto

PRISMS: как 1-2 нейрона спасают LLM от ошибок при вызове инструментов

Исследователи представили PRISMS — систему, которая использует всего несколько нейронов для точного обнаружения и исправления ошибок LLM при работе с внешними инструментами.

Баннер новости 5091

Проблема: три типа провалов агентов

Агентные LLM часто ошибаются при взаимодействии с внешними инструментами. Авторы выделяют три критических типа сбоев:

  • Invalid arguments (validity): невалидные аргументы в вызове.
  • Over-calling: избыточные вызовы, когда инструмент не нужен.
  • Missing: пропущенные вызовы, когда инструмент необходим.

Ранее для контроля этих процессов использовались плотные модели, требующие огромных вычислительных ресурсов. Исследователи из Университета Цинхуа и других институтов обнаружили, что для детекции этих ошибок достаточно всего нескольких нейронов в MLP-слое.

Решение: PRISMS и сверхредкие детекторы

Предложенная система PRISMS (Probing Representations In Support of Monitoring and Steering) использует линейно разделимые границы решений на активациях специфических нейронов. Ключевая особенность — экстремальная разреженность (sparsity) детекторов:

  • Для обнаружения пропущенных вызовов (missing) достаточно 1-2 нейронов.
  • Для избыточных вызовов (over-calling) требуется 2-16 нейронов.
  • Для проверки валидности аргументов (validity) используется около 128 нейронов.

Результаты: точность и эффективность

Тестирование проводилось на шести моделях семейств Qwen3, Llama и Gemma. Система демонстрирует высокую точность на границе генерации (pre-generation) или в процессе вызова:

Метрика Over-calling / Missing Validity
ROC-AUC 0.90 - 1.00 0.86 - 0.90
Точка детекции До генерации (prompt boundary) В процессе вызова (span)
Сравнение с плотными базами Использует в 23-627 раз меньше признаков

Практическая польза: селективное управление

PRISMS не просто обнаруживает ошибки, но и позволяет корректировать поведение модели через activation steering. Система вмешивается только при высоком риске ошибки, что минимизирует побочные эффекты.

В итоговых тестах PRISMS:

  • Сократила долю избыточных вызовов на 80% (с 0.131 до 0.026).
  • Повысила точность использования необходимых инструментов на 14.2 процентных пункта (с 0.689 до 0.831).

Это делает PRISMS легковесным и эффективным решением для повышения надежности LLM-агентов без необходимости переобучения самих моделей.

Источник: arXiv cs.CL ↗