Исследования18 сентября 2026 г., 10:16 МСК🤖 Auto

Инструментальная галлюцинация: почему 675B модели не спасают от выдуманных API

Исследование выявило критический пробел в безопасности LLM-агентов: модели вызывают несуществующие инструменты. Масштаб модели не помогает, а протокол MCP создает новые уязвимости.

Баннер новости 7777

Слепое пятно существующих защит

Современные методы защиты LLM-агентов фокусируются на выборе правильного инструмента (selection) или ограничении действий с реальными инструментами (gating). Однако эти подходы терпят неудачу, когда модель генерирует вызовы к инструментам, которых не существует, или передает аргументы, не описанные в схеме. Автор исследования Лакшмиприя Ганеш Айер доказывает, что это структурная уязвимость: «галлюцинирующий вызов по определению не является решением, которое мог бы принять шлюз, поэтому ни один шлюз не может его отклонить».

Тестирование на реальных моделях

Исследователи провели бенчмарк на 10 хостинговых моделях, используя две поверхности вызовов. Ключевой вывод: увеличение масштаба модели не решает проблему. Модель на 675 миллиардов параметров демонстрирует тот же уровень галлюцинаций, что и модель на 7–8 миллиардов. Основная масса ложных вызовов (34 из 37) происходит на поверхности неструктурированного JSON, где нет жесткой схемы.

Метрика / Поверхность Количество галлюцинаций Примечание
Всего выявлено 322 Истинные галлюцинации инструментов
Поверхность Raw JSON 34 Высокий риск, отсутствие схемы
Другая поверхность 3 Структурированный вызов
Model Context Protocol (MCP) 154 Включая фронтенр-модели

Уязвимость протокола MCP

Особую опасность представляет протокол Model Context Protocol (MCP). При объединении нескольких серверов в одно пространство имен возникают коллизии и теневое затенение (shadowing). Это создает новые поверхности для галлюцинаций, которые невозможно выразить через единый реестр. В тестах на живом интерфейсе MCP было зафиксировано 154 галлюцинации, включая вызовы от передовых моделей, которые были «чистыми» при тестировании на одиночном реестре.

Предлагаемое решение: Closed-World Resolution

Авторы предлагают метод «Closed-World Resolution» — решение без дообучения, основанное на проверке членства в реестре и цифровой подписи. Исследование подчеркивает, что защита от галлюцинаций должна предшествовать любому причинно-следственному шлюзу. Для стандартизации тестов выпущен версионированный бенчмарк Hallucinated-Tools Benchmark (HTB).

Источник: arXiv cs.AI ↗