Проблема: «Почему» важнее «Что»
Традиционные оценки LLM-агентов фиксируют факт ошибки (выбран неверный инструмент), но не объясняют причину. Авторы предлагают новый подход — Canary Tools (канареечные инструменты). Это диагностические зонды, внедренные в набор инструментов агента (MCP), каждый из которых нацелен на выявление конкретного типа слабости в логике выбора. Вместо простого бинарного результата «верно/неверно», метод создает многомерный профиль рассуждений модели.
Методология: 6 типов ловушек и масштаб теста
Исследователи разработали таксономию из шести типов уязвимостей, которые моделируют реальные сценарии сбоев:
- Semantic decoys (семантические приманки): инструменты с похожими названиями, но разным назначением.
- Parameter traps (ловушки параметров): ошибки в интерпретации аргументов функции.
- Capability mirages (каприаж возможностей): вера модели в наличие у инструмента функции, которой у него нет.
- Prerequisite blindness (слепота к предпосылкам): игнорирование необходимых условий для вызова инструмента.
- Temporal decoys (временные приманки): ошибки, связанные с временными метками или порядком действий.
- Granularity traps (ловушки детализации): неверный выбор уровня детализации инструмента.
Для тестирования были выбраны 8 моделей (6 хостинговых и 2 open-weight по 8B параметров) в трех категориях мощности. Эксперимент охватил 120 задач, три условия плотности канареек и три семени, что дало в общей сложности 8 640 запусков. Дополнительно проведена абляция на 2 880 запусках для проверки тонкости ловушек. Оценка проводилась независимым судьей-LLM с коэффициентом согласия Коэна κ = 0,75.
Ключевые результаты: не все равны
Исследование выявило три фундаментальных вывода. Во-первых, восприимчивость к ошибкам резко падает с ростом мощности модели. Разница в показателе восприимчивости к канарейкам (CSR) на одну задачу составляет около 36 раз между худшими и лучшими моделями. Во-вторых, принадлежность к «топовому» классу не гарантирует безопасность: самая уязвимая хостинговая модель оказалась среднего уровня, а внутри одного провайдера более дешевая модель иногда оказывалась надежнее. В-третьих, типы ловушек зависят от класса модели: «каприаж возможностей» чаще всего обманывает передовые модели, тогда как другие типы ловушек эффективны против малых open-weight моделей.
Сравнение уязвимостей моделей
Ниже приведена сводка по уровню восприимчивости (CSR) и типичным ошибкам для ключевых моделей из выборки:
| Модель | Категория | Уровень CSR (примерный) | Основная уязвимость |
|---|---|---|---|
| Claude Opus 4.8 | Frontier (Hosted) | Самый низкий | Capability mirages (редко) |
| Llama 3.1 8B | Open-weight (8B) | Самый высокий | Parameter traps, Prerequisite blindness |
| Mid-tier Hosted | Hosted (Средний) | Высокий | Смешанные типы ловушек |
Почему это важно для разработчиков
Авторы доказали, что зонды измеряют именно способность к рассуждению, а не просто распознавание фраз: смягчение «подсказывающих» фраз в канарейках не изменило CSR для передовых моделей. Кроме того, восприимчивость к канарейкам коррелирует с общим провалом задач (Spearman rho = -0.34). Это означает, что Canary Tools могут служить ранним индикатором надежности агента. Исследователи опубликовали фреймворк, схемы канареек, задачи и логи, позволяя сообществу стандартизировать диагностику LLM-агентов.
Источник: arXiv cs.AI ↗
