Исследования7 августа 2026 г., 04:17 МСК🤖 Auto

Canary Tools: как тесты выявили скрытые ошибки в выборе инструментов LLM

Исследование Atul Anand и Sourav Chattaraj представило метод «канареечных инструментов» для диагностики рассуждений LLM-агентов, выявив, что даже передовые модели подвержены специфическим когнитивным ловушкам при выборе функций.

Баннер новости 5264

Проблема: «Почему» важнее «Что»

Традиционные оценки LLM-агентов фиксируют факт ошибки (выбран неверный инструмент), но не объясняют причину. Авторы предлагают новый подход — Canary Tools (канареечные инструменты). Это диагностические зонды, внедренные в набор инструментов агента (MCP), каждый из которых нацелен на выявление конкретного типа слабости в логике выбора. Вместо простого бинарного результата «верно/неверно», метод создает многомерный профиль рассуждений модели.

Методология: 6 типов ловушек и масштаб теста

Исследователи разработали таксономию из шести типов уязвимостей, которые моделируют реальные сценарии сбоев:

  • Semantic decoys (семантические приманки): инструменты с похожими названиями, но разным назначением.
  • Parameter traps (ловушки параметров): ошибки в интерпретации аргументов функции.
  • Capability mirages (каприаж возможностей): вера модели в наличие у инструмента функции, которой у него нет.
  • Prerequisite blindness (слепота к предпосылкам): игнорирование необходимых условий для вызова инструмента.
  • Temporal decoys (временные приманки): ошибки, связанные с временными метками или порядком действий.
  • Granularity traps (ловушки детализации): неверный выбор уровня детализации инструмента.

Для тестирования были выбраны 8 моделей (6 хостинговых и 2 open-weight по 8B параметров) в трех категориях мощности. Эксперимент охватил 120 задач, три условия плотности канареек и три семени, что дало в общей сложности 8 640 запусков. Дополнительно проведена абляция на 2 880 запусках для проверки тонкости ловушек. Оценка проводилась независимым судьей-LLM с коэффициентом согласия Коэна κ = 0,75.

Ключевые результаты: не все равны

Исследование выявило три фундаментальных вывода. Во-первых, восприимчивость к ошибкам резко падает с ростом мощности модели. Разница в показателе восприимчивости к канарейкам (CSR) на одну задачу составляет около 36 раз между худшими и лучшими моделями. Во-вторых, принадлежность к «топовому» классу не гарантирует безопасность: самая уязвимая хостинговая модель оказалась среднего уровня, а внутри одного провайдера более дешевая модель иногда оказывалась надежнее. В-третьих, типы ловушек зависят от класса модели: «каприаж возможностей» чаще всего обманывает передовые модели, тогда как другие типы ловушек эффективны против малых open-weight моделей.

Сравнение уязвимостей моделей

Ниже приведена сводка по уровню восприимчивости (CSR) и типичным ошибкам для ключевых моделей из выборки:

Модель Категория Уровень CSR (примерный) Основная уязвимость
Claude Opus 4.8 Frontier (Hosted) Самый низкий Capability mirages (редко)
Llama 3.1 8B Open-weight (8B) Самый высокий Parameter traps, Prerequisite blindness
Mid-tier Hosted Hosted (Средний) Высокий Смешанные типы ловушек

Почему это важно для разработчиков

Авторы доказали, что зонды измеряют именно способность к рассуждению, а не просто распознавание фраз: смягчение «подсказывающих» фраз в канарейках не изменило CSR для передовых моделей. Кроме того, восприимчивость к канарейкам коррелирует с общим провалом задач (Spearman rho = -0.34). Это означает, что Canary Tools могут служить ранним индикатором надежности агента. Исследователи опубликовали фреймворк, схемы канареек, задачи и логи, позволяя сообществу стандартизировать диагностику LLM-агентов.

Источник: arXiv cs.AI ↗