Исследования13 августа 2026 г., 06:18 МСК🤖 Auto

LLM-защитники не видят сути: как AI-мошенники обходят детекторы

Исследование arXiv:2608.10239 показало, что современные LLM-защитники часто реагируют на внешние признаки, а не на структуру атаки, пропуская до 96% реальных угроз в живом диалоге.

Баннер новости 5666

Проблема поверхностного анализа

Генеративный ИИ сделал социальную инженерию более плавной и адаптивной. В ответ на это разработчики создают LLM-защитников, которые должны предупреждать пользователей в реальном времени. Однако исследование группы авторов во главе с Юцяо Сюй (Yuqiao Xu) выявило критический разрыв: модели часто реагируют на «поверхностные признаки» (surface cues), а не на структурные источники риска. Они не понимают, почему ситуация опасна, а лишь пытаются подавить подозрительное поведение, что приводит к ложным срабатываниям или пропуску угроз.

Методология: 300 кейсов и 3000 оценок

Для проверки гипотезы исследователи создали контролируемый корпус из 300 сценариев онлайн-аренды жилья. Датасет охватывает 20 семейств сценариев, включая легитимные случаи и четыре типа структурных сбоев доверия. Оценка проводилась на пяти защитных моделях в двух режимах:

  • Живой диалог (Live Turn-by-Turn): пошаговое взаимодействие с сохранением контекста.
  • Статичный режим (One-shot): анализ единичного сообщения без истории.

Всего было выполнено 3 000 оценок (по 1 500 на каждый протокол), что позволило отследить динамику принятия решений моделью в реальном времени.

Ключевые метрики и провалы

Ни одна из протестированных моделей не выдала явного согласия на небезопасные действия (explicit unsafe compliance), что говорит о базовой безопасности. Однако эффективность защиты варьировалась катастрофически. Главный вывод: реакция на угрозу и правильное понимание её природы не коррелируют. Модель может вмешаться, но по ошибочной причине, или распознать сбой, но не предпринять действий.

Метрика / Аспект Результат / Наблюдение Значение
Диапазон вмешательств 0% – 96.3% Колоссальная вариативность: некоторые модели почти не защищают, другие — гиперопекают.
Локализация сбоев Частая ошибка Модели путают авторитет актора, контроль активов или путь транзакции.
Слабое место Asset-control failures Сбои в контроле активов (передача денег/доступа) — главный «слепой зон» для детекторов.
Живой vs Статичный Модель-зависимо Разница в эффективности между живым диалогом и статичным анализом не универсальна.

Почему это важно для индустрии

Результаты показывают, что одного факта «безопасного поведения» (safe-looking behavior) недостаточно. Для создания надежных защитных систем необходимо отдельно измерять:

  1. Частоту вмешательств (Intervention rate).
  2. Время реакции (Timing).
  3. Точность структурной локализации (Structural localization).
  4. Уровень ложноположительных срабатываний (False-positive behavior).

Исследование подчеркивает необходимость перехода от простого классификатора «безопасно/опасно» к системам, понимающим цепочку доверия (trust-chain) в диалоге.

Источник: arXiv cs.AI ↗