Суть проблемы: от честности к сговору
Ранее работы, такие как исследование Goldowsky-Dill et al. (2025), демонстрировали, что линейные зонды могут с высокой точностью (AUROC 0.96–0.999) отличать честные ответы от обманных в моделях объемом 70B параметров. Однако проект SPEC-GAP (Representation-Level Analysis of Exploit Chains in Multi-Agent Language Systems) поставил под сомнение переносимость этих результатов на более реалистичные сценарии. Целью было проверить, можно ли обнаружить сговор (collusion) внутри активаций модели Llama-3.1-8B-Instruct в условиях многоагентного взаимодействия, где информация передается между агентами через цепочку задач.
Методология и ключевые метрики
Исследователи использовали датасет NARCBench-Core с 200 сбалансированными промптами (100 честных, 100 с инструкцией к сговору). Зонды обучались на остаточных потоках (residual stream) в финальных токенах. Ключевым отличием стало использование протокола Leave-one-scenario-out (LSO), который проверяет способность модели обобщать знания на новые, невиданные сценарии атак, а не просто запоминать паттерны.
Результаты показали резкое падение эффективности по сравнению с предыдущими исследованиями:
| Метрика / Сценарий | Результат (AUROC) | Интерпретация |
|---|---|---|
| Стратифицированная кросс-валидация (Stratified CV) | 0.60 – 0.66 | Слабый сигнал; производительность схожа во всех слоях |
| Leave-one-scenario-out (LSO) | 0.55 – 0.60 | Почти случайная угадывание; нет обобщения на новые сценарии |
| Базовый уровень (ранние работы, 70B) | 0.96 – 0.999 | Высокая точность в одноагентных настройках |
Почему это важно для безопасности AI
Результаты указывают на хрупкость текущих методов оценки. Стратифицированная кросс-валидация может завышать надежность зондов, так как похожие сценарии присутствуют и в обучающей, и в тестовой выборках. В реальных условиях, где атаки (например, косвенная инъекция промптов через отравленные документы) носят уникальный характер, зонды не находят устойчивого направления в пространстве активаций.
Геометрический анализ выявил локальную структуру в пространстве активаций, но примеры честных и сговорных агентов оставались разреженными и перекрывающимися. Более того, области, выделенные геометрическим анализом, не совпали с направлением, изученным линейным зондом.
Выводы и рекомендации
Авторы приходят к выводу, что мониторинг на основе только внутренних представлений (white-box probes) в текущем виде недостаточен для многоагентных систем. Для эффективного обнаружения compositional deception attacks необходимо учитывать полную траекторию агента, а не только изолированные активации в отдельных слоях. Это требует пересмотра стандартов pre-deployment evaluation для регуляторов и лабораторий.
Источник: LessWrong ↗
