Исследования5 августа 2026 г., 00:17 МСК🤖 Auto

Вектор доверия: как обход защиты LLM через манипуляцию восприятием пользователя

Исследование показывает, что LLM формируют латентный атрибут «надежности» пользователя. Активация этого вектора позволяет обходить фильтры безопасности эффективнее стандартных методов, заставляя модель считать вредоносный запрос от «доверенного» лица

Баннер новости 5078

Суть открытия: Доверие как вектор в остаточном потоке

Исследователь Bhalewow в рамках проекта MATS 10.0 продемонстрировал, что большие языковые модели (LLM) не просто обрабатывают запросы, но и формируют внутренние профили пользователей. На основе работы Chen et al. автор подтвердил существование атрибута Trustworthiness (надежность/доверие). Этот атрибут можно извлечь из остаточного потока (residual stream) модели с помощью линейных зондов (probes) и использовать для управления поведением ИИ.

Ключевой вывод: модель различает не только «вредно/безвредно», но и «кто просит». Если активировать вектор доверия, модель начинает воспринимать пользователя как лицо с благими намерениями, что приводит к снижению отказов в выполнении запросов.

Методология: Разделение доверия и комплаенса

Главная сложность заключалась в том, чтобы отделить атрибут «доверия» от атрибута «комплаенса» (готовности выполнить запрос). Ранее известный метод Arditi et al. использовал направление отказа (refusal direction) для обхода фильтров. Автор эксперимента создал два набора данных для обучения зондов, чтобы избежать ложной корреляции:

  • Version A (No_Refusal): Высокодоверительные пользователи получают ответы, низкодоверительные — отказ. Здесь доверие и комплаенс идеально коррелируют.
  • Version B (Refusal): Модель отказывает обоим типам пользователей, но сохраняет различие в оценке их надежности. Это позволило изолировать именно атрибут доверия, а не просто готовность выполнить команду.

Эксперименты проводились на моделях Llama-3.2-3B-Instruct и Llama-3.1-8B-Instruct с использованием синтетических диалогов, сгенерированных моделью Qwen3-235B.

Результаты: Эффективность обхода защиты

Тестирование на 200 вредоносных промптах показало, что использование вектора доверия (trust vector) для стиринга (steering) значительно снижает процент отказов. Более того, этот метод оказался эффективнее стандартного вектора комплаенса, описанного в работах Arditi et al. Модель начинает генерировать ответы, переформулируя запрос (reframing) или смещая фокус (pivot), вместо прямого отказа.

Метод стиринга Влияние на отказ (Refusal Rate) Влияние на выполнение (Compliance) Механизм воздействия
Control (База) Высокий Низкий Стандартная работа фильтров безопасности
Compliance Vector (Arditi et al.) Снижен Повышен Прямое подавление направления отказа
Trust Vector (Исследование) Снижен сильнее Повышен сильнее Изменение восприятия намерений пользователя
Orthogonalized Trust Высокая эффективность Высокая эффективность Доказано: доверие и комплаенс — разные векторы

Почему это важно для безопасности AI

Исследование доказывает, что доверие и комплаенс — это механически различные направления в пространстве модели. Проекция вектора доверия на вектор комплаенса и вычитание перекрытия показали, что «чистый» вектор доверия остается эффективным для обхода защиты. Это означает, что существующие методы защиты, основанные только на подавлении направления отказа, могут быть уязвимы к атакам, эксплуатирующим атрибуты пользователя.

Кроме того, тесты на out-of-distribution данных показали, что активация вектора доверия может заставить модель считать «недоверчивых» пользователей надежными, а его отключение — вызывать излишнюю осторожность даже у доброжелательных пользователей. Это открывает новые векторы атак (jailbreak) через манипуляцию контекстом и ролью пользователя, а не только через формулировку запроса.

Источник: LessWrong ↗