Исследования12 августа 2026 г., 06:17 МСК🤖 Auto

LLM не осознают манипуляции: как порядок ответов скрывает «мысли» модели

Исследование показало, что Qwen 3.6–27B может «видеть» внедренные концепции, но только если сначала выдает ответ, а потом отчитывается. При обратном порядке модель слепа к вмешательствам.

Баннер новости 5578

Суть эксперимента: J-Space и автогенерация

Исследователь Ethan Garcia протестировал способность модели Qwen 3.6–27B распознавать внедренные векторы Якоби (J-Lens) в пространстве активаций. Цель — понять, может ли модель вербализовать «мысли», которые ей не принадлежат, или она остается «счастливо неосведомленной» (blissfully unaware). В эксперименте использовалось 1560 инъекций концепций (как связанных с вопросом, так и случайных) в разных слоях сети.

Ключевая находка: порядок имеет значение

Результаты кардинально зависели от протокола генерации. Когда модель сначала отвечала на вопрос, а затем сообщала о наличии вмешательства, она фиксировала аномалии. Если же требовалось сначала отчитаться, а потом ответить, модель игнорировала инъекции полностью. Это подтверждает гипотезу автогенеративной самонастройки: модель «привязывается» к уже сгенерированному ответу и использует его как контекст для последующего отчета.

Параметр Сценарий: Ответ → Отчет Сценарий: Отчет → Ответ
Количество инъекций 1,560 1,560
Успешность манипуляции (ошибочный ответ) 450 случаев 454 случая
Вербализация вмешательства (отчет о нем) 322 случая 0 случаев
Отчет при правильном ответе 0 случаев 0 случаев

Почему это важно для безопасности AI

Результаты ставят под сомнение надежность самоанализа больших языковых моделей. Если модель не может обнаружить вмешательство в свои активации при стандартном режиме диалога, это создает риск скрытого управления (steering) без возможности верификации со стороны пользователя. Исследование также показало, что инъекции эффективнее работают в первой половине предполагаемой «рабочей зоны» (workspace band) модели, а ранги логитов для отчета в «слепом» сценарии оставались на уровне десятков тысяч, что исключает возможность скрытой вербализации.

Вывод

Модели не обладают универсальной способностью эвристически обнаруживать аномалии в собственных активациях. Без специальных триггеров или специфического порядка генерации, заставляющего модель опираться на уже созданный текст, они остаются неспособными сообщить о внешних манипуляциях с их внутренним состоянием.

Источник: LessWrong ↗