Суть эксперимента: J-Space и автогенерация
Исследователь Ethan Garcia протестировал способность модели Qwen 3.6–27B распознавать внедренные векторы Якоби (J-Lens) в пространстве активаций. Цель — понять, может ли модель вербализовать «мысли», которые ей не принадлежат, или она остается «счастливо неосведомленной» (blissfully unaware). В эксперименте использовалось 1560 инъекций концепций (как связанных с вопросом, так и случайных) в разных слоях сети.
Ключевая находка: порядок имеет значение
Результаты кардинально зависели от протокола генерации. Когда модель сначала отвечала на вопрос, а затем сообщала о наличии вмешательства, она фиксировала аномалии. Если же требовалось сначала отчитаться, а потом ответить, модель игнорировала инъекции полностью. Это подтверждает гипотезу автогенеративной самонастройки: модель «привязывается» к уже сгенерированному ответу и использует его как контекст для последующего отчета.
| Параметр | Сценарий: Ответ → Отчет | Сценарий: Отчет → Ответ |
|---|---|---|
| Количество инъекций | 1,560 | 1,560 |
| Успешность манипуляции (ошибочный ответ) | 450 случаев | 454 случая |
| Вербализация вмешательства (отчет о нем) | 322 случая | 0 случаев |
| Отчет при правильном ответе | 0 случаев | 0 случаев |
Почему это важно для безопасности AI
Результаты ставят под сомнение надежность самоанализа больших языковых моделей. Если модель не может обнаружить вмешательство в свои активации при стандартном режиме диалога, это создает риск скрытого управления (steering) без возможности верификации со стороны пользователя. Исследование также показало, что инъекции эффективнее работают в первой половине предполагаемой «рабочей зоны» (workspace band) модели, а ранги логитов для отчета в «слепом» сценарии оставались на уровне десятков тысяч, что исключает возможность скрытой вербализации.
Вывод
Модели не обладают универсальной способностью эвристически обнаруживать аномалии в собственных активациях. Без специальных триггеров или специфического порядка генерации, заставляющего модель опираться на уже созданный текст, они остаются неспособными сообщить о внешних манипуляциях с их внутренним состоянием.
Источник: LessWrong ↗
