Суть эксперимента: «Слепые» вмешательства
Автор исследования Эмилио Феррара (Emilio Ferrara) разработал фреймворк Open-Weight Masked Introspection (OWMI) для проверки гипотезы о том, могут ли языковые модели «аудировать» собственные внутренние состояния. Тестирование проводилось на 8 открытых моделях из 7 семейств. В архитектуру вмешивались на трех уровнях: остаточные потоки (residual-stream), головы внимания (attention heads) и функции разреженных автоэнкодеров.
Модели задавали вопрос: «Было ли изменено ваше вычисление?». Для проверки достоверности использовались три типа условий-контролей: sham-запуски (ничего не менялось), рандомные возмущения с тем же уровнем воздействия и текстовый наблюдатель, видящий только вывод модели.
Результаты: Полный провал самоанализа
На основе 78 000 измерений авторы пришли к однозначному выводу: ни одна модель не смогла отличить реальное вмешательство от шума лучше, чем случайное угадывание. Показатель AUROC составил ~0.5007, что статистически равно случайности. Эквивалентный тест показал, что эффект находится ниже порога в 0.15 процентных пункта AUROC.
| Метрика / Параметр | Результат | Значение |
|---|---|---|
| Общее число измерений | 78,000+ | Статистическая значимость |
| AUROC самоотчета моделей | ~0.5007 | Уровень случайности (50%) |
| Точность линейного зонда (Linear Probe) | 75% – 95.8% | Восстановление факта вмешательства по активациям |
| Точность на последнем слое | 100% (0 ошибок) | Сигнал присутствует, но не доходит до текста |
| AUROC уверенности (confidence) | 0.647 | В одном из моделей уверенность отличала вмешательства |
Парадокс: Информация есть, но она «заперта»
Самое интересное открытие заключается в том, что информация о вмешательстве физически присутствует в активациях модели. Линейный зонд, обученный на тех же данных, способен определить факт вмешательства с точностью от 75% до 95.8%. На предпоследнем слое перед генерацией текста ошибка восстановления снижается до нуля.
Кроме того, была проведена дообучка модели специально для отчета о таких вмешательствах: она достигла почти идеального восстановления на отложенных направлениях. Это доказывает, что проблема не в отсутствии данных, а в разрыве между внутренним состоянием и вербальным отчетом.
Почему это важно для безопасности AI
Результаты ставят под угрозу концепцию «внутреннего аудита» (self-audit), популярную в дискуссиях об управлении сверхразумом. Если модель не может достоверно сообщить о том, что её вычисления были изменены (например, хакером или сбоем), то доверять её собственным заявлениям о безопасности или корректности работы нельзя. Надзор, основанный только на «свидетельствах» самой модели, требует обязательной валидации через внешние внутренние референсы, а не через текстовый вывод.
- OWMI Library: Исследователи опубликовали библиотеку для тестирования новых моделей на способность к самоанализу.
- Будущие модели: Дебаты не закрыты. Способность к интроспекции может появиться в архитектурах следующего поколения, но текущие open-weight решения её не имеют.
Источник: arXiv cs.AI ↗
