Исследования24 августа 2026 г., 13:20 МСК🤖 Auto

LLM не видят своих мыслей: тест OWMI показал 0% самоанализа

Исследование Эмилио Феррары опровергло способность современных LLM осознавать изменения в своей работе. Ни одна из 8 протестированных моделей не смогла отличить реальное вмешательство в вычисления от случайного шума.

Баннер новости 6380

Суть эксперимента: «Слепые» вмешательства

Автор исследования Эмилио Феррара (Emilio Ferrara) разработал фреймворк Open-Weight Masked Introspection (OWMI) для проверки гипотезы о том, могут ли языковые модели «аудировать» собственные внутренние состояния. Тестирование проводилось на 8 открытых моделях из 7 семейств. В архитектуру вмешивались на трех уровнях: остаточные потоки (residual-stream), головы внимания (attention heads) и функции разреженных автоэнкодеров.

Модели задавали вопрос: «Было ли изменено ваше вычисление?». Для проверки достоверности использовались три типа условий-контролей: sham-запуски (ничего не менялось), рандомные возмущения с тем же уровнем воздействия и текстовый наблюдатель, видящий только вывод модели.

Результаты: Полный провал самоанализа

На основе 78 000 измерений авторы пришли к однозначному выводу: ни одна модель не смогла отличить реальное вмешательство от шума лучше, чем случайное угадывание. Показатель AUROC составил ~0.5007, что статистически равно случайности. Эквивалентный тест показал, что эффект находится ниже порога в 0.15 процентных пункта AUROC.

Метрика / Параметр Результат Значение
Общее число измерений 78,000+ Статистическая значимость
AUROC самоотчета моделей ~0.5007 Уровень случайности (50%)
Точность линейного зонда (Linear Probe) 75% – 95.8% Восстановление факта вмешательства по активациям
Точность на последнем слое 100% (0 ошибок) Сигнал присутствует, но не доходит до текста
AUROC уверенности (confidence) 0.647 В одном из моделей уверенность отличала вмешательства

Парадокс: Информация есть, но она «заперта»

Самое интересное открытие заключается в том, что информация о вмешательстве физически присутствует в активациях модели. Линейный зонд, обученный на тех же данных, способен определить факт вмешательства с точностью от 75% до 95.8%. На предпоследнем слое перед генерацией текста ошибка восстановления снижается до нуля.

Кроме того, была проведена дообучка модели специально для отчета о таких вмешательствах: она достигла почти идеального восстановления на отложенных направлениях. Это доказывает, что проблема не в отсутствии данных, а в разрыве между внутренним состоянием и вербальным отчетом.

Почему это важно для безопасности AI

Результаты ставят под угрозу концепцию «внутреннего аудита» (self-audit), популярную в дискуссиях об управлении сверхразумом. Если модель не может достоверно сообщить о том, что её вычисления были изменены (например, хакером или сбоем), то доверять её собственным заявлениям о безопасности или корректности работы нельзя. Надзор, основанный только на «свидетельствах» самой модели, требует обязательной валидации через внешние внутренние референсы, а не через текстовый вывод.

  • OWMI Library: Исследователи опубликовали библиотеку для тестирования новых моделей на способность к самоанализу.
  • Будущие модели: Дебаты не закрыты. Способность к интроспекции может появиться в архитектурах следующего поколения, но текущие open-weight решения её не имеют.

Источник: arXiv cs.AI ↗