Суть проблемы: «Смещение» маскирует смысл
Интерпретируемость нейросетей (Interpretability) сталкивается с проблемой так называемого «non-context offset» — смещения, которое не связано с контекстом, но искажает показания линз (lenses). Автор исследования, Амея Панчал, выявил, что это смещение в J-lens (метод, использующий якобиан для анализа активаций) и R-lens практически полностью определяется собственной частотой использования токенов моделью. Простое вычитание этого смещения разрушало полезную информацию, снижая точность чтения мыслей модели в 3.5–12.3 раза.
Решение: Z-нормировка (Z-scoring)
Вместо прямого вычитания среднего значения, автор применил Z-нормировку (вычитание среднего с делением на стандартное отклонение). Этот метод позволил отделить шум частоты от семантического содержания. Результат превзошел ожидания: Z-калиброванный J-lens стал единственным методом, способным надежно извлекать скрытые «табуированные» слова из моделей Qwen3-1.7B и Gemma-2-9B-it.
Ключевые метрики и сравнения
Эксперименты проводились на датасетах «табуированных организмов» (taboo organisms) — дообученных моделях, скрывающих секретные слова. Ниже приведены результаты точности (accuracy) при использовании метода leave-one-out:
| Модель / Метод | Точность (Accuracy) | Примечание |
|---|---|---|
| Gemma-2-9B-it (J-lens + Z-score) | 0.805 | Превосходит базовый протокол Cywiński (0.665) |
| Gemma-2-9B-it (Протокол Cywiński) | 0.665 | Исходный метод сравнения |
| Qwen3-1.7B (J-lens + Z-score) | >0 (успешно) | Единственный метод, давший ненулевой результат |
| Qwen3-1.7B (Прочие методы) | 0 | Не смогли извлечь скрытые слова |
Почему это важно для индустрии
Исследование подтверждает гипотезу, что базовые линзы (Logit Lens, J-lens, R-lens) сильно зависят от статистики токенов. Корреляция смещения с логарифмом частоты токена достигала Spearman ρ = 0.48 в средних слоях Qwen3.5-4B. Без Z-нормировки анализ активаций дает ложноположительные срабатывания на «мусорных» токенах (не-латиница, фрагменты байтов), доля которых в топ-100 смещения достигала 33% для Logit Lens. Применение Z-нормировки позволяет чище считывать латентные знания и обнаруживать бэкдоры или скрытые инструкции в больших языковых моделях.
Источник: LessWrong ↗