Исследования18 сентября 2026 г., 01:17 МСК🤖 Auto

J-lens vs Logit: Z-нормировка раскрыла скрытые слова в LLM

Исследование Ameya Panchal показало, что смещение в J-lens связано с частотой токенов. Z-нормировка повысила точность обнаружения скрытых концепций в Gemma-2 и Qwen3.

Суть проблемы: «Смещение» маскирует смысл

Интерпретируемость нейросетей (Interpretability) сталкивается с проблемой так называемого «non-context offset» — смещения, которое не связано с контекстом, но искажает показания линз (lenses). Автор исследования, Амея Панчал, выявил, что это смещение в J-lens (метод, использующий якобиан для анализа активаций) и R-lens практически полностью определяется собственной частотой использования токенов моделью. Простое вычитание этого смещения разрушало полезную информацию, снижая точность чтения мыслей модели в 3.5–12.3 раза.

Решение: Z-нормировка (Z-scoring)

Вместо прямого вычитания среднего значения, автор применил Z-нормировку (вычитание среднего с делением на стандартное отклонение). Этот метод позволил отделить шум частоты от семантического содержания. Результат превзошел ожидания: Z-калиброванный J-lens стал единственным методом, способным надежно извлекать скрытые «табуированные» слова из моделей Qwen3-1.7B и Gemma-2-9B-it.

Ключевые метрики и сравнения

Эксперименты проводились на датасетах «табуированных организмов» (taboo organisms) — дообученных моделях, скрывающих секретные слова. Ниже приведены результаты точности (accuracy) при использовании метода leave-one-out:

Модель / Метод Точность (Accuracy) Примечание
Gemma-2-9B-it (J-lens + Z-score) 0.805 Превосходит базовый протокол Cywiński (0.665)
Gemma-2-9B-it (Протокол Cywiński) 0.665 Исходный метод сравнения
Qwen3-1.7B (J-lens + Z-score) >0 (успешно) Единственный метод, давший ненулевой результат
Qwen3-1.7B (Прочие методы) 0 Не смогли извлечь скрытые слова

Почему это важно для индустрии

Исследование подтверждает гипотезу, что базовые линзы (Logit Lens, J-lens, R-lens) сильно зависят от статистики токенов. Корреляция смещения с логарифмом частоты токена достигала Spearman ρ = 0.48 в средних слоях Qwen3.5-4B. Без Z-нормировки анализ активаций дает ложноположительные срабатывания на «мусорных» токенах (не-латиница, фрагменты байтов), доля которых в топ-100 смещения достигала 33% для Logit Lens. Применение Z-нормировки позволяет чище считывать латентные знания и обнаруживать бэкдоры или скрытые инструкции в больших языковых моделях.

Источник: LessWrong ↗