Исследования7 сентября 2026 г., 10:17 МСК🤖 Auto

J-Lens провалил тест на GPT-2: Logit Lens всё ещё король

Независимая репликация метода J-Lens от Anthropic на моделях GPT-2 Small и Medium показала его полную несостоятельность. J-Lens проигрывает классическому Logit Lens в каждом слое, а его преимущества объясняются артефактами частотности токенов.

Баннер новости 6915

Суть эксперимента и ключевые цифры

Исследователь Нелит Бандуларатне провел строгую проверку гипотезы Anthropic о том, что J-Lens (Jacobians Lens) исправляет геометрическое несоответствие представлений в ранних слоях трансформеров. Результаты оказались однозначными:

  • GPT-2 Small (124M параметров): J-Lens проигрывает Logit Lens во всех 11 слоях (0/11 побед). Медианный ранг правильного токена у J-Lens находится в диапазоне тысяч, тогда как Logit Lens удерживает ранг 1–43.
  • GPT-2 Medium (355M параметров): J-Lens выиграл лишь в 1 из 23 слоев. При этом «победа» является статистической погрешностью: J-Lens занял 221-е место, а Logit Lens — 220-е.

Почему J-Lens «выигрывал» в тестах на разреженность?

Один из самых интригующих результатов — искусственное улучшение метрик J-Lens при применении жесткого порога разреженности (sparsity thresholding). При отсечке 99% весов J-Lens якобы выигрывал в 7 из 11 слоев. Однако анализ показал, что это ложная победа:

  • Топ-1 токены были исключительно «мусорными» (запятые, пробелы).
  • Всего 9 уникальных токенов появились в ответах на 60 тестовых промптах.
  • Выжившие веса коррелировали с известными «выбросами активации» (outlier dimensions) GPT-2, а не с семантической структурой.

Влияние частотности токенов

Критики ранее утверждали, что J-Lens просто предсказывает самые частые токены. Эксперимент подтвердил это с коэффициентом корреляции r=0.656 между общим смещением (bias term) и логарифмической частотой токенов. Даже после вычитания этого смещения J-Lens продолжал показывать худшие результаты, чем Logit Lens.

Сводная таблица результатов (GPT-2 Small)

Метрика / Параметр Logit Lens J-Lens Вывод
Метрика A (Точность топ-1 токена) Ранг 1–43 Ранг в тысячи (в ранних слоях) Logit Lens значительно точнее
Метрика B (Прогноз будущих токенов) Лучший результат Хуже на -8...-9 nats J-Lens не справляется с задачей, для которой создавался
Корреляция с частотой токенов Низкая (относительно) r=0.656 J-Lens сильно зависит от статистики токенов
Устойчивость к масштабированию Стабильно Разрыв увеличивается На GPT-2 Medium J-Lens стал еще хуже

Методологические уроки для исследователей

Автор выделяет два критических вывода для сообщества интерпретируемости (interpretability):

  1. Ранговые метрики легко накрутить. Модель может показывать высокие результаты, просто предсказывая общие токены (запятые, пробелы), если не контролировать влияние частотности.
  2. Пороговая обработка (thresholding) не всегда раскрывает структуру. Жесткая обрезка весов может оставить только «шум» и выбросы активации, создавая иллюзию работы метода.

Код репликации доступен на GitHub: github.com/nelithb/mech-interp-lab.

Источник: LessWrong ↗