Суть эксперимента и ключевые цифры
Исследователь Нелит Бандуларатне провел строгую проверку гипотезы Anthropic о том, что J-Lens (Jacobians Lens) исправляет геометрическое несоответствие представлений в ранних слоях трансформеров. Результаты оказались однозначными:
- GPT-2 Small (124M параметров): J-Lens проигрывает Logit Lens во всех 11 слоях (0/11 побед). Медианный ранг правильного токена у J-Lens находится в диапазоне тысяч, тогда как Logit Lens удерживает ранг 1–43.
- GPT-2 Medium (355M параметров): J-Lens выиграл лишь в 1 из 23 слоев. При этом «победа» является статистической погрешностью: J-Lens занял 221-е место, а Logit Lens — 220-е.
Почему J-Lens «выигрывал» в тестах на разреженность?
Один из самых интригующих результатов — искусственное улучшение метрик J-Lens при применении жесткого порога разреженности (sparsity thresholding). При отсечке 99% весов J-Lens якобы выигрывал в 7 из 11 слоев. Однако анализ показал, что это ложная победа:
- Топ-1 токены были исключительно «мусорными» (запятые, пробелы).
- Всего 9 уникальных токенов появились в ответах на 60 тестовых промптах.
- Выжившие веса коррелировали с известными «выбросами активации» (outlier dimensions) GPT-2, а не с семантической структурой.
Влияние частотности токенов
Критики ранее утверждали, что J-Lens просто предсказывает самые частые токены. Эксперимент подтвердил это с коэффициентом корреляции r=0.656 между общим смещением (bias term) и логарифмической частотой токенов. Даже после вычитания этого смещения J-Lens продолжал показывать худшие результаты, чем Logit Lens.
Сводная таблица результатов (GPT-2 Small)
| Метрика / Параметр | Logit Lens | J-Lens | Вывод |
|---|---|---|---|
| Метрика A (Точность топ-1 токена) | Ранг 1–43 | Ранг в тысячи (в ранних слоях) | Logit Lens значительно точнее |
| Метрика B (Прогноз будущих токенов) | Лучший результат | Хуже на -8...-9 nats | J-Lens не справляется с задачей, для которой создавался |
| Корреляция с частотой токенов | Низкая (относительно) | r=0.656 | J-Lens сильно зависит от статистики токенов |
| Устойчивость к масштабированию | Стабильно | Разрыв увеличивается | На GPT-2 Medium J-Lens стал еще хуже |
Методологические уроки для исследователей
Автор выделяет два критических вывода для сообщества интерпретируемости (interpretability):
- Ранговые метрики легко накрутить. Модель может показывать высокие результаты, просто предсказывая общие токены (запятые, пробелы), если не контролировать влияние частотности.
- Пороговая обработка (thresholding) не всегда раскрывает структуру. Жесткая обрезка весов может оставить только «шум» и выбросы активации, создавая иллюзию работы метода.
Код репликации доступен на GitHub: github.com/nelithb/mech-interp-lab.
Источник: LessWrong ↗
