Проблема шумных ранних слоев
Инструмент J-lens позволяет визуализировать промежуточные переменные в слоях трансформеров, но на ранних этапах обработки данных он часто выдает «шум» и неинтерпретируемые результаты. Авторы (Camila Blank, Agam Bhatia, Neel Nanda) выявили, что это структурный дефект: ошибки в оценках градиентов накапливаются при обратной передаче от последнего слоя к ранним, делая их показания неточными.
Решение: R-lens на базе LRP
Новый метод R-lens заменяет стандартные градиенты (autograd) на правила распространения релевантности (Layer-wise Relevance Propagation, LRP). Это позволяет сохранять «суммарную релевантность» при переходе между слоями. Ключевые технические изменения:
- LN-rule: Нормализация RMSNorm обрабатывается линейно, предотвращая коллапс релевантности.
- Identity-rule + Half-rule: В MLP-слоях с гейтами (SiLU/GELU) релевантность распределяется поровну между ветвями, исключая двойной учет.
- 0-rule: Линейные слои обрабатываются как обычно (Gradient × Input).
Результаты: Цифры и бенчмарки
Тестирование проводилось на моделях Qwen3 (4B, 122B-a10b), Qwen3.5 и DeepSeek-V4-Flash (284B/13B active). Метрика Mean pass@10 (попадание целевого токена в топ-10 предсказаний) показала явное преимущество R-lens в моделях среднего и большого размера.
| Модель | Архитектура | Параметры | Наблюдаемый эффект R-lens |
|---|---|---|---|
| Qwen3-4B | Dense | 4B | Нет значимого преимущества |
| Qwen3.5-122B-a10b | MoE | 122B (10B active) | Нет значимого преимущества |
| Qwen3.5 (27B) | Dense | 27B | Значительное улучшение на ранних слоях |
| DeepSeek-V4-Flash | MoE | 284B (13B active) | Максимальный прирост точности |
Кейсы: Раннее обнаружение концепций
R-lens не только точнее, но и быстрее выявляет семантические связи. В тестах на опечатки, многошаговые вопросы и ассоциации R-lens находил целевые концепции на 10–16 слоев раньше J-lens:
- Опечатки: Слово «aganst» → R-lens исправляет на «against» уже на 4-м слое, J-lens не находит его вовсе.
- Многошаговые факты: Ассоциация «sushi» → «Japan» обнаруживается на 2-м слое (против 14-го у J-lens).
- Базовые ассоциации: «Jordan» → «basketball» выявляется на 4-м слое (против 20-го у J-lens).
Метод R-lens является «drop-in replacement» для J-lens, требуя лишь добавления нескольких стоп-градиентов, что делает его легким в интеграции и эффективным для анализа внутренних состояний больших языковых моделей.
Источник: LessWrong ↗
