Исследования5 августа 2026 г., 23:16 МСК🤖 Auto

R-lens: Прорыв в интерпретируемости LLM на ранних слоях

Исследователи представили R-lens — улучшенную версию J-lens, использующую LRP для обратной передачи релевантности. Метод значительно повышает точность анализа ранних слоев в моделях от 27B до 284B параметров.

Баннер новости 5155

Проблема шумных ранних слоев

Инструмент J-lens позволяет визуализировать промежуточные переменные в слоях трансформеров, но на ранних этапах обработки данных он часто выдает «шум» и неинтерпретируемые результаты. Авторы (Camila Blank, Agam Bhatia, Neel Nanda) выявили, что это структурный дефект: ошибки в оценках градиентов накапливаются при обратной передаче от последнего слоя к ранним, делая их показания неточными.

Решение: R-lens на базе LRP

Новый метод R-lens заменяет стандартные градиенты (autograd) на правила распространения релевантности (Layer-wise Relevance Propagation, LRP). Это позволяет сохранять «суммарную релевантность» при переходе между слоями. Ключевые технические изменения:

  • LN-rule: Нормализация RMSNorm обрабатывается линейно, предотвращая коллапс релевантности.
  • Identity-rule + Half-rule: В MLP-слоях с гейтами (SiLU/GELU) релевантность распределяется поровну между ветвями, исключая двойной учет.
  • 0-rule: Линейные слои обрабатываются как обычно (Gradient × Input).

Результаты: Цифры и бенчмарки

Тестирование проводилось на моделях Qwen3 (4B, 122B-a10b), Qwen3.5 и DeepSeek-V4-Flash (284B/13B active). Метрика Mean pass@10 (попадание целевого токена в топ-10 предсказаний) показала явное преимущество R-lens в моделях среднего и большого размера.

Модель Архитектура Параметры Наблюдаемый эффект R-lens
Qwen3-4B Dense 4B Нет значимого преимущества
Qwen3.5-122B-a10b MoE 122B (10B active) Нет значимого преимущества
Qwen3.5 (27B) Dense 27B Значительное улучшение на ранних слоях
DeepSeek-V4-Flash MoE 284B (13B active) Максимальный прирост точности

Кейсы: Раннее обнаружение концепций

R-lens не только точнее, но и быстрее выявляет семантические связи. В тестах на опечатки, многошаговые вопросы и ассоциации R-lens находил целевые концепции на 10–16 слоев раньше J-lens:

  • Опечатки: Слово «aganst» → R-lens исправляет на «against» уже на 4-м слое, J-lens не находит его вовсе.
  • Многошаговые факты: Ассоциация «sushi» → «Japan» обнаруживается на 2-м слое (против 14-го у J-lens).
  • Базовые ассоциации: «Jordan» → «basketball» выявляется на 4-м слое (против 20-го у J-lens).

Метод R-lens является «drop-in replacement» для J-lens, требуя лишь добавления нескольких стоп-градиентов, что делает его легким в интеграции и эффективным для анализа внутренних состояний больших языковых моделей.

Источник: LessWrong ↗