Суть метода: от локализации к глобальному пониманию
В основе анализа лежит J-lens (Jacobian Lens) — метод, позволяющий визуализировать, как изменения в скрытых слоях нейросети влияют на итоговый вывод (logits). Автор использует сингулярное разложение (SVD) матрицы Якоби для каждого слоя, выделяя «векторы управления» (steering vectors). Эти векторы показывают, какие направления в пространстве признаков имеют наибольшее влияние на выход модели.
Ключевая идея: усреднение матриц Якоби по множеству контекстов позволяет отсечь шум, специфичный для отдельных примеров, и выявить стабильные, «канонические» пути передачи информации внутри модели. Это дает возможность сравнивать «рабочее пространство» разных слоев между собой.
Архитектурная сегментация Gemma-4-31B
Анализ выявил четкую трехчастную структуру в модели Gemma-4-31B (base), что перекликается с находками Anthropic, но с важными нюансами для данной архитектуры. Граница между ранними и средними слоями проходит на 25-м слое (L25).
| Блок | Примерные слои | Функция | Характер информации |
|---|---|---|---|
| Сенсорный (Sensory) | Ранние слои (до L25) | Обработка входных данных | Синтаксис, токены, локальные паттерны |
| Рабочий (Workspace) | Средние слои (после L25) | Интеграция и абстракция | Семантика, логика, контекст |
| Моторный (Motor) | Поздние слои | Генерация ответа | Прямое влияние на выбор токенов |
Методологическая коррекция: проблема масштабирования
Автор отмечает критическую ошибку в стандартном применении J-lens к Gemma-4: использование стандартной метрики влияния (евкликова норма изменения скрытого состояния) приводит к искажениям. В Gemma-4 диагональная матрица усиления (diagonal gain) имеет сильную асимметрию — некоторые направления подавляются в 30 раз сильнее других.
Если не скорректировать это, модель будет казаться «слепой» к важным, но слабо масштабированным направлениям. Briggs предлагает использовать аппроксимацию, учитывающую влияние на логиты, а не просто на скрытое состояние, что восстанавливает корректную геометрию пространства признаков. Удаление всего 8 топ-каналов из этой аппроксимации уже возвращает структуру, близкую к истинной.
Почему это важно для AI-сообщества
Это исследование демонстрирует, что интерпретируемость (XAI) требует адаптации методов под конкретную архитектуру. То, что работает для Llama или Mistral, может давать ложные срабатывания для Gemma из-за особенностей нормализации и масштабирования. Понимание того, что L25 является «швом» между восприятием и мышлением, позволяет целенаправленно внедрять steering-векторы для контроля поведения модели на нужных этапах обработки информации.
Источник: LessWrong ↗
