Исследования7 сентября 2026 г., 15:17 МСК🤖 Auto

J-lens: Как расшифровать «мышление» Gemma-4-31B через матрицы Якоби

Исследование Caleb Briggs раскрывает внутреннюю архитектуру Gemma-4-31B, разделяя её на сенсорные, рабочие и моторные блоки с помощью анализа пространства управления (J-lens).

Баннер новости 6934

Суть метода: от локализации к глобальному пониманию

В основе анализа лежит J-lens (Jacobian Lens) — метод, позволяющий визуализировать, как изменения в скрытых слоях нейросети влияют на итоговый вывод (logits). Автор использует сингулярное разложение (SVD) матрицы Якоби для каждого слоя, выделяя «векторы управления» (steering vectors). Эти векторы показывают, какие направления в пространстве признаков имеют наибольшее влияние на выход модели.

Ключевая идея: усреднение матриц Якоби по множеству контекстов позволяет отсечь шум, специфичный для отдельных примеров, и выявить стабильные, «канонические» пути передачи информации внутри модели. Это дает возможность сравнивать «рабочее пространство» разных слоев между собой.

Архитектурная сегментация Gemma-4-31B

Анализ выявил четкую трехчастную структуру в модели Gemma-4-31B (base), что перекликается с находками Anthropic, но с важными нюансами для данной архитектуры. Граница между ранними и средними слоями проходит на 25-м слое (L25).

Блок Примерные слои Функция Характер информации
Сенсорный (Sensory) Ранние слои (до L25) Обработка входных данных Синтаксис, токены, локальные паттерны
Рабочий (Workspace) Средние слои (после L25) Интеграция и абстракция Семантика, логика, контекст
Моторный (Motor) Поздние слои Генерация ответа Прямое влияние на выбор токенов

Методологическая коррекция: проблема масштабирования

Автор отмечает критическую ошибку в стандартном применении J-lens к Gemma-4: использование стандартной метрики влияния (евкликова норма изменения скрытого состояния) приводит к искажениям. В Gemma-4 диагональная матрица усиления (diagonal gain) имеет сильную асимметрию — некоторые направления подавляются в 30 раз сильнее других.

Если не скорректировать это, модель будет казаться «слепой» к важным, но слабо масштабированным направлениям. Briggs предлагает использовать аппроксимацию, учитывающую влияние на логиты, а не просто на скрытое состояние, что восстанавливает корректную геометрию пространства признаков. Удаление всего 8 топ-каналов из этой аппроксимации уже возвращает структуру, близкую к истинной.

Почему это важно для AI-сообщества

Это исследование демонстрирует, что интерпретируемость (XAI) требует адаптации методов под конкретную архитектуру. То, что работает для Llama или Mistral, может давать ложные срабатывания для Gemma из-за особенностей нормализации и масштабирования. Понимание того, что L25 является «швом» между восприятием и мышлением, позволяет целенаправленно внедрять steering-векторы для контроля поведения модели на нужных этапах обработки информации.

Источник: LessWrong ↗