Исследования15 сентября 2026 г., 06:17 МСК🤖 Auto

Секретный канал ломает abliteration в Gemma-3: как победить «шум»

Исследователи обнаружили, что один доминирующий нейронный канал в Gemma-3-12B делает стандартный метод abliteration нерабочим. Предложенное решение — Winsorization — восстанавливает контроль над моделью без потери качества.

Баннер новости 7505

Проблема: Abliteration не работает на Gemma-3

Исследователи из сообщества LessWrong столкнулись с критической проблемой при попытке извлечь и отключить «направление отказа» (refusal direction) в модели Gemma-3-12B с помощью метода abliteration. В то время как для моделей Llama-3-8b и Qwen-2.5-7B этот метод работает хирургически точно, применение стандартного подхода к Gemma-3 приводило к полному коллапсу модели: генерация превращалась в бессмысленный текст, а метрики падали до уровня случайного угадывания.

Ключевые метрики деградации Gemma-3-12B при использовании сырого (raw) метода abliteration:

  • MMLU: падение с 0.682 до 0.242 (уровень случайного выбора).
  • NLL (Negative Log-Likelihood): рост с 4.47 до 20.3, что указывает на глубокое выведение модели из распределения.

Диагноз: Доминирующий канал 2339

Анализ активаций в residual stream выявил аномалию, не связанную с безопасностью или отказом. В модели Gemma-3-12B существует канал с индексом 2339, который доминирует над всеми остальными. На 98% слоев этот канал имеет среднее значение, превышающее типичную координату в 626.5 раз и в 25–90 раз превышающее вторую по величине координату. Это явление наблюдается на всех позициях токенов и во всех слоях от 0 до 46.

Для сравнения, в моделях Llama и Qwen подобные аномалии встречаются редко и имеют гораздо меньший масштаб (разница в ~7 раз против 45–300 у Gemma). Аномалия проявляется и на несвязанных с безопасностью датасетах (SST-2), что указывает на архитектурную особенность обучения Gemma-3.

Решение: Winsorization и другие методы коррекции

Стандартный метод «разности средних» (difference of means) стал плохим эстиматором из-за выброса в канале 2339. Исследователи протестировали несколько методов коррекции, основанных на идее из блога Jim Lai, который рекомендовал использовать Winsorization (обрезку значений по квантилю) перед вычислением разности активаций. Были протестированы три основных подхода:

  1. Winsorization: Ограничение величин активаций на заданном квантиле.
  2. Masked: Исключение координат, где абсолютное среднее превышает медиану слоя в 50 раз.
  3. Standardized: Деление разницы каналов на дисперсию координаты.

Результаты: Восстановление контроля

Методы коррекции, особенно Winsorization и Masked, успешно восстановили работоспособность abliteration для Gemma-3, не нарушая fluency и capability модели. Ниже приведено сравнение эффективности методов на контрасте отказов (harmful vs harmless).

Метод / Условие Gemma-3-12B (Refusal / Degeneration / MMLU) Llama-3-8B (Refusal / Degeneration / MMLU) Qwen-2.5-7B (Refusal / Degeneration / MMLU)
Clean (Базовая) 0.767 / 0.00 / 0.682 0.913 / 0.00 / 0.616 0.813 / 0.00 / 0.686
Raw (Сырой метод) no feasible cell 0.000 / 0.00 / 0.614 0.020 / 0.00 / 0.682
Masked 0.000 / 0.00 / 0.682 0.000 / 0.00 / 0.614 0.013 / 0.00 / 0.684
Standardized 0.053 / 0.00 / 0.670 0.013 / 0.00 / 0.604 0.020 / 0.00 / 0.684
Winsorized 0.000 / 0.00 / 0.676 0.020 / 0.00 / 0.618 0.000 / 0.00 / 0.672

Результаты показывают, что после применения коррекции (Masked, Standardized, Winsorized) модель Gemma-3 сохраняет высокий балл MMLU (~0.67-0.68) и нулевой уровень деградации (degeneration), что сопоставимо с поведением Llama и Qwen. Метод также обобщается на другие контрасты, такие как StrongREJECT vs WildJailbreak-benign.

Почему это важно

Это исследование вскрывает фундаментальную особенность архитектуры или процесса обучения Gemma-3, приводящую к появлению «громких» каналов активаций. Для инженеров, работающих с механистической интерпретируемостью (Mechanistic Interpretability), это критически важно: стандартные пайплайны извлечения направлений, работающие на Llama и Qwen, требуют модификации для Gemma-3. Без применения Winsorization или Masking любые попытки вмешательства в поведение модели через активации будут приводить к полному разрушению её функциональности.

Источник: LessWrong ↗