Суть эксперимента: что и как тестировали
Автор проанализировал влияние стандартного сжатия весов (weight quantization) на производительность и интерпретируемость моделей Google DeepMind Gemma 3 4B и Gemma 3 12B. В качестве базовой линии использовались оригинальные модели, затем они были сжаты с помощью библиотеки bitsandbytes до форматов 8-bit (метод LLM.int8()) и 4-bit (datatype NF4). Анализ проводился на слоях 17 (для 4B) и 24 (для 12B), так как они занимают схожие относительные позиции в архитектуре.
Ключевым инструментом интерпретируемости выступали предварительно обученные разреженные автоэнкодеры (Sparse Autoencoders, SAE), взятые из репозитория SAELens. Их задача — реконструировать остаточный поток (residual stream) модели. Качество реконструкции измерялось метрикой FVU (Fraction of Variance Unexplained) — долей необъясненной дисперсии. Низкий FVU является необходимым, но не достаточным условием для успешного выявления признаков (features).
Результаты: производительность и интерпретируемость
Эксперимент выявил интригующее расхождение между падением точности генерации и стабильностью интерпретируемости. В то время как 8-битное сжатие практически не повлияло на качество, 4-битное вызвало умеренное снижение метрик перплексии (perplexity) и кросс-энтропии. Однако способность SAE-модулей «расшифровывать» внутреннее состояние модели осталась высокой.
| Метрика / Параметр | Gemma 3 4B | Gemma 3 12B |
|---|---|---|
| Влияние 8-bit сжатия на производительность | Практически отсутствует | Практически отсутствует |
| Деградация при 4-bit сжатии | ~2% | ~2.7% |
| Стабильность SAE (FVU) | Высокая (консистентная) | Высокая (консистентная) |
| Инструменты сжатия | bitsandbytes (LLM.int8, NF4) | bitsandbytes (LLM.int8, NF4) |
Почему это важно для индустрии
Результаты создают оптимистичный сценарий для механистической интерпретируемости (Mechanistic Interpretability, MI). Обычно считается, что агрессивное сжатие моделей разрушает тонкие внутренние представления, необходимые для анализа. Здесь же показано, что даже в 4-битном формате, который становится стандартом для локального запуска тяжелых моделей, SAE-инструменты сохраняют работоспособность.
Это означает, что исследователи и разработчики смогут применять методы интерпретируемости к компактным, эффективным моделям, которые массово развертываются на edge-устройствах. Хотя способность SAE реконструировать векторы не гарантирует полного понимания логики модели, это критически важный первый шаг к контролю над «черным ящиком» в условиях ограниченных вычислительных ресурсов.
Источник: LessWrong ↗
