Суть метода: от интерпретируемости к оптимизации
Традиционные подходы к квантованию часто применяют равномерное сжатие весов по всей модели, что приводит к значительной потере качества. Автор предлагает гибридный подход, объединяющий механистическую интерпретируемость (Mechanistic Interpretability) и инженерную оптимизацию. Идея проста: модель обрабатывает синтаксис на ранних слоях, семантику — в средних, а специфичные для задачи признаки — в последних. Линейный зонд (linear probe) — легкий классификатор, обучаемый на активациях каждого слоя, позволяет точно определить, на каком слое формируется сигнал для конкретной задачи (например, распознавания именованных сущностей или частей речи).
Эксперимент на BERT и перенос на LLM
Исследование началось с энкодеров (BERT-base, RoBERTa, DistilBERT) на датасете CoNLL-2003. Зонды показали, что синтаксические признаки (POS, chunks) пикуются к 4-му слою, а сущности (NER) — к 5-му. Квантование слоев, идущих после пика сигнала, не влияло на точность, так как информация уже была извлечена. Этот паттерн обобщился на другие модели и даже на компьютерное зрение (ранние слои ловят края, поздние — глубину).
Ключевой тест прошел на декодере Qwen2.5-3B. Зонды выявили пики сигналов: chunks к 4-му слою, POS к 8-му, NER к 11-му. Оказалось, что 25-32 из 36 слоев можно сжать агрессивно, не навредив результату.
Результаты: Guided vs Uniform Quantization
Сравнение стратегий квантования показало катастрофический провал равномерного подхода и успех «направленного» (guided) метода, который сохраняет 8-битную точность на важных слоях и снижает её до 2 бит на остальных.
| Метрика / Модель | Guided (Направленное) | Uniform (Равномерное) | Anti / Random |
|---|---|---|---|
| Средняя разрядность (BERT) | 5 бит | 5 бит | 5 бит |
| Точность на unseen data (NER/POS/Chunks) | 99–100% | 16–41% | 2–41% |
| Средняя разрядность (Qwen2.5-3B) | ~3 бит | ~8 бит (для сравнения) | Информация недостаточна |
| Сохранение F1-score (Qwen2.5-3B) | Высокое до 3 бит | Сравнимо только при 8 бит | Информация недостаточна |
Почему это важно для индустрии
Метод работает идеально для «острых» задач (NER, классификация, chunking), где модель опирается на четкие, локализованные признаки. Это позволяет сократить вычислительные затраты и память в 2-3 раза без потери качества. Однако подход не универсален: для задач общего знания (general-knowledge QA) или сложных логических цепочек (Arc Challenge), где сигнал распределен по всей сети, выделение конкретных «важных» слоев затруднительно, и равномерное сжатие может оказаться более предсказуемым, albeit менее эффективным, компромиссом.
Источник: LessWrong ↗
