Исследования25 июля 2026 г., 05:19 МСК🤖 Auto

Квантование по слоям: как линейные зонды экономят биты без потери точности

Исследователь Aniket Ghosh доказал, что равномерное квантование LLM неэффективно. Использование линейных зондов для выявления «важных» слоев позволяет снизить среднюю разрядность до 3-5 бит, сохраняя 99-100% точности на специфичных задачах.

Баннер новости 4352

Суть метода: от интерпретируемости к оптимизации

Традиционные подходы к квантованию часто применяют равномерное сжатие весов по всей модели, что приводит к значительной потере качества. Автор предлагает гибридный подход, объединяющий механистическую интерпретируемость (Mechanistic Interpretability) и инженерную оптимизацию. Идея проста: модель обрабатывает синтаксис на ранних слоях, семантику — в средних, а специфичные для задачи признаки — в последних. Линейный зонд (linear probe) — легкий классификатор, обучаемый на активациях каждого слоя, позволяет точно определить, на каком слое формируется сигнал для конкретной задачи (например, распознавания именованных сущностей или частей речи).

Эксперимент на BERT и перенос на LLM

Исследование началось с энкодеров (BERT-base, RoBERTa, DistilBERT) на датасете CoNLL-2003. Зонды показали, что синтаксические признаки (POS, chunks) пикуются к 4-му слою, а сущности (NER) — к 5-му. Квантование слоев, идущих после пика сигнала, не влияло на точность, так как информация уже была извлечена. Этот паттерн обобщился на другие модели и даже на компьютерное зрение (ранние слои ловят края, поздние — глубину).

Ключевой тест прошел на декодере Qwen2.5-3B. Зонды выявили пики сигналов: chunks к 4-му слою, POS к 8-му, NER к 11-му. Оказалось, что 25-32 из 36 слоев можно сжать агрессивно, не навредив результату.

Результаты: Guided vs Uniform Quantization

Сравнение стратегий квантования показало катастрофический провал равномерного подхода и успех «направленного» (guided) метода, который сохраняет 8-битную точность на важных слоях и снижает её до 2 бит на остальных.

Метрика / Модель Guided (Направленное) Uniform (Равномерное) Anti / Random
Средняя разрядность (BERT) 5 бит 5 бит 5 бит
Точность на unseen data (NER/POS/Chunks) 99–100% 16–41% 2–41%
Средняя разрядность (Qwen2.5-3B) ~3 бит ~8 бит (для сравнения) Информация недостаточна
Сохранение F1-score (Qwen2.5-3B) Высокое до 3 бит Сравнимо только при 8 бит Информация недостаточна

Почему это важно для индустрии

Метод работает идеально для «острых» задач (NER, классификация, chunking), где модель опирается на четкие, локализованные признаки. Это позволяет сократить вычислительные затраты и память в 2-3 раза без потери качества. Однако подход не универсален: для задач общего знания (general-knowledge QA) или сложных логических цепочек (Arc Challenge), где сигнал распределен по всей сети, выделение конкретных «важных» слоев затруднительно, и равномерное сжатие может оказаться более предсказуемым, albeit менее эффективным, компромиссом.

Источник: LessWrong ↗