Проблема адаптации AFR к структурированному прунингу
Традиционные методы неструктурированного прунинга, такие как Adaptive Feature Retention (AFR), демонстрируют высокую эффективность, но требуют специализированного оборудования для работы. Перенос этих техник на структурированный прунинг (удаление целых нейронов или каналов) сталкивается с тремя ключевыми барьерами: рассогласование распределений гетерогенных оценок важности, потеря информации о знаке (направлении оптимизации) и влияние выбросов на итоговый результат.
Решение: три компонента метода
Авторы предлагают унифицированный подход, состоящий из трех этапов:
- Степенная трансформация (Power Transformation): выравнивает нелинейные распределения оценок важности весов, делая их сопоставимыми.
- Агрегация с сохранением знака (Sign-Preserving Score Aggregation): позволяет учитывать направление градиента, предотвращая удаление критически важных связей.
- Удаление выбросов на основе перцентилей: исключает аномальные значения, искажающие пороговые значения для обрезки.
Результаты бенчмарков
Метод протестирован на трех популярных моделях. Ключевое достижение — сохранение точности на уровне неструктурированного прунинга при получении практического ускорения инференса за счет структурированности.
| Модель | Параметры | Ключевое преимущество |
|---|---|---|
| Llama-3-8B | 8 млрд | Совместимость с Llama-3 и стандартными оптимизаторами |
| Vicuna-v1.5-13B | 13 млрд | Эффективность на диалоговых моделях |
| LLaVA-v1.5-13B | 13 млрд | Применимость к мультимодальным LLM |
Значение для индустрии
Предложенный подход решает проблему «разрыва» между теоретической эффективностью сжатия и практической скоростью. Благодаря структурированности, модели можно запускать на стандартных GPU без кастомных ядер, что критически важно для внедрения LLM в production-среды с жесткими требованиями к latency.
Источник: arXiv cs.CL ↗
