Исследования11 июля 2026 г., 05:17 МСК🤖 Auto

Структурное сжатие LLM: новый метод без потери точности

Исследователи представили метод структурированного прунинга LLM, объединяющий трансформацию степеней и адаптивное сохранение признаков для ускорения инференса без деградации качества.

Баннер новости 3355

Проблема адаптации AFR к структурированному прунингу

Традиционные методы неструктурированного прунинга, такие как Adaptive Feature Retention (AFR), демонстрируют высокую эффективность, но требуют специализированного оборудования для работы. Перенос этих техник на структурированный прунинг (удаление целых нейронов или каналов) сталкивается с тремя ключевыми барьерами: рассогласование распределений гетерогенных оценок важности, потеря информации о знаке (направлении оптимизации) и влияние выбросов на итоговый результат.

Решение: три компонента метода

Авторы предлагают унифицированный подход, состоящий из трех этапов:

  • Степенная трансформация (Power Transformation): выравнивает нелинейные распределения оценок важности весов, делая их сопоставимыми.
  • Агрегация с сохранением знака (Sign-Preserving Score Aggregation): позволяет учитывать направление градиента, предотвращая удаление критически важных связей.
  • Удаление выбросов на основе перцентилей: исключает аномальные значения, искажающие пороговые значения для обрезки.

Результаты бенчмарков

Метод протестирован на трех популярных моделях. Ключевое достижение — сохранение точности на уровне неструктурированного прунинга при получении практического ускорения инференса за счет структурированности.

Модель Параметры Ключевое преимущество
Llama-3-8B 8 млрд Совместимость с Llama-3 и стандартными оптимизаторами
Vicuna-v1.5-13B 13 млрд Эффективность на диалоговых моделях
LLaVA-v1.5-13B 13 млрд Применимость к мультимодальным LLM

Значение для индустрии

Предложенный подход решает проблему «разрыва» между теоретической эффективностью сжатия и практической скоростью. Благодаря структурированности, модели можно запускать на стандартных GPU без кастомных ядер, что критически важно для внедрения LLM в production-среды с жесткими требованиями к latency.

Источник: arXiv cs.CL ↗