Исследования10 сентября 2026 г., 08:17 МСК🤖 Auto

Damage-Aware Bandit: новый метод прунинга Transformer-моделей

Исследователи Salem Ameen и Sunil Vadera представили метод структурированного прунинга, использующий алгоритмы многоручного банкомата для минимизации деградации качества моделей GPT-2, Qwen2.5 и ViT.

Баннер новости 7145

Суть метода: от жадного выбора к bandit-стратегии

Традиционные методы прунинга часто полагаются на жадные алгоритмы или оценку значимости весов, что может приводить к субоптимальному отбору структурных единиц. Авторы предлагают формулировать задачу отбора функциональных блоков (голов внимания и групп каналов MLP) как проблему Damage-Aware Multi-Armed Bandit. Ключевая инновация — использование paired damage (парного ущерба): разница между потерями на калибровочном батче с замаскированными единицами и базовыми потерями. Это нивелирует вариативность между батчами.

Для выбора единиц применяются два подхода: UCB-style policy и fractional-Beta Thompson Sampling. Отбор происходит последовательно, добавляя по одной единице за шаг, после чего они функционально обнуляются в исходном плотном чекпоинте.

Масштабное тестирование и бенчмарки

Эксперименты охватили широкий спектр архитектур: языковые модели GPT-2, OPT, Pythia, Qwen2.5, SmolLM2 и визуальные модели ViT-B/16, DeiT-Tiny, Swin-Tiny. Оценка проводилась на датасетах WikiText-2, LAMBADA и Imagenette. Метод сравнивался с рандомным отбором, magnitude-based pruning, static-saliency и budgeted-greedy selection.

Статистическая значимость результатов

Результаты демонстрируют статистически значимое превосходство предложенного метода над базовыми стратегиями. Из 28 выделенных сравнений 23 доверительных интервала исключают ноль, а 11 парных тестов имеют p-value < 0.05. После коррекции Бенфамини-Хохберга 6 тестов сохранили значимость (q < 0.05) на полном семействе из 116 тестов.

d>
Метрика/Аспект Значение/Результат
Архитектуры GPT-2, OPT, Pythia, Qwen2.5, SmolLM2, ViT-B/16, DeiT-Tiny, Swin-Tiny
Датасеты WikiText-2, LAMBADA, Imagenette
Базовые сравнения Random, Magnitude, Static-saliency, Budgeted-greedy
Стат. значимость (p < 0.05) 11 парных тестов
Коррекция Бенфамини-Хохберга (q < 0.05) 6 тестов из 116
Визуальные модели (ViT/Swin) Прирост не объясняется только большим бюджетом оценки

Почему это важно

Метод позволяет эффективно сжимать модели, сохраняя их функциональность, без необходимости физической компрессии или изменения скорости инференса на этапе отбора. Это открывает путь к более надежному структурированному прунингу для больших языковых и зрительных трансформеров, где сохранение качества критично.

Источник: arXiv cs.AI ↗