Проблема избыточности в CNN
Сверточные нейронные сети (CNN) часто содержат избыточные карты признаков (feature maps), которые увеличивают затраты на хранение и вычисления при выводе (inference). Традиционные методы прунинга часто удаляют изолированные скалярные веса, что может нарушить структуру сети. Новый подход, описанный в статье arXiv:2607.22564, предлагает структурный прунинг: удаление целых выходных каналов свертки и соответствующих фильтров, что более эффективно для аппаратной оптимизации.
Механика «Многоармочных бандитов»
Каждая кандидатная карта признаков рассматривается как «рука» (arm) в задаче многоармочного бандита. Процесс работает следующим образом:
- Временное маскирование: На каждом шаге одна карта признаков временно маскируется.
- Оценка: Сеть оценивается на выборке мини-батча (mini-batch).
- Награда: Изменение функции потерь (loss change) конвертируется в награду за безопасное удаление.
- Ранжирование: После фиксированного бюджета «игр» карты ранжируются по обученным оценкам, и топ-k карт удаляются навсегда вместе с их фильтрами, смещениями (biases) и ядрами входных каналов следующего слоя.
Экспериментальные данные и бенчмарки
Исследование сравнивает два алгоритма выбора действий — UCB1 (Upper Confidence Bound 1) и Thompson Sampling — с прямыми (oracle-style) методами оценки. Тестирование проводилось на шести наборах данных: LeNet/MNIST, MNIST, CIFAR-10, CIFAR-100, SVHN, CUB-200-2011 и Oxford Flowers 102. Статистические тесты Фридмана и Немени подтвердили значимость результатов.
| Метод | Точность (Accuracy) | Вычислительная эффективность | Статистический ранг |
|---|---|---|---|
| UCB1 | Близка к unpruned модели | Значительное снижение вычислений | Наивысший средний ранг |
| Thompson Sampling | Близка к unpruned модели | Значительное снижение вычислений | Второй по рангу |
| Greedy / Magnitude | Ниже базовой | Ниже | Значительно хуже |
| Unpruned (Базовая) | Максимальная | Базовая (высокая) | — |
Почему это важно
Результаты показывают, что UCB1 и Thompson Sampling сохраняют точность, близкую к исходным неоптимизированным моделям, при этом существенно сокращая объем вычислений. Оба метода статистически значимо превосходят жадные (greedy) и методы, основанные на величине весов (magnitude-based pruning). Это открывает путь к созданию более легких CNN для развертывания на устройствах с ограниченными ресурсами без потери качества распознавания образов.
Источник: arXiv cs.AI ↗
