Проблема развертывания LLM на периферии
Большие языковые модели (LLM) демонстрируют выдающиеся результаты в задачах рассуждения, однако их внедрение на устройствах с ограниченными ресурсами (edge computing) сталкивается с серьезными барьерами. Высокое потребление памяти, вычислительная нагрузка и строгие требования к задержке (latency) делают стандартные модели непригодными для работы на мобильных и встроенных системах. Традиционные методы прунинга часто оптимизируют только один аспект (например, размер), игнорируя задержку, или приводят к нестабильным конфигурациям из-за сложности совместной оптимизации слоев, голов внимания (attention heads) и размерностей многослойных перцептронов (MLP).
Двухэтапный подход: от грубого к тонкому
Авторы работы (Muhammad Junaid Ali, Smail Niar, El-Ghazali Talbi) предлагают аппаратно-ориентированную многоцелевую структуру прунинга, состоящую из двух этапов:
- Грубый этап (Coarse-grained): Многоцелевое прунинг глубины (depth pruning) удаляет целые блоки внимания и MLP. Это позволяет существенно снизить вычислительную нагрузку и объем используемой памяти на ранней стадии.
- Тонкий этап (Fine-grained): Используется параллельная байесовская оптимизация (Parallel Bayesian Optimization, PBO) для поиска оптимальных коэффициентов прунинга для каждого слоя с учетом ограничений по задержке. Внутри выделенного бюджета для каждого слоя компоненты отбираются на основе стратегий, основанных на важности (importance-based strategies).
Результаты и метрики
Эксперименты показали, что предложенный метод обеспечивает баланс между точностью, задержкой и размером модели. Ключевые результаты достигнуты при уровнях прунинга 37.5% и 50%. Метод превосходит существующие аналоги по качеству выполнения задач на здравый смысл (commonsense reasoning) и zero-shot производительности, при этом значительно снижая стоимость инференса.
| Параметр | Описание/Результат |
|---|---|
| Целевые метрики | Задержка (Latency) и Размер модели (Model Size) |
| Метод оптимизации | Параллельная байесовская оптимизация (PBO) |
| Уровни прунинга | 37.5% и 50% |
| Ключевое преимущество | Превосходство над существующими методами в задачах на здравый смысл при снижении вычислительных затрат |
| Применимость | Edge-устройства, embedded systems |
Значение для индустрии
Разработка эффективных методов сжатия LLM критически важна для демократизации доступа к передовым AI-технологиям. Предложенный framework позволяет развертывать мощные модели на устройствах, где ранее это было невозможно или экономически нецелесообразно, открывая путь для новых приложений в области мобильного AI и интернета вещей (IoT).
Источник: arXiv cs.AI ↗
