Исследования29 июля 2026 г., 05:16 МСК🤖 Auto

Многоцелевое структурированное прунинг LLM: оптимизация для edge-устройств

Исследователи представили двухэтапный метод структурированного прунинга больших языковых моделей, снижающий задержку и размер модели без критической потери качества.

Баннер новости 4596

Проблема развертывания LLM на периферии

Большие языковые модели (LLM) демонстрируют выдающиеся результаты в задачах рассуждения, однако их внедрение на устройствах с ограниченными ресурсами (edge computing) сталкивается с серьезными барьерами. Высокое потребление памяти, вычислительная нагрузка и строгие требования к задержке (latency) делают стандартные модели непригодными для работы на мобильных и встроенных системах. Традиционные методы прунинга часто оптимизируют только один аспект (например, размер), игнорируя задержку, или приводят к нестабильным конфигурациям из-за сложности совместной оптимизации слоев, голов внимания (attention heads) и размерностей многослойных перцептронов (MLP).

Двухэтапный подход: от грубого к тонкому

Авторы работы (Muhammad Junaid Ali, Smail Niar, El-Ghazali Talbi) предлагают аппаратно-ориентированную многоцелевую структуру прунинга, состоящую из двух этапов:

  • Грубый этап (Coarse-grained): Многоцелевое прунинг глубины (depth pruning) удаляет целые блоки внимания и MLP. Это позволяет существенно снизить вычислительную нагрузку и объем используемой памяти на ранней стадии.
  • Тонкий этап (Fine-grained): Используется параллельная байесовская оптимизация (Parallel Bayesian Optimization, PBO) для поиска оптимальных коэффициентов прунинга для каждого слоя с учетом ограничений по задержке. Внутри выделенного бюджета для каждого слоя компоненты отбираются на основе стратегий, основанных на важности (importance-based strategies).

Результаты и метрики

Эксперименты показали, что предложенный метод обеспечивает баланс между точностью, задержкой и размером модели. Ключевые результаты достигнуты при уровнях прунинга 37.5% и 50%. Метод превосходит существующие аналоги по качеству выполнения задач на здравый смысл (commonsense reasoning) и zero-shot производительности, при этом значительно снижая стоимость инференса.

Параметр Описание/Результат
Целевые метрики Задержка (Latency) и Размер модели (Model Size)
Метод оптимизации Параллельная байесовская оптимизация (PBO)
Уровни прунинга 37.5% и 50%
Ключевое преимущество Превосходство над существующими методами в задачах на здравый смысл при снижении вычислительных затрат
Применимость Edge-устройства, embedded systems

Значение для индустрии

Разработка эффективных методов сжатия LLM критически важна для демократизации доступа к передовым AI-технологиям. Предложенный framework позволяет развертывать мощные модели на устройствах, где ранее это было невозможно или экономически нецелесообразно, открывая путь для новых приложений в области мобильного AI и интернета вещей (IoT).

Источник: arXiv cs.AI ↗