Исследования30 июля 2026 г., 07:16 МСК🤖 Auto

SpecPrefetch: ускорение MoE-моделей на Snapdragon 8 Elite на 20%

Исследователи представили SpecPrefetch — метод асинхронной подгрузки экспертов для MoE-моделей, который снижает задержки без изменения весов и ускоряет вывод на мобильных чипах.

Баннер новости 4690

Проблема: узкое горлышко маршрутизации в MoE

Спайсовые модели Mixture-of-Experts (MoE) расширяют емкость нейросетей за счет условной активации экспертов, но их полные пулы экспертов сложно развернуть при ограниченной памяти ускорителей. Существующие методы выгрузки (offloading) перемещают неактивные эксперты в память хоста, но создают критический bottleneck: необходимые эксперты становятся известны только после маршрутизации top-K, что сериализует процессы маршрутизации, загрузки и выполнения.

Решение: разделение предсказания и выполнения

SpecPrefetch решает эту проблему, разделяя предсказание передачи данных от маршрутизации выполнения. Метод использует легкий разделяемый адаптер для предсказания кандидатов в эксперты следующего слоя исключительно для асинхронной передачи. При этом замороженный нативный роутер определяет финальных исполняемых экспертов. Ошибки предсказания влияют только на эффективность передачи, но не на выходные данные модели.

Результаты: лидерство в recall и прирост скорости

Эксперименты проводились на моделях Qwen3-VL-30B-A3B и DeepSeek-VL2-Tiny. SpecPrefetch показал лучший средний recall экспертов в 9 из 10 конфигураций, требуя значительно меньше обучаемых параметров по сравнению с базовыми методами предсказания. На устройстве с чипом Snapdragon 8 Elite метод увеличил пропускную способность декодирования (decoding throughput) до 20% по сравнению с вычислительно оптимизированным временем выполнения.

Метрика / Параметр SpecPrefetch Базовые методы (Learned Predictor)
Средний recall экспертов Лучший результат (9/10 настроек) Ниже
Объем обучаемых параметров Минимальный (легкий адаптер) Значительно больше
Прирост скорости (Snapdragon 8 Elite) До +20% пропускной способности Базовый уровень (compute-optimized)

Значение для индустрии

Представленный подход демонстрирует практическую пользу для развертывания MoE-моделей в условиях ограниченного хранилища и пропускной способности памяти. Разделение логики предсказания и выполнения позволяет оптимизировать использование ресурсов без компромиссов в точности модели, что критически важно для мобильных и edge-устройств.

Источник: arXiv cs.AI ↗