Проблема: узкое горлышко маршрутизации в MoE
Спайсовые модели Mixture-of-Experts (MoE) расширяют емкость нейросетей за счет условной активации экспертов, но их полные пулы экспертов сложно развернуть при ограниченной памяти ускорителей. Существующие методы выгрузки (offloading) перемещают неактивные эксперты в память хоста, но создают критический bottleneck: необходимые эксперты становятся известны только после маршрутизации top-K, что сериализует процессы маршрутизации, загрузки и выполнения.
Решение: разделение предсказания и выполнения
SpecPrefetch решает эту проблему, разделяя предсказание передачи данных от маршрутизации выполнения. Метод использует легкий разделяемый адаптер для предсказания кандидатов в эксперты следующего слоя исключительно для асинхронной передачи. При этом замороженный нативный роутер определяет финальных исполняемых экспертов. Ошибки предсказания влияют только на эффективность передачи, но не на выходные данные модели.
Результаты: лидерство в recall и прирост скорости
Эксперименты проводились на моделях Qwen3-VL-30B-A3B и DeepSeek-VL2-Tiny. SpecPrefetch показал лучший средний recall экспертов в 9 из 10 конфигураций, требуя значительно меньше обучаемых параметров по сравнению с базовыми методами предсказания. На устройстве с чипом Snapdragon 8 Elite метод увеличил пропускную способность декодирования (decoding throughput) до 20% по сравнению с вычислительно оптимизированным временем выполнения.
| Метрика / Параметр | SpecPrefetch | Базовые методы (Learned Predictor) |
|---|---|---|
| Средний recall экспертов | Лучший результат (9/10 настроек) | Ниже |
| Объем обучаемых параметров | Минимальный (легкий адаптер) | Значительно больше |
| Прирост скорости (Snapdragon 8 Elite) | До +20% пропускной способности | Базовый уровень (compute-optimized) |
Значение для индустрии
Представленный подход демонстрирует практическую пользу для развертывания MoE-моделей в условиях ограниченного хранилища и пропускной способности памяти. Разделение логики предсказания и выполнения позволяет оптимизировать использование ресурсов без компромиссов в точности модели, что критически важно для мобильных и edge-устройств.
Источник: arXiv cs.AI ↗
