Проблема: «Стена пропускной способности» на edge-устройствах
Запуск MoE-моделей на потребительском оборудовании упирается не в вычисления, а в память. На примере Qwen3-235B (квантованная версия Q4_K_M, 134 ГБ) показано, что декодирование на GPU с 8 ГБ VRAM ограничено пропускной способностью памяти. Скорость составляет всего 0.44 токена/с в теплом состоянии, так как большинство экспертов хранится на SSD, скорость которого несопоставима с RAM. Попытка сгладить нагрузку пакетной обработкой (batching) приводит к thrashing-у страниц уже при batch size 32.
Метрика: Насколько «кэшируема» типичная маршрутизация?
Авторы разработали инструмент llama-moe-trace для телеметрии маршрутизаторов без изменения кода. Анализ трафика Qwen3-30B выявил высокую степень повторного использования экспертов:
- 2.0x — вероятность повторного вызова эксперта для соседних токенов.
- 52.5% экспертов обрабатывают 95% всего трафика.
- LRU-кэш, вмещающий всего 13.4% экспертов, обслуживает 66% запросов.
Эксперимент: Обучение локальности (Negative Result)
Гипотеза: можно ли обучить маршрутизатор минимизировать промахи кэша, добавив вспомогательные лoss-функции? Были обучены модели 137M параметров с дополнительными целями на локальность. Результаты оказались противоречивыми:
| Метрика | Результат | Значение |
|---|---|---|
| Снижение промахов кэша | До 60% | Механизм работает технически |
| Статический хит-рейт | 99% | Эксперты «закрепляются» за слоями |
| Perplexity (качество) | >1% деградации | Провал порога допуска (gate) |
Снижение промахов кэша жестко связано с падением качества модели. На моделях масштаба 340M «налог» на качество не уменьшается, а слегка растет.
Решение: Комбинация методов дешевле обучения
Полностью обученная локальность не прошла тест на качество. Однако авторы нашли гибридный подход: кэширование, aware к rerouting (без обучения) + обученная локальность. Эта связка дает:
- Снижение промахов кэша до 80%.
- Деградацию perplexity не более 3.4%.
- Значительно меньшую стоимость, чем попытка обучить локальность «с нуля».
Код, трейсы и пре-регистрация эксперимента опубликованы, что делает это исследование эталонным примером честного научного результата (negative result) в области оптимизации LLM.
Источник: arXiv cs.AI ↗
