Исследования20 августа 2026 г., 10:17 МСК🤖 Auto

MoE-маршрутизаторы не кэшируются: провал обучения локальности для Qwen3

Исследование с предварительной регистрацией доказало: обучение маршрутизаторов MoE для повышения локальности данных снижает промахи кэша, но критически ухудшает качество модели (perplexity).

Баннер новости 6146

Проблема: «Стена пропускной способности» на edge-устройствах

Запуск MoE-моделей на потребительском оборудовании упирается не в вычисления, а в память. На примере Qwen3-235B (квантованная версия Q4_K_M, 134 ГБ) показано, что декодирование на GPU с 8 ГБ VRAM ограничено пропускной способностью памяти. Скорость составляет всего 0.44 токена/с в теплом состоянии, так как большинство экспертов хранится на SSD, скорость которого несопоставима с RAM. Попытка сгладить нагрузку пакетной обработкой (batching) приводит к thrashing-у страниц уже при batch size 32.

Метрика: Насколько «кэшируема» типичная маршрутизация?

Авторы разработали инструмент llama-moe-trace для телеметрии маршрутизаторов без изменения кода. Анализ трафика Qwen3-30B выявил высокую степень повторного использования экспертов:

  • 2.0x — вероятность повторного вызова эксперта для соседних токенов.
  • 52.5% экспертов обрабатывают 95% всего трафика.
  • LRU-кэш, вмещающий всего 13.4% экспертов, обслуживает 66% запросов.

Эксперимент: Обучение локальности (Negative Result)

Гипотеза: можно ли обучить маршрутизатор минимизировать промахи кэша, добавив вспомогательные лoss-функции? Были обучены модели 137M параметров с дополнительными целями на локальность. Результаты оказались противоречивыми:

МетрикаРезультатЗначение
Снижение промахов кэшаДо 60%Механизм работает технически
Статический хит-рейт99%Эксперты «закрепляются» за слоями
Perplexity (качество)>1% деградацииПровал порога допуска (gate)

Снижение промахов кэша жестко связано с падением качества модели. На моделях масштаба 340M «налог» на качество не уменьшается, а слегка растет.

Решение: Комбинация методов дешевле обучения

Полностью обученная локальность не прошла тест на качество. Однако авторы нашли гибридный подход: кэширование, aware к rerouting (без обучения) + обученная локальность. Эта связка дает:

  • Снижение промахов кэша до 80%.
  • Деградацию perplexity не более 3.4%.
  • Значительно меньшую стоимость, чем попытка обучить локальность «с нуля».

Код, трейсы и пре-регистрация эксперимента опубликованы, что делает это исследование эталонным примером честного научного результата (negative result) в области оптимизации LLM.

Источник: arXiv cs.AI ↗