Исследования13 августа 2026 г., 09:17 МСК🤖 Auto

Квантование MoE: почему 4-bit KV-кэш ломает маршрутизацию

Исследование Parvel Gu показывает, что при 4-битном кэшировании ключей и значений (KV-cache) в моделях типа MoE треть деградации качества вызвана не ошибками вычислений, а «перепрыгиванием» токенов между экспертами.

Баннер новости 5675

Суть проблемы: разрывная маршрутизация

В архитектурах Mixture-of-Experts (MoE) с топ-k маршрутизацией решение о том, какой эксперт обрабатывает токен, принимается на основе пороговых значений. Это создает дискретную границу. Когда применяется квантование KV-кэша до 4 бит (int4), а шлюзы (gates) читаются в BF16, возникает численный шум. Этот шум сдвигает токены через границы решений, заставляя срабатывать не те эксперты, которые были бы выбраны в полной точности. Автор называет это route flip (перепрыгивание маршрута).

Ключевые метрики: RMF и AUC

Исследование использует каузальный аппарат для оценки доли повреждений, опосредованных маршрутизацией (Route-Mediated Fraction, RMF). На модели OLMoE-1B-7B (пилотный запуск) было установлено, что около 31% общего ущерба от квантования вызвано именно сменой маршрута. При этом обнаружение факта перепрыгивания возможно, но оценка его вреда — нет.

Метрика / Параметр Значение / Результат Интерпретация
RMF (доля ущерба от маршрутизации) ~0.31 (диапазон 0.20–0.41) Треть потерь качества — это «ошибка выбора» эксперта, а не точности вычислений.
AUC обнаружения флипа 0.772 Маржинальные статистики шлюза позволяют с хорошей точностью узнать, что токен перешел к другому эксперту.
Прогноз знака ущерба (Loss Sign) На уровне случайности (at chance) Невозможно отличить «полезный» флип от «вредного» по наблюдаемым статистикам шлюза.
Реальный int4 KV-ядро (kernel) 95% CI [-0.111, 0.394] Результат совместим с симуляцией, но статистически незначим (включает ноль) из-за недостаточной мощности теста.

Почему это важно для разработчиков

Результат sign-inseparability (неразделимость знака) означает, что мы не можем применить селективный ремонт: если мы видим, что токен перешел к другому эксперту, мы не знаем, улучшило ли это или ухудшило ответ. Это создает empirical benefit-detection barrier (эмпирический барьер обнаружения выгоды) для любых методов исправления, основанных только на наблюдаемых статистиках маршрутизации.

Выводы и ограничения

Исследование не предлагает нового метода смягчения последствий, но предоставляет строгий каузальный анализ. Нормализация шлюзов (gate normalization) оказалась не механизмом восстановления маршрута, а модерирующим фактором величины ущерба. Все гипотезы и пороги были предварительно зарегистрированы (pre-registered), что повышает надежность выводов, особенно в условиях высокой вариативности MoE-архитектур.

Источник: arXiv cs.AI ↗