Проблема унификации в байтовых моделях
Последние байтовые большие языковые модели (LLM) делают шаг к полному отказу от токенизаторов, группируя байты в патчи динамического размера. Однако существующие архитектуры применяют одинаковые плотные feed-forward вычисления к каждому патчу. Это не позволяет адаптировать емкость модели под семантическую вариативность и гранулярность патчей, что является узким местом в эффективности обучения.
Решение: EntropyMoE
Авторы (Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang) предлагают архитектуру EntropyMoE, которая заменяет плотные модули на Top-K экспертные слои. Ключевая инновация заключается в том, что маршрутизация экспертов происходит напрямую на основе энтропии патча. Эта же метрика энтропии используется для формирования самих динамических патчей, создавая единую систему координат для sparse-вычислений.
Механика работы
Каждый динамический патч становится базовой единицей маршрутизации. Вклад патча в общую нагрузку (workload) определяется его байтовым покрытием. Пространство признаков для регулирования специализации экспертов формируется совместным влиянием энтропии патча и его длины. Это позволяет модели «понимать», какие эксперты нужны для сложных (высокоэнтропийных) участков текста, а какие — для простых.
Результаты и метрики
Эксперименты показали, что EntropyMoE достигает наименьшего значения held-out bits-per-byte среди всех сопоставимых плотных и разреженных базовых моделей. При этом downstream-точность (качество решения прикладных задач) остается на сопоставимом уровне с традиционными подходами.
| Характеристика | Традиционные байтовые LLM | EntropyMoE (предлагаемая модель) |
|---|---|---|
| Архитектура вычислений | Плотные (Dense) feed-forward | Разреженные (Sparse) Top-K Experts |
| База маршрутизации | Отсутствует (единая обработка) | Энтропия патча + Длина |
| Метрика качества | Выше bits-per-byte | Минимальный bits-per-byte |
| Downstream accuracy | Базовый уровень | Сопоставимый с базой |
Результаты работы доказывают, что энтропия патча является эффективным координатным пространством для маршрутизации, расширяя применение Mixture-of-Experts за пределы токенизированных представлений.
Источник: arXiv cs.AI ↗
