Исследования10 августа 2026 г., 07:18 МСК🤖 Auto

EntropyMoE: Мозаика без токенизатора на базе энтропии байтов

Исследователи представили EntropyMoE — архитектуру MoE для LLM без токенизатора, где маршрутизация экспертов управляется энтропией динамических байтовых патчей, что снижает perplexity без потери качества.

Баннер новости 5403

Проблема унификации в байтовых моделях

Последние байтовые большие языковые модели (LLM) делают шаг к полному отказу от токенизаторов, группируя байты в патчи динамического размера. Однако существующие архитектуры применяют одинаковые плотные feed-forward вычисления к каждому патчу. Это не позволяет адаптировать емкость модели под семантическую вариативность и гранулярность патчей, что является узким местом в эффективности обучения.

Решение: EntropyMoE

Авторы (Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang) предлагают архитектуру EntropyMoE, которая заменяет плотные модули на Top-K экспертные слои. Ключевая инновация заключается в том, что маршрутизация экспертов происходит напрямую на основе энтропии патча. Эта же метрика энтропии используется для формирования самих динамических патчей, создавая единую систему координат для sparse-вычислений.

Механика работы

Каждый динамический патч становится базовой единицей маршрутизации. Вклад патча в общую нагрузку (workload) определяется его байтовым покрытием. Пространство признаков для регулирования специализации экспертов формируется совместным влиянием энтропии патча и его длины. Это позволяет модели «понимать», какие эксперты нужны для сложных (высокоэнтропийных) участков текста, а какие — для простых.

Результаты и метрики

Эксперименты показали, что EntropyMoE достигает наименьшего значения held-out bits-per-byte среди всех сопоставимых плотных и разреженных базовых моделей. При этом downstream-точность (качество решения прикладных задач) остается на сопоставимом уровне с традиционными подходами.

Характеристика Традиционные байтовые LLM EntropyMoE (предлагаемая модель)
Архитектура вычислений Плотные (Dense) feed-forward Разреженные (Sparse) Top-K Experts
База маршрутизации Отсутствует (единая обработка) Энтропия патча + Длина
Метрика качества Выше bits-per-byte Минимальный bits-per-byte
Downstream accuracy Базовый уровень Сопоставимый с базой

Результаты работы доказывают, что энтропия патча является эффективным координатным пространством для маршрутизации, расширяя применение Mixture-of-Experts за пределы токенизированных представлений.

Источник: arXiv cs.AI ↗