Проблема изолированной маршрутизации
В современных языковых моделях с архитектурой Mixture-of-Experts (MoE) маршрутизатор обычно выбирает и взвешивает эксперты, опираясь исключительно на скрытое состояние токена (hidden state). Этот подход использует ограниченную контекстуальную информацию, игнорируя то, как модель фактически «смотрит» на данные. Авторы работы из Университета Аристотеля и других институтов предлагают решение: Attention-Aware Routing (AAR).
AAR обогащает маршрутизатор временными и спектральными функциями, извлеченными из скользящего окна весов внимания. Эти веса служат сводкой контекстуального состояния модели, полностью отделенной от скрытого состояния. Ключевое преимущество метода: базовый трансформер остается полностью замороженным, обучаются только параметры маршрутизации, что изолирует влияние нового механизма.
Результаты и метрики
Эксперименты проводились на модели OLMoE. Интеграция AAR позволила достичь значимого прироста качества на бенчмарке GSM8K (математическое мышление). Ниже приведены ключевые показатели эффективности:
| Метрика / Аспект | Результат / Наблюдение |
|---|---|
| Прирост на GSM8K | +3.37 процентных пункта (pp) относительно базовой линии SFT |
| Длина генерации (ошибки) | Сокращается (модель быстрее «сдается» при неверном ответе) |
| Длина генерации (верные ответы) | Остается неизменной |
| Чувствительность к глубине | Высокая: применение на всех слоях ухудшает фактологическую выборку |
Открытый механизм: Цепная реакция внимания
Исследование выявило неожиданный феномен: маршрутизация и внимание образуют связанную цепь. Изменения в маршрутизации на слое l распространяются через остаточный поток (residual stream) и усиливают «якоря внимания» (attention sinks) на слое l+1. Это перестраивает механизм внимания без каких-либо прямых обновлений его весов. Таким образом, AAR не просто улучшает выбор экспертов, но и косвенно оптимизирует то, как модель фокусируется на контексте.
Глубинная чувствительность и компромисс
AAR демонстрирует сильную зависимость от глубины сети. Индискриминационное применение метода на всех слоях приводит к деградации фактологической выборки (retrieval), тогда как математические рассуждения выигрывают от внедрения AAR в более глубокие слои. Это обнажает напряжение между извлечением фактов и логическим выводом в зависимости от глубины сети, делая выборочное по слоям AAR мощным инструментом для анализа информации, которую несут веса внимания на разных этапах обработки.
Источник: arXiv cs.AI ↗
