Исследования21 сентября 2026 г., 07:19 МСК🤖 Auto

Attention-Aware Routing: Как MoE-модели учатся слушать себя

Исследователи представили Attention-Aware Routing (AAR) — метод, который связывает маршрутизацию и внимание в MoE-моделях, повышая точность GSM8K на 3.37% без изменения базового трансформера.

Баннер новости 7916

Проблема изолированной маршрутизации

В современных языковых моделях с архитектурой Mixture-of-Experts (MoE) маршрутизатор обычно выбирает и взвешивает эксперты, опираясь исключительно на скрытое состояние токена (hidden state). Этот подход использует ограниченную контекстуальную информацию, игнорируя то, как модель фактически «смотрит» на данные. Авторы работы из Университета Аристотеля и других институтов предлагают решение: Attention-Aware Routing (AAR).

AAR обогащает маршрутизатор временными и спектральными функциями, извлеченными из скользящего окна весов внимания. Эти веса служат сводкой контекстуального состояния модели, полностью отделенной от скрытого состояния. Ключевое преимущество метода: базовый трансформер остается полностью замороженным, обучаются только параметры маршрутизации, что изолирует влияние нового механизма.

Результаты и метрики

Эксперименты проводились на модели OLMoE. Интеграция AAR позволила достичь значимого прироста качества на бенчмарке GSM8K (математическое мышление). Ниже приведены ключевые показатели эффективности:

Метрика / Аспект Результат / Наблюдение
Прирост на GSM8K +3.37 процентных пункта (pp) относительно базовой линии SFT
Длина генерации (ошибки) Сокращается (модель быстрее «сдается» при неверном ответе)
Длина генерации (верные ответы) Остается неизменной
Чувствительность к глубине Высокая: применение на всех слоях ухудшает фактологическую выборку

Открытый механизм: Цепная реакция внимания

Исследование выявило неожиданный феномен: маршрутизация и внимание образуют связанную цепь. Изменения в маршрутизации на слое l распространяются через остаточный поток (residual stream) и усиливают «якоря внимания» (attention sinks) на слое l+1. Это перестраивает механизм внимания без каких-либо прямых обновлений его весов. Таким образом, AAR не просто улучшает выбор экспертов, но и косвенно оптимизирует то, как модель фокусируется на контексте.

Глубинная чувствительность и компромисс

AAR демонстрирует сильную зависимость от глубины сети. Индискриминационное применение метода на всех слоях приводит к деградации фактологической выборки (retrieval), тогда как математические рассуждения выигрывают от внедрения AAR в более глубокие слои. Это обнажает напряжение между извлечением фактов и логическим выводом в зависимости от глубины сети, делая выборочное по слоям AAR мощным инструментом для анализа информации, которую несут веса внимания на разных этапах обработки.

Источник: arXiv cs.AI ↗