Проблема: фиксированные слои неэффективны
Мультимодальные большие языковые модели (MLLM) сталкиваются с узким местом в виде огромного количества визуальных токенов. Существующие методы прунинга часто используют внимание (attention) из фиксированного среднего слоя для оценки важности токенов. Однако анализ показал, что слой, наиболее чувствительный к вопросу, варьируется от примера к примеру. Использование одного фиксированного слоя приводит к субопимальным результатам, а вычисление внимания в нужном слое требует предварительной обработки токенов, что нивелирует экономию.
Решение: Middle-layer Attention Prediction (MAP)
Авторы предлагают метод MAP, который решает две проблемы сразу. Во-первых, он использует Question Contrastive Teacher Selection для выбора «учительского» слоя, специфичного для каждого запроса, сравнивая внимание при оригинальном и эталонном вопросах. Во-вторых, внимание из выбранного слоя дистиллируется в легковесный предиктор, который оценивает важность визуальных токенов на основе мультимодальных входных признаков.
Ключевое преимущество: во время инференса MAP комбинирует предсказанные оценки важности с критерием разнообразия для прунинга токенов до первого слоя языковой модели. Это означает, что карта внимания для отсечения не требуется, и метод совместим с существующими техниками ускорения.
Результаты: 3.09x ускорение при 97.5% качества
Метод был протестирован на модели LLaVA-NeXT-7B в рамках 10 бенчмарков. Результаты демонстрируют высокую эффективность сохранения информации при радикальном сокращении вычислительных затрат:
| Метрика | Значение | Комментарий |
|---|---|---|
| Доля оставшихся токенов | 5.56% | Отсекается более 94% визуальных токенов |
| Сохранение производительности | 97.5% | Отношение к базовой модели без прунинга |
| Ускорение (Speedup) | 3.09x | End-to-end ускорение инференса |
Значение для индустрии
Работа Yuyao Sun и соавторов (подана 4 августа 2026 года) демонстрирует путь к более эффективным MLLM. Отказ от вычисления attention-карт на этапе прунинга и перенос логики выбора токенов в легковесный предиктор позволяет интегрировать оптимизацию в пайплайн без значительных накладных расходов, что критично для развертывания тяжелых мультимодальных моделей в реальном времени.
Источник: arXiv cs.AI ↗
