Исследования10 августа 2026 г., 08:18 МСК🤖 Auto

MAP: Прунинг визуальных токенов в MLLM без лишних вычислений

Исследователи представили метод MAP, который предсказывает важность визуальных токенов до входа в языковую модель, обеспечивая ускорение LLaVA-NeXT-7B в 3 раза при сохранении 97.5% качества.

Баннер новости 5407

Проблема: фиксированные слои неэффективны

Мультимодальные большие языковые модели (MLLM) сталкиваются с узким местом в виде огромного количества визуальных токенов. Существующие методы прунинга часто используют внимание (attention) из фиксированного среднего слоя для оценки важности токенов. Однако анализ показал, что слой, наиболее чувствительный к вопросу, варьируется от примера к примеру. Использование одного фиксированного слоя приводит к субопимальным результатам, а вычисление внимания в нужном слое требует предварительной обработки токенов, что нивелирует экономию.

Решение: Middle-layer Attention Prediction (MAP)

Авторы предлагают метод MAP, который решает две проблемы сразу. Во-первых, он использует Question Contrastive Teacher Selection для выбора «учительского» слоя, специфичного для каждого запроса, сравнивая внимание при оригинальном и эталонном вопросах. Во-вторых, внимание из выбранного слоя дистиллируется в легковесный предиктор, который оценивает важность визуальных токенов на основе мультимодальных входных признаков.

Ключевое преимущество: во время инференса MAP комбинирует предсказанные оценки важности с критерием разнообразия для прунинга токенов до первого слоя языковой модели. Это означает, что карта внимания для отсечения не требуется, и метод совместим с существующими техниками ускорения.

Результаты: 3.09x ускорение при 97.5% качества

Метод был протестирован на модели LLaVA-NeXT-7B в рамках 10 бенчмарков. Результаты демонстрируют высокую эффективность сохранения информации при радикальном сокращении вычислительных затрат:

Метрика Значение Комментарий
Доля оставшихся токенов 5.56% Отсекается более 94% визуальных токенов
Сохранение производительности 97.5% Отношение к базовой модели без прунинга
Ускорение (Speedup) 3.09x End-to-end ускорение инференса

Значение для индустрии

Работа Yuyao Sun и соавторов (подана 4 августа 2026 года) демонстрирует путь к более эффективным MLLM. Отказ от вычисления attention-карт на этапе прунинга и перенос логики выбора токенов в легковесный предиктор позволяет интегрировать оптимизацию в пайплайн без значительных накладных расходов, что критично для развертывания тяжелых мультимодальных моделей в реальном времени.

Источник: arXiv cs.AI ↗