Проблема выбора слоев в VLA
Визуально-языковые модели действий (VLA) соединяют предварительно обученный визуальный языковой бэкбон с головой действий через скрытый интерфейс. Ключевой вопрос, на который ответили авторы работы "The Layer Mystery of VLA" (arXiv:2609.36118), заключается в том, какие именно слои бэкбона следует экспонировать для максимальной эффективности. Исследование охватывает три предварительно обученные модели и два бенчмарка манипуляции: LIBERO и CALVIN.
Провал многоуровневого слияния
Авторы протестировали стратегии одиночного выбора слоев и многоуровневого слияния для замороженных бэкбонов. Результаты оказались неожиданными: из 54 протестированных конфигураций 47 показали худшие результаты по сравнению с лучшей политикой одиночного слоя. Статистический анализ подтвердил, что преимущество слияния слоев крайне ограничено, а выбор конкретного слоя критически важен и сильно варьируется в зависимости от модели и задачи.
InfoNCE как прокси-метрика
Для решения проблемы дорогостоящих переборов (policy sweeps) исследователи вывели эквивалентность между целями информационного бутылочного горлышка (information-bottleneck) для action-conditioned InfoNCE и предсказания действий. Эмпирически метрика InfoNCE показала наиболее стабильную положительную корреляцию с успехом политики среди четырех протестированных прокси-метрик.
Экономия вычислений и точность
Использование InfoNCE для выбора слоя требует в 9–33 раза меньше GPU-вычислений по сравнению с исчерпывающими переборами. Средний регрет (regret) при выборе слоя через InfoNCE составляет 3.71 процентных пункта, что близко к 3.28–3.50 пунктам, достигаемым эвристиками, оптимизированными ретроспективно с использованием всех шести оракульных переборов. При этом метод не требует закрытых циклических оценок (closed-loop evaluations) в процессе выбора.
| Метрика/Подход | Средний регрет (pp) | Вычислительная стоимость |
|---|---|---|
| InfoNCE (предложенный метод) | 3.71 | В 9-33 раза быстрее перебора |
| Best Single-Layer (эталон) | ~0 (базовый) | Требует полного перебора |
| Deepest-Layer Selection | 17.89 | Низкая, но неэффективная |
| Retrospective Heuristics | 3.28 - 3.50 | Требует всех 6 оракульных переборов |
Значение для индустрии
Работа демонстрирует, что сложные механизмы слияния слоев в VLA-архитектурах часто избыточны. Предложенный подход на основе InfoNCE позволяет инженерам быстро и дешево настраивать интерфейсы между VLM и модулями действий, избегая ресурсоемких экспериментов с замкнутым контуром.
Источник: arXiv cs.AI ↗
