Исследования1 октября 2026 г., 05:19 МСК🤖 Auto

Слои VLA: Инфо-теоретический анализ скрытого интерфейса

Исследователи доказали, что слияние слоев в VLA-моделях часто бесполезно, а метрика InfoNCE позволяет выбирать оптимальный слой в 33 раза быстрее без обучения.

Баннер новости 8659

Проблема выбора слоев в VLA

Визуально-языковые модели действий (VLA) соединяют предварительно обученный визуальный языковой бэкбон с головой действий через скрытый интерфейс. Ключевой вопрос, на который ответили авторы работы "The Layer Mystery of VLA" (arXiv:2609.36118), заключается в том, какие именно слои бэкбона следует экспонировать для максимальной эффективности. Исследование охватывает три предварительно обученные модели и два бенчмарка манипуляции: LIBERO и CALVIN.

Провал многоуровневого слияния

Авторы протестировали стратегии одиночного выбора слоев и многоуровневого слияния для замороженных бэкбонов. Результаты оказались неожиданными: из 54 протестированных конфигураций 47 показали худшие результаты по сравнению с лучшей политикой одиночного слоя. Статистический анализ подтвердил, что преимущество слияния слоев крайне ограничено, а выбор конкретного слоя критически важен и сильно варьируется в зависимости от модели и задачи.

InfoNCE как прокси-метрика

Для решения проблемы дорогостоящих переборов (policy sweeps) исследователи вывели эквивалентность между целями информационного бутылочного горлышка (information-bottleneck) для action-conditioned InfoNCE и предсказания действий. Эмпирически метрика InfoNCE показала наиболее стабильную положительную корреляцию с успехом политики среди четырех протестированных прокси-метрик.

Экономия вычислений и точность

Использование InfoNCE для выбора слоя требует в 9–33 раза меньше GPU-вычислений по сравнению с исчерпывающими переборами. Средний регрет (regret) при выборе слоя через InfoNCE составляет 3.71 процентных пункта, что близко к 3.28–3.50 пунктам, достигаемым эвристиками, оптимизированными ретроспективно с использованием всех шести оракульных переборов. При этом метод не требует закрытых циклических оценок (closed-loop evaluations) в процессе выбора.

Метрика/Подход Средний регрет (pp) Вычислительная стоимость
InfoNCE (предложенный метод) 3.71 В 9-33 раза быстрее перебора
Best Single-Layer (эталон) ~0 (базовый) Требует полного перебора
Deepest-Layer Selection 17.89 Низкая, но неэффективная
Retrospective Heuristics 3.28 - 3.50 Требует всех 6 оракульных переборов

Значение для индустрии

Работа демонстрирует, что сложные механизмы слияния слоев в VLA-архитектурах часто избыточны. Предложенный подход на основе InfoNCE позволяет инженерам быстро и дешево настраивать интерфейсы между VLM и модулями действий, избегая ресурсоемких экспериментов с замкнутым контуром.

Источник: arXiv cs.AI ↗