Проблема выбора бэкбона
Выбор базовой языковой модели (LLM) для Vision-Language Model (VLM) долгое время оставался эмпирическим процессом. Существующие законы масштабирования, основанные на вычислительной сложности, не обобщаются между семействами моделей, а предсказать итоговую точность до начала обучения было невозможно. Команда исследователей во главе с Цзыранем Ли (Ziran Li) предложила первую кросс-семейную рамку — Capability-Driven Multimodal Scaling Law, которая связывает текстовые способности LLM с производительностью VLM.
Методология и масштаб эксперимента
Для валидации фреймворка была проведена масштабная работа: обучено более 150 VLM на базе 34 LLM, охватывающих 7 различных семейств моделей. Эксперименты проводились при строго контролируемых условиях. Оценка производилась на более чем 200 текстовых и 50 мультимодальных бенчмарках. Ключевым индикатором стала низкоразмерная оценка способности ($S$), извлеченная из текстовых бенчмарков с помощью PCA.
Ключевые метрики и точность предсказаний
Предложенная модель позволяет экстраполировать скорость передачи знаний (transfer rate) от моделей до 8B параметров к бэкбонам масштаба 72B. Фреймворк с высокой точностью предсказывает полные траектории обучения VLM и обобщается на совершенно новые, ранее не встречавшиеся семейства моделей. Это превращает выбор бэкбона из дорогостоящего перебора в количественное решение.
Важные инсайты: Instruction-tuning vs Base
Анализ выявил парадоксальный результат: базовые LLM (pre-trained) часто превосходят модели с инструктивным дообучением (instruction-tuned) в роли бэкбонов для VLM. Это связано с тем, что базовые модели имеют более высокие показатели поглощения (absorption rate) и меньшую деградацию при масштабировании данных. Кроме того, обнаружена негативная корреляция между некоторыми текстовыми бенчмарками и мультимодальной производительностью, что указывает на «гейминг» (накрутку) результатов в текстовых тестах.
| Параметр исследования | Значение / Описание |
|---|---|
| Количество обученных VLM | > 150 моделей |
| Количество базовых LLM | 34 модели |
| Охват семейств моделей | 7 различных семейств |
| Масштаб экстраполяции | От 8B до 72B параметров |
| Количество бенчмарков | > 200 текстовых, > 50 мультимодальных |
Практическая значимость
Представленный фреймворк позволяет инженерам предсказывать эффективность мультимодальной модели, используя только данные о текстовых способностях бэкбона. Это значительно снижает затраты на вычислительные ресурсы и время разработки, исключая необходимость обучения множества кандидатов «вслепую».
Источник: arXiv cs.CL ↗
