Исследования4 августа 2026 г., 09:16 МСК🤖 Auto

Новый закон масштабирования VLM: как выбрать LLM-бэкбон без перебора

Исследователи представили Capability-Driven Multimodal Scaling Law, позволяющую предсказывать точность мультимодальных моделей по текстовым бенчмаркам, экономя месяцы обучения.

Баннер новости 5019

Проблема выбора бэкбона

Выбор базовой языковой модели (LLM) для Vision-Language Model (VLM) долгое время оставался эмпирическим процессом. Существующие законы масштабирования, основанные на вычислительной сложности, не обобщаются между семействами моделей, а предсказать итоговую точность до начала обучения было невозможно. Команда исследователей во главе с Цзыранем Ли (Ziran Li) предложила первую кросс-семейную рамку — Capability-Driven Multimodal Scaling Law, которая связывает текстовые способности LLM с производительностью VLM.

Методология и масштаб эксперимента

Для валидации фреймворка была проведена масштабная работа: обучено более 150 VLM на базе 34 LLM, охватывающих 7 различных семейств моделей. Эксперименты проводились при строго контролируемых условиях. Оценка производилась на более чем 200 текстовых и 50 мультимодальных бенчмарках. Ключевым индикатором стала низкоразмерная оценка способности ($S$), извлеченная из текстовых бенчмарков с помощью PCA.

Ключевые метрики и точность предсказаний

Предложенная модель позволяет экстраполировать скорость передачи знаний (transfer rate) от моделей до 8B параметров к бэкбонам масштаба 72B. Фреймворк с высокой точностью предсказывает полные траектории обучения VLM и обобщается на совершенно новые, ранее не встречавшиеся семейства моделей. Это превращает выбор бэкбона из дорогостоящего перебора в количественное решение.

Важные инсайты: Instruction-tuning vs Base

Анализ выявил парадоксальный результат: базовые LLM (pre-trained) часто превосходят модели с инструктивным дообучением (instruction-tuned) в роли бэкбонов для VLM. Это связано с тем, что базовые модели имеют более высокие показатели поглощения (absorption rate) и меньшую деградацию при масштабировании данных. Кроме того, обнаружена негативная корреляция между некоторыми текстовыми бенчмарками и мультимодальной производительностью, что указывает на «гейминг» (накрутку) результатов в текстовых тестах.

Параметр исследования Значение / Описание
Количество обученных VLM > 150 моделей
Количество базовых LLM 34 модели
Охват семейств моделей 7 различных семейств
Масштаб экстраполяции От 8B до 72B параметров
Количество бенчмарков > 200 текстовых, > 50 мультимодальных

Практическая значимость

Представленный фреймворк позволяет инженерам предсказывать эффективность мультимодальной модели, используя только данные о текстовых способностях бэкбона. Это значительно снижает затраты на вычислительные ресурсы и время разработки, исключая необходимость обучения множества кандидатов «вслепую».

Источник: arXiv cs.CL ↗