Суть проблемы: модальный разрыв
Мультимодальные большие языковые модели (MLLM) часто демонстрируют нестабильность при обработке семантически эквивалентных данных. Авторы исследования ввели понятие modality gap (модальный разрыв) — разницу в производительности модели при ответе на текстовый запрос и на запрос, где ключевые концепции заменены на изображения. Оказалось, что модели не способны одинаково точно интерпретировать один и тот же смысл, представленный в разных модальностях.
Методология TokenSwap и результаты
Для измерения этого феномена команда создала метод TokenSwap, который генерирует входные последовательности, чередуя текстовые токены с визуальными. На основе этого подхода они трансформировали известный текстовый бенчмарк MMLU в TokenSwap-Bench. Тестирование 42 различных MLLM показало катастрофическое падение точности при переходе от чистого текста к смешанным данным.
| Категория моделей | Средний модальный разрыв | Диапазон падения точности |
|---|---|---|
| Модели с рассуждением (Reasoning) | 10.1% | Меньше, чем у обычных |
| Обычные MLLM (Non-reasoning) | 25.5% | До 47.4% |
| Среднее по всем 42 моделям | 19.6% ± 3.3% | 4.2% – 47.4% |
Почему стандартные методы не работают
Исследователи проверили, можно ли сократить разрыв за счет улучшения промптов (prompting strategies) или простого увеличения вычислительных ресурсов при обучении (scaling training compute). Результаты показали, что ни один из этих подходов не дает стабильного снижения модального разрыва. Проблема носит системный характер архитектуры, а не недостатка данных или инструкций.
Решение: обучение через TokenSwap
Единственным эффективным решением стало включение данных формата TokenSwap непосредственно в процесс обучения. Интеграция таких смешанных последовательностей (где визуальные токены перемешаны с текстовыми) позволила моделям выровнять свои представления между модальностями. Важно отметить, что этот метод не только устранил разрыв, но и сохранил высокую точность на стандартных текстовых и визуальных задачах, не деградируя общие способности модели.
Источник: arXiv cs.CL ↗
