Проблема случайного маскирования
Традиционный подход к обучению дискретных диффузионных языковых моделей (Diffusion LMs) через контролируемое дообучение (SFT) часто использует равномерное случайное маскирование токенов. Этот метод не учитывает сложное взаимодействие между доступным контекстом и токенами, которые модель должна предсказать. В результате модель может тратить вычислительные ресурсы на обучение менее значимым паттернам, упуская возможность максимизировать полезность предоставленной информации.
Решение: GoldiMask
Авторы работы (Loay Mualem, Lluís Pastor-Pérez, Vinh Tong и др.) предложили алгоритм GoldiMask. Его ключевая особенность — выбор токенов для раскрытия в качестве контекста путем аппроксимации максимизации субмодулярной целевой функции. Эта функция балансирует пользу от раскрытия токенов против их ценности как целей предсказания, используя внутренние сигналы модели.
После выбора контекста, оставшиеся целевые токены взвешиваются на основе того, насколько они выигрывают от выбранного контекста, и их оставшегося потенциала обучения.
Результаты и метрики
Эксперименты проводились на трех архитектурных основах (backbones) и трех наборах данных. GoldiMask показал наивысшую среднюю точность в большинстве оцененных настроек, демонстрируя значительные улучшения как в задачах логического рассуждения, так и в генерации кода. Аблиционные исследования подтвердили, что как выбор контекста, так и взвешивание целей вносят вклад в общий прирост.
Особое внимание уделено эффективности декодирования. Метод позволяет сократить количество итераций декодирования на бенчмарках GSM8K и MATH-500 при использовании параллельного декодирования с порогом уверенности, сохраняя при этом сопоставимую точность на более высоких порогах.
| Критерий | Описание эффекта GoldiMask |
|---|---|
| Точность | Наивысшая средняя точность в большинстве настроек (3 backbones, 3 датасета) |
| Генерация кода | Заметный прирост качества сгенерированного кода |
| Логика (GSM8K, MATH-500) | Снижение количества итераций декодирования при сохранении точности |
| Методология | Субмодулярная оптимизация контекста + взвешивание целей |
Значение для индустрии
Работа демонстрирует, что оптимизация самого процесса обучения (выбор того, что скрывать и что предсказывать) может быть столь же важна, как и архитектура модели. Для разработчиков, работающих с диффузионными моделями, GoldiMask предлагает способ повысить эффективность обучения и скорость инференса без изменения базовой архитектуры.
Источник: arXiv cs.AI ↗
