Проблема существующих методов
Текущий стандарт в обучении диффузионных больших языковых моделей (dLLM), метод TraceRL, опирается на «осознание траектории» (trajectory-aware). Он предполагает, что случайное маскирование (random masking) несовместимо с траекторией вывода модели, поэтому во время обучения он реконструирует эту траекторию, разрезая каждый роллаут (rollout) на до K/s обучающих сэмплов. Этот подход требует значительных вычислительных затрат, которые растут пропорционально размеру блока K.
Решение SLIM-RL
Авторы работы (Ruikang Zhao, Zhenting Wang, Han Gao, Ligong Han) доказали, что это несовпадение можно устранить без реконструкции траектории. Их метод, SLIM-RL (Risk-Budgeted Random-Masking RL), использует tau-budget decoder для ограничения риска коммита на каждом шаге роллаута. Это снижает совокупный риск в обучающих данных. Оптимизация происходит на этих контролируемых роллаутах с использованием trace-free random-masking objective, который комбинирует:
- Важность выборки на уровне последовательности (sequence-level importance sampling);
- Детерминированную квадратуру по уровням маскирования;
- Новый график маскирования блоков, который монотонно убывает и сохраняет среднее значение (mean-preserving).
Результаты бенчмарков
Эксперименты проводились на модели SDAR-4B. SLIM-RL демонстрирует выдающиеся результаты, превосходя TraceRL как в математике, так и в программировании, при этом требуя меньше обучающих данных.
| Метрика / Модель | Результат SLIM-RL (SDAR-4B) | Сравнение / Примечание |
|---|---|---|
| MATH500 (K=16) | Match TraceRL best | Использует только 0.46x обучающих сэмплов от TraceRL |
| MATH500 (Dynamic Sampling) | +6.32% vs TraceRL | Улучшение точности при сопоставимых условиях |
| GSM8K (Dynamic Sampling) | +11.05% vs TraceRL | Значительный прирост в решении задач |
| MATH500 (K=4) | Превосходит LLaDA-8B | Улучшение на 10.76% над более крупной моделью LLaDA-8B |
| MBPP (Code) | +4.20% vs TraceRL | Улучшение в генерации кода |
| HumanEval (Code) | +3.65% vs TraceRL | Улучшение в проверке кода |
Значимость для индустрии
Метод SLIM-RL позволяет модели размером 4B (SDAR-4B) превосходить более крупные диффузионные модели (LLaDA-8B, Dream-7B) в математических задачах, оставаясь при этом уступающей авторегрессионной модели Qwen2.5-7B. Ключевое преимущество — переносимость: tau-budget decoder работает без дополнительного обучения (training-free) для различных архитектур, включая LLaDA, Dream и SDAR. Исходный код метода уже доступен.
Источник: arXiv cs.CL ↗
