Исследования2 июля 2026 г., 13:15 МСК🤖 Auto

SLIM-RL: Прорыв в обучении диффузионных LLM без разрезания траекторий

Исследователи представили SLIM-RL — метод обучения с подкреплением для диффузионных LLM, который превосходит TraceRL по точности и экономит вычислительные ресурсы за счет управления рисками.

Баннер новости 2797

Проблема существующих методов

Текущий стандарт в обучении диффузионных больших языковых моделей (dLLM), метод TraceRL, опирается на «осознание траектории» (trajectory-aware). Он предполагает, что случайное маскирование (random masking) несовместимо с траекторией вывода модели, поэтому во время обучения он реконструирует эту траекторию, разрезая каждый роллаут (rollout) на до K/s обучающих сэмплов. Этот подход требует значительных вычислительных затрат, которые растут пропорционально размеру блока K.

Решение SLIM-RL

Авторы работы (Ruikang Zhao, Zhenting Wang, Han Gao, Ligong Han) доказали, что это несовпадение можно устранить без реконструкции траектории. Их метод, SLIM-RL (Risk-Budgeted Random-Masking RL), использует tau-budget decoder для ограничения риска коммита на каждом шаге роллаута. Это снижает совокупный риск в обучающих данных. Оптимизация происходит на этих контролируемых роллаутах с использованием trace-free random-masking objective, который комбинирует:

  • Важность выборки на уровне последовательности (sequence-level importance sampling);
  • Детерминированную квадратуру по уровням маскирования;
  • Новый график маскирования блоков, который монотонно убывает и сохраняет среднее значение (mean-preserving).

Результаты бенчмарков

Эксперименты проводились на модели SDAR-4B. SLIM-RL демонстрирует выдающиеся результаты, превосходя TraceRL как в математике, так и в программировании, при этом требуя меньше обучающих данных.

Метрика / Модель Результат SLIM-RL (SDAR-4B) Сравнение / Примечание
MATH500 (K=16) Match TraceRL best Использует только 0.46x обучающих сэмплов от TraceRL
MATH500 (Dynamic Sampling) +6.32% vs TraceRL Улучшение точности при сопоставимых условиях
GSM8K (Dynamic Sampling) +11.05% vs TraceRL Значительный прирост в решении задач
MATH500 (K=4) Превосходит LLaDA-8B Улучшение на 10.76% над более крупной моделью LLaDA-8B
MBPP (Code) +4.20% vs TraceRL Улучшение в генерации кода
HumanEval (Code) +3.65% vs TraceRL Улучшение в проверке кода

Значимость для индустрии

Метод SLIM-RL позволяет модели размером 4B (SDAR-4B) превосходить более крупные диффузионные модели (LLaDA-8B, Dream-7B) в математических задачах, оставаясь при этом уступающей авторегрессионной модели Qwen2.5-7B. Ключевое преимущество — переносимость: tau-budget decoder работает без дополнительного обучения (training-free) для различных архитектур, включая LLaDA, Dream и SDAR. Исходный код метода уже доступен.

Источник: arXiv cs.CL ↗