Проблема: «Яблоки с апельсинами» в оценке MDLM
Masked Diffusion Language Models (MDLM) стремительно развиваются, но индустрия столкнулась с критическим тупиком: последние 7 исследований по ремаскированию (remasking) используют несовместимые метрики. Авторы разных работ сравнивают стратегии, меняя количество шагов (NFE), метрики качества и температуру выборки (sampling temperature) одновременно. Это делает невозможным честное сравнение: невозможно понять, улучшилась ли модель алгоритмически или просто «подкрутили» параметры генерации.
Решение: Протокол CaRE
Команда исследователей (Yash Shah, Abhijit Chakraborty, Vivek Gupta) представила CaRE (Compute-aware Remasking Evaluation) — фреймворк, который:
- Стандартизирует фактическое количество вычислительных функций (NFE).
- Требует отчетов по множеству метрик одновременно.
- Жестко контролирует стохастичность (случайность) процесса.
Ключевые открытия: Температура — главный драйвер
Применив CaRE к моделям LLaDA-8B-Base и Dream-7B-Base на датасетах OpenWebText и LM1B, ученые выявили шокирующие факты. Оказалось, что большинство заявленных прорывов в эффективности ремаскирования были артефактами тестирования.
| Фактор влияния | Влияние на результат (MAUVE) | Вывод |
|---|---|---|
| Температура выборки | Объясняет большинство дисперсии MAUVE | Основной источник «улучшений» в старых тестах |
| Вычислительная мощность (NFE) | Сравнение при равных затратах меняет рейтинги | Многие стратегии проигрывают, если дать им равные ресурсы |
| Высокоэнтропийное ремаскирование | Снижает MAUVE на 0.296 при 256 шагах | Эффективно только при низкой температуре (0.25) |
Почему это важно для индустрии
Исследование показало, что informed remasking (информированное ремаскирование) и stochastic unmasking (стохастическое снятие маски) находятся в напряжении. Высокая энтропия помогает только при строго контролируемой случайности. Без стандарта CaRE разработчики могут тратить месяцы на оптимизацию алгоритмов, которые не дадут прироста в реальных условиях.
Авторы опубликовали полный код, протокол и лидерборд для 12 открытых MDLM-моделей (от 150M до 8B параметров), чтобы в будущем любые заявления о превосходстве новых методов можно было проверить объективно.
Источник: arXiv cs.AI ↗
