Исследования29 июля 2026 г., 08:16 МСК🤖 Auto

CaRE: Почему оценки MDLM-моделей были ложными

Исследователи из CaRE доказали, что 70% успеха новых методов маскирования — это просто настройка температуры. Новый протокол стандартизирует тесты для диффузионных языковых моделей.

Баннер новости 4604

Проблема: «Яблоки с апельсинами» в оценке MDLM

Masked Diffusion Language Models (MDLM) стремительно развиваются, но индустрия столкнулась с критическим тупиком: последние 7 исследований по ремаскированию (remasking) используют несовместимые метрики. Авторы разных работ сравнивают стратегии, меняя количество шагов (NFE), метрики качества и температуру выборки (sampling temperature) одновременно. Это делает невозможным честное сравнение: невозможно понять, улучшилась ли модель алгоритмически или просто «подкрутили» параметры генерации.

Решение: Протокол CaRE

Команда исследователей (Yash Shah, Abhijit Chakraborty, Vivek Gupta) представила CaRE (Compute-aware Remasking Evaluation) — фреймворк, который:

  • Стандартизирует фактическое количество вычислительных функций (NFE).
  • Требует отчетов по множеству метрик одновременно.
  • Жестко контролирует стохастичность (случайность) процесса.

Ключевые открытия: Температура — главный драйвер

Применив CaRE к моделям LLaDA-8B-Base и Dream-7B-Base на датасетах OpenWebText и LM1B, ученые выявили шокирующие факты. Оказалось, что большинство заявленных прорывов в эффективности ремаскирования были артефактами тестирования.

Фактор влияния Влияние на результат (MAUVE) Вывод
Температура выборки Объясняет большинство дисперсии MAUVE Основной источник «улучшений» в старых тестах
Вычислительная мощность (NFE) Сравнение при равных затратах меняет рейтинги Многие стратегии проигрывают, если дать им равные ресурсы
Высокоэнтропийное ремаскирование Снижает MAUVE на 0.296 при 256 шагах Эффективно только при низкой температуре (0.25)

Почему это важно для индустрии

Исследование показало, что informed remasking (информированное ремаскирование) и stochastic unmasking (стохастическое снятие маски) находятся в напряжении. Высокая энтропия помогает только при строго контролируемой случайности. Без стандарта CaRE разработчики могут тратить месяцы на оптимизацию алгоритмов, которые не дадут прироста в реальных условиях.

Авторы опубликовали полный код, протокол и лидерборд для 12 открытых MDLM-моделей (от 150M до 8B параметров), чтобы в будущем любые заявления о превосходстве новых методов можно было проверить объективно.

Источник: arXiv cs.AI ↗