Проблема «черного ящика» в диффузионных моделях
Традиционные LLM генерируют текст токеном за токеном, что позволяет отслеживать цепочки рассуждений (Chain-of-Thought). DiffusionGemma (DG) работает иначе: она использует обратную диффузию, где между шагами передаются не только токены, но и векторы распределения вероятностей. Это создает риск «непрозрачной серийной глубины» (opaque serial depth), когда внутреннее состояние модели становится нечитаемым для исследователей.
Развенчание мифа о потере производительности
Ранее исследователи (Engels et al.) заметили, что усечение распределения до топ-k токенов резко снижает качество ответов DG. Однако новое исследование показало, что это артефакт сэмплера, а не необходимость модели. При использовании более мягкого сэмплера и увеличении шагов диффузии модель сохраняет точность даже при работе только с топ-1 токеном.
| Параметр | Оригинальная настройка (Engels et al.) | Оптимизированная настройка (новое исследование) |
|---|---|---|
| Количество шагов диффузии (N) | 48 | 96 |
| Диапазон температуры | 0.8 – 0.4 | 1.0 – 0.5 |
| Граница энтропии (Entropy bound) | 0.1 | 0.02 |
| Результат усечения до Top-1 | Значительное падение метрик | Производительность сохраняется |
Редкий случай: параллельные вычисления в суперпозиции
Несмотря на общую прозрачность, исследователи нашли исключение — задачу «буквенной арифметики» (letter arithmetic). Модель должна сдвинуть букву на 3 позиции вперед в алфавите (например, G → J). В этом случае DG использует векторное распределение для удержания нескольких гипотез одновременно (суперпозиция), выполняя вычисления параллельно, а не последовательно.
Интерпретируемость техник
Стандартные методы интерпретируемости, такие как зонды (probes), управление (steering) и J-lens, успешно переносятся на DiffusionGemma. Это важный сигнал для индустрии: диффузионные модели, обученные на текстовых данных, могут быть столь же прозрачными, как и авторегрессионные аналоги, что упрощает их мониторинг и безопасность.
Источник: LessWrong ↗
