Исследования16 августа 2026 г., 08:17 МСК🤖 Auto

DiffusionGemma: скрытые вычисления или прозрачность?

Исследование Google DeepMind показало, что DiffusionGemma сохраняет высокую интерпретируемость, но в редких случаях использует векторные распределения для параллельных вычислений.

Баннер новости 5874

Проблема «черного ящика» в диффузионных моделях

Традиционные LLM генерируют текст токеном за токеном, что позволяет отслеживать цепочки рассуждений (Chain-of-Thought). DiffusionGemma (DG) работает иначе: она использует обратную диффузию, где между шагами передаются не только токены, но и векторы распределения вероятностей. Это создает риск «непрозрачной серийной глубины» (opaque serial depth), когда внутреннее состояние модели становится нечитаемым для исследователей.

Развенчание мифа о потере производительности

Ранее исследователи (Engels et al.) заметили, что усечение распределения до топ-k токенов резко снижает качество ответов DG. Однако новое исследование показало, что это артефакт сэмплера, а не необходимость модели. При использовании более мягкого сэмплера и увеличении шагов диффузии модель сохраняет точность даже при работе только с топ-1 токеном.

Параметр Оригинальная настройка (Engels et al.) Оптимизированная настройка (новое исследование)
Количество шагов диффузии (N) 48 96
Диапазон температуры 0.8 – 0.4 1.0 – 0.5
Граница энтропии (Entropy bound) 0.1 0.02
Результат усечения до Top-1 Значительное падение метрик Производительность сохраняется

Редкий случай: параллельные вычисления в суперпозиции

Несмотря на общую прозрачность, исследователи нашли исключение — задачу «буквенной арифметики» (letter arithmetic). Модель должна сдвинуть букву на 3 позиции вперед в алфавите (например, G → J). В этом случае DG использует векторное распределение для удержания нескольких гипотез одновременно (суперпозиция), выполняя вычисления параллельно, а не последовательно.

Интерпретируемость техник

Стандартные методы интерпретируемости, такие как зонды (probes), управление (steering) и J-lens, успешно переносятся на DiffusionGemma. Это важный сигнал для индустрии: диффузионные модели, обученные на текстовых данных, могут быть столь же прозрачными, как и авторегрессионные аналоги, что упрощает их мониторинг и безопасность.

Источник: LessWrong ↗