Суть прорыва: от токена к блоку
Традиционные большие языковые модели (LLM) генерируют текст токеном за токеном, что создает узкое место в скорости вывода. Команда Google представила DiffusionGemma — модель на базе архитектуры Gemma 4, которая использует дискретную диффузию для параллельной генерации блоков из 256 токенов за один forward pass. Это позволяет избежать последовательного bottleneck, характерного для автоорегрессионных (AR) моделей.
Архитектура и эффективность обучения
Модель не обучалась с нуля. Исследователи провели fine-tuning существующей MoE-модели Gemma 4. Ключевые параметры:
- Общее число параметров: 25.2B
- Активированные параметры: 3.8B
- Стоимость обучения: Менее 10% от бюджета исходной AR-модели.
Процесс состоял из двух этапов: сначала supervised fine-tuning (SFT) для обучения двунаправленному денуайзингу, затем reinforcement learning (RL) с дистилляцией самплера для улучшения качества и скорости.
Производительность: новые метрики скорости
DiffusionGemma устанавливает новую границу Парето между скоростью и качеством. На одном GPU NVIDIA H100 модель генерирует около 1,500 токенов в секунду. Это существенно быстрее, чем AR-модели, даже с использованием state-of-the-art speculative decoding.
| Характеристика | DiffusionGemma | Стандартные AR-модели (с Speculative Decoding) |
|---|---|---|
| Механизм генерации | Параллельный (блоки по 256 токенов) | Последовательный (1 токен за шаг) |
| Скорость (H100) | ~1,500 токенов/сек | Значительно ниже (зависит от модели, но уступает в 2-3 раза) |
| Поддержка Thinking Mode | Да | Да |
| Мультимодальность | Да | Да |
| Длина контекста | Long context support | Long context support |
Гибридный потенциал
Важно отметить, что несмотря на диффузионную природу, DiffusionGemma сохраняет способность к автоорегрессионной генерации с минимальной потерей качества. Это открывает путь к созданию гибридных моделей, сочетающих преимущества обоих подходов: скорость диффузии для черновиков и точность AR для финальной полировки.
Источник: arXiv cs.CL ↗
