Новая архитектура: AR + Диффузия
Команда разработала класс моделей diffusion-augmented LLMs, который использует два набора весов. Первый набор (AR-веса) обучается стандартным методом Next Token Prediction (NTP) для обеспечения высокого качества генерации. Второй набор — легкие диффузионные веса — обучается для одновременной генерации нескольких токенов. Архитектура позволяет интегрировать диффузионный процесс непосредственно в логическое ядро модели, избегая необходимости в отдельной модели-черновике (draft model), что характерно для традиционного speculative decoding.
Технология -Spec samplers
Ключевым инновационным элементом стал алгоритм -Spec samplers. Он позволяет генерировать токены параллельно, строго следуя распределению AR-весов. Это гарантирует lossless speedups (ускорение без потерь в качестве вывода). В отличие от методов, требующих дополнительной памяти для хранения черновиков, Uno вносит минимальный оверхед в параметры и потребление GPU-памяти.
Сравнение с конкурентами
Модель Uno (8B параметров) демонстрирует превосходство над существующими решениями как в эффективности вычислений, так и в качестве. Ниже приведено сравнение с ключевыми альтернативами:
| Метод/Модель | Параметры (доп.) | Потребление памяти (GPU) | Ускорение (Speedup) | Качество (Benchmarks) |
|---|---|---|---|---|
| Uno (8B) | Минимальное | Низкое | До 2.5x (vs Base AR) | Лучший результат (Agentic, Coding, Long-context) |
| DFlash (Speculative) | Высокое | Высокое | Ниже Uno | Уступает Uno |
| Eagle3 (Speculative) | Высокое | Высокое | Ниже Uno | Уступает Uno |
| DiffusionGemma (26B) | — | — | — | Uno (8B) превосходит её |
| Mercury 2 (Proprietary) | — | — | — | Uno (8B) превосходит её |
Практическая значимость
Результаты показывают, что Uno доминирует по кривой Парето: при любом размере батча (batch size) и уровне конкурентности (concurrency) система обеспечивает более высокую пропускную способность (throughput), чем методы спекулятивного декодирования. Модель успешно прошла тесты на агентных инструментах, написании кода и работе с длинным контекстом, доказав, что диффузионная augmentation не вредит, а усиливает способности базовой AR-модели.
Источник: S-sahoo ↗
