Релиз модели10 сентября 2026 г., 13:47 МСК🤖 Auto

Uno: Диффузия без потерь для LLM от Cerebras и UIUC

Исследователи из Cerebras и UIUC представили модель Uno, объединяющую AR-архитектуру с дискретной диффузией. Это решение обеспечивает ускорение до 2.5x без потери качества и дополнительных моделей-черновиков.

Баннер новости 7167

Новая архитектура: AR + Диффузия

Команда разработала класс моделей diffusion-augmented LLMs, который использует два набора весов. Первый набор (AR-веса) обучается стандартным методом Next Token Prediction (NTP) для обеспечения высокого качества генерации. Второй набор — легкие диффузионные веса — обучается для одновременной генерации нескольких токенов. Архитектура позволяет интегрировать диффузионный процесс непосредственно в логическое ядро модели, избегая необходимости в отдельной модели-черновике (draft model), что характерно для традиционного speculative decoding.

Технология -Spec samplers

Ключевым инновационным элементом стал алгоритм -Spec samplers. Он позволяет генерировать токены параллельно, строго следуя распределению AR-весов. Это гарантирует lossless speedups (ускорение без потерь в качестве вывода). В отличие от методов, требующих дополнительной памяти для хранения черновиков, Uno вносит минимальный оверхед в параметры и потребление GPU-памяти.

Сравнение с конкурентами

Модель Uno (8B параметров) демонстрирует превосходство над существующими решениями как в эффективности вычислений, так и в качестве. Ниже приведено сравнение с ключевыми альтернативами:

Метод/Модель Параметры (доп.) Потребление памяти (GPU) Ускорение (Speedup) Качество (Benchmarks)
Uno (8B) Минимальное Низкое До 2.5x (vs Base AR) Лучший результат (Agentic, Coding, Long-context)
DFlash (Speculative) Высокое Высокое Ниже Uno Уступает Uno
Eagle3 (Speculative) Высокое Высокое Ниже Uno Уступает Uno
DiffusionGemma (26B) Uno (8B) превосходит её
Mercury 2 (Proprietary) Uno (8B) превосходит её

Практическая значимость

Результаты показывают, что Uno доминирует по кривой Парето: при любом размере батча (batch size) и уровне конкурентности (concurrency) система обеспечивает более высокую пропускную способность (throughput), чем методы спекулятивного декодирования. Модель успешно прошла тесты на агентных инструментах, написании кода и работе с длинным контекстом, доказав, что диффузионная augmentation не вредит, а усиливает способности базовой AR-модели.

Источник: S-sahoo ↗