Релиз модели7 июля 2026 г., 11:45 МСК🤖 Auto

OrbitQuant: Квантование DiT-моделей без калибровки до 2 бит

Cantina Labs представили OrbitQuant — метод постобученного квантования (PTQ) для диффузионных трансформеров, позволяющий сжимать веса и активации до 2 бит без использования калибровочных данных.

Баннер новости 3021

Проблема: Дрейф активаций в DiT

Диффузионные трансформеры (DiT), такие как FLUX.1 и Wan 2.1, обеспечивают высокое качество генерации, но требуют огромных вычислительных ресурсов. Традиционные методы квантования (PTQ) часто терпят неудачу, потому что активации в DiT сильно меняются в зависимости от шага сэмплирования, промпта и ветвей CFG (Classifier-Free Guidance). Это заставляет перенастраивать калибровочные данные для каждой новой модели или модальности.

Решение: OrbitQuant и RPBH-вращение

Исследователи из Cantina Labs, USC и UIUC предложили OrbitQuant — метод, не требующий калибровочных данных (calibration-free). Ключевая идея заключается в использовании Randomized Permuted Block-Hadamard (RPBH) вращения. Эта операция преобразует активации в нормализованную базу, где каждая координата концентрируется вокруг известного маргинала. Это позволяет использовать единую таблицу кодов (Lloyd–Max codebook) для всех слоев, шагов и промптов. Вращение «вшивается» в веса модели на этапе оффлайн-подготовки, поэтому во время инференса требуется только легкое вращение активаций.

Результаты: Качество и скорость

OrbitQuant демонстрирует рекордные результаты для методов без калибровки. На бенчмарке GenEval для модели FLUX.1-dev метод W4A4 (4 бита для весов и активаций) превосходит аналоги, а метод W2A4 (2 бита) сохраняет пригодное для использования качество генерации, тогда как другие методы (QuaRot, SmoothQuant) коллапсируют до почти нулевых показателей.

Сравнение с состоянием искусства (SOTA)

Ниже приведены результаты на модели FLUX.1-dev (GenEval) и Wan 2.1-1.3B (VBench). Обратите внимание на разрыв между OrbitQuant и другими методами при квантовании до 2 бит.

Метод Биты GenEval (FLUX.1-dev) VBench Overall (Wan 2.1-1.3B)
FP16 (Референс) 16 0.667 24.67
SVDQuant W4A4 0.573 21.91
QuaRot W4A4 0.243 17.98
OrbitQuant W4A4 0.633 23.86
QuaRot W2A4 0.001
OrbitQuant W2A4 0.475

Производительность и память

На GPU NVIDIA H100 OrbitQuant является самым быстрым методом PTQ среди методов, использующих и веса, и активации. Для генерации изображений (FLUX.1-dev) пиковое потребление памяти OrbitQuant совпадает с BF16, а задержка инференса ниже, чем у SmoothQuant (1.09x быстрее) и QuaRot (1.28x быстрее). Для видео (Wan 2.1-1.3B) метод также показывает лучшие показатели по скорости при сопоставимом качестве.

Значение для индустрии

OrbitQuant делает возможным развертывание крупных моделей генерации изображений и видео на ресурсоограниченных устройствах. Возможность работы с 2-битными весами без потери визуального качества открывает путь к локальному хостингу мощных DiT-моделей с минимальными затратами на память и вычисления.

Источник: Github ↗