Проблема: Дрейф активаций в DiT
Диффузионные трансформеры (DiT), такие как FLUX.1 и Wan 2.1, обеспечивают высокое качество генерации, но требуют огромных вычислительных ресурсов. Традиционные методы квантования (PTQ) часто терпят неудачу, потому что активации в DiT сильно меняются в зависимости от шага сэмплирования, промпта и ветвей CFG (Classifier-Free Guidance). Это заставляет перенастраивать калибровочные данные для каждой новой модели или модальности.
Решение: OrbitQuant и RPBH-вращение
Исследователи из Cantina Labs, USC и UIUC предложили OrbitQuant — метод, не требующий калибровочных данных (calibration-free). Ключевая идея заключается в использовании Randomized Permuted Block-Hadamard (RPBH) вращения. Эта операция преобразует активации в нормализованную базу, где каждая координата концентрируется вокруг известного маргинала. Это позволяет использовать единую таблицу кодов (Lloyd–Max codebook) для всех слоев, шагов и промптов. Вращение «вшивается» в веса модели на этапе оффлайн-подготовки, поэтому во время инференса требуется только легкое вращение активаций.
Результаты: Качество и скорость
OrbitQuant демонстрирует рекордные результаты для методов без калибровки. На бенчмарке GenEval для модели FLUX.1-dev метод W4A4 (4 бита для весов и активаций) превосходит аналоги, а метод W2A4 (2 бита) сохраняет пригодное для использования качество генерации, тогда как другие методы (QuaRot, SmoothQuant) коллапсируют до почти нулевых показателей.
Сравнение с состоянием искусства (SOTA)
Ниже приведены результаты на модели FLUX.1-dev (GenEval) и Wan 2.1-1.3B (VBench). Обратите внимание на разрыв между OrbitQuant и другими методами при квантовании до 2 бит.
| Метод | Биты | GenEval (FLUX.1-dev) | VBench Overall (Wan 2.1-1.3B) |
|---|---|---|---|
| FP16 (Референс) | 16 | 0.667 | 24.67 |
| SVDQuant | W4A4 | 0.573 | 21.91 |
| QuaRot | W4A4 | 0.243 | 17.98 |
| OrbitQuant | W4A4 | 0.633 | 23.86 |
| QuaRot | W2A4 | 0.001 | — |
| OrbitQuant | W2A4 | 0.475 | — |
Производительность и память
На GPU NVIDIA H100 OrbitQuant является самым быстрым методом PTQ среди методов, использующих и веса, и активации. Для генерации изображений (FLUX.1-dev) пиковое потребление памяти OrbitQuant совпадает с BF16, а задержка инференса ниже, чем у SmoothQuant (1.09x быстрее) и QuaRot (1.28x быстрее). Для видео (Wan 2.1-1.3B) метод также показывает лучшие показатели по скорости при сопоставимом качестве.
Значение для индустрии
OrbitQuant делает возможным развертывание крупных моделей генерации изображений и видео на ресурсоограниченных устройствах. Возможность работы с 2-битными весами без потери визуального качества открывает путь к локальному хостингу мощных DiT-моделей с минимальными затратами на память и вычисления.
Источник: Github ↗
