Суть эксперимента: от 1.58 бит к 1.64 эффективных
Команда исследователей (Anirudh Malik, M Sparsh Mehra, Poojith Devan) применила к instruction-tuned модели Qwen3-4B сложный стек пост-тренировочной оптимизации. В процесс вошли вращение весов KOTMS, тернаризация E2M-ATQ и компенсация ошибок по методу GPTQ. Важно отметить: квантование затронуло только веса (weight-only), активации остались в 16-битном формате (FP16), что исключило использование ILA-AMP.
Итоговый показатель эффективного битового бюджета составил 1.641 бит на вес, при этом было квантовано 81.62% параметров модели. Это позволяет говорить о высокой степени сжатия, но требует детального анализа потерь.
Цена сжатия: падение точности и рост перплексии
Результаты оценки способности модели (capability retention) показали значительное, но неравномерное снижение качества. Средняя точность упала с 64.5% до 54.7% по десяти тестовым наборам. Модель сохранила хорошие навыки в задачах на понимание текста (BoolQ — 84.6% от оригинала), но сильно проиграла в логических рассуждениях (ARC-Challenge — всего 43.8%).
Метрика перплексии (PPL) на тестовых корпусах также выросла, что свидетельствует о снижении качества генерации текста:
| Метрика / Датасет | Оригинал (Qwen3-4B) | Тернаризованная версия |
|---|---|---|
| Perplexity (WikiText-2) | 13.639 | 18.748 |
| Perplexity (PTB) | 24.700 | 31.992 |
| Perplexity (C4) | 19.831 | 28.966 |
| Средняя точность (10 наборов) | 64.5% | 54.7% |
Упаковка и хранение: экономия места
Отдельный этап упаковки (packing) позволил сохранить тернарные плоскости и масштабы, существенно сократив объем чекпоинта. Изначальный размер модели в 8.29 GiB был уменьшен до 3.96 GiB практически без дополнительных потерь перплексии. Примечательно, что попытка сторонней упаковки оказалась убыточной (lossy) и была исключена из основного артефакта.
Деплой: скорость против размера
Главный вопрос для разработчиков — ускорит ли такое сжатие инференс. Preliminary-бенчмарки на микроуровне (Triton GEMV) показали обратный эффект: скорость выполнения оказалась в 4.6 раза ниже, чем у стандартного FP16 cuBLAS на протестированной форме. Авторы прямо заявляют, что на данном этапе сжатие само по себе не обеспечивает ускорения вывода, а требует дальнейшей оптимизации вычислительных ядер.
Источник: arXiv cs.AI ↗
