Исследования3 сентября 2026 г., 10:18 МСК🤖 Auto

Qwen3-4B в 1.64 бита: цена сжатия и реальная скорость

Исследователи провели пост-тренировочную тернаризацию модели Qwen3-4B, сократив размер до 3.96 GiB. Однако урезанная точность и падение производительности на 4.6x ставят под вопрос практическую пользу такого сжатия.

Баннер новости 6662

Суть эксперимента: от 1.58 бит к 1.64 эффективных

Команда исследователей (Anirudh Malik, M Sparsh Mehra, Poojith Devan) применила к instruction-tuned модели Qwen3-4B сложный стек пост-тренировочной оптимизации. В процесс вошли вращение весов KOTMS, тернаризация E2M-ATQ и компенсация ошибок по методу GPTQ. Важно отметить: квантование затронуло только веса (weight-only), активации остались в 16-битном формате (FP16), что исключило использование ILA-AMP.

Итоговый показатель эффективного битового бюджета составил 1.641 бит на вес, при этом было квантовано 81.62% параметров модели. Это позволяет говорить о высокой степени сжатия, но требует детального анализа потерь.

Цена сжатия: падение точности и рост перплексии

Результаты оценки способности модели (capability retention) показали значительное, но неравномерное снижение качества. Средняя точность упала с 64.5% до 54.7% по десяти тестовым наборам. Модель сохранила хорошие навыки в задачах на понимание текста (BoolQ — 84.6% от оригинала), но сильно проиграла в логических рассуждениях (ARC-Challenge — всего 43.8%).

Метрика перплексии (PPL) на тестовых корпусах также выросла, что свидетельствует о снижении качества генерации текста:

Метрика / Датасет Оригинал (Qwen3-4B) Тернаризованная версия
Perplexity (WikiText-2) 13.639 18.748
Perplexity (PTB) 24.700 31.992
Perplexity (C4) 19.831 28.966
Средняя точность (10 наборов) 64.5% 54.7%

Упаковка и хранение: экономия места

Отдельный этап упаковки (packing) позволил сохранить тернарные плоскости и масштабы, существенно сократив объем чекпоинта. Изначальный размер модели в 8.29 GiB был уменьшен до 3.96 GiB практически без дополнительных потерь перплексии. Примечательно, что попытка сторонней упаковки оказалась убыточной (lossy) и была исключена из основного артефакта.

Деплой: скорость против размера

Главный вопрос для разработчиков — ускорит ли такое сжатие инференс. Preliminary-бенчмарки на микроуровне (Triton GEMV) показали обратный эффект: скорость выполнения оказалась в 4.6 раза ниже, чем у стандартного FP16 cuBLAS на протестированной форме. Авторы прямо заявляют, что на данном этапе сжатие само по себе не обеспечивает ускорения вывода, а требует дальнейшей оптимизации вычислительных ядер.

Источник: arXiv cs.AI ↗