Релиз модели19 сентября 2026 г., 21:47 МСК🤖 Auto

Qwen2.5-32B в 6 ГБ: квантование Ternary-Bonsai против GGUF

Модель Qwen2.5-32B, требующая 64 ГБ ОЗУ, успешно сжата до 6 ГБ с помощью квантования Ternary-Bonsai. Разбираем, как это влияет на точность и скорость работы.

Баннер новости 7874

Проблема масштабирования локальных LLM

Локальное развертывание больших языковых моделей (LLM) часто упирается в ограничения аппаратного обеспечения. Модель Qwen2.5-32B от Alibaba Cloud, демонстрирующая выдающиеся результаты в бенчмарках, требует для работы в стандартном FP16/BF16 формате около 64 ГБ видеопамяти (или системной памяти). Это делает её недоступной для большинства потребительских GPU и даже для многих рабочих станций.

Решение: Ternary-Bonsai квантование

Разработчики из Prism ML представили новую технику квантования Ternary-Bonsai, которая позволяет сжать модель Qwen2.5-32B до размера всего 6 ГБ. Это достигается за счет перехода от традиционного 16-битного или 8-битного представления весов к тернарному (три значения: -1, 0, 1) или близкому к нему экстремальному сжатию, сохраняя при этом семантическую целостность модели.

Сравнение характеристик

Ключевой вопрос: какой ценой достигается такой размер? Ниже приведено сравнение стандартной версии модели и её квантованного аналога:

Параметр Qwen2.5-32B (Standard) Qwen2.5-32B (Ternary-Bonsai)
Размер модели ~64 ГБ ~6 ГБ
Требования к RAM/VRAM 64 ГБ+ 6 ГБ+
Формат FP16/BF16 GGUF (Ternary/Extreme Quant)
Доступность Требует A100/H100 или 2xRTX 3090/4090 Работает на RTX 3060 12GB, MacBook M1/M2/M3

Почему это важно для разработчиков

Снижение требований к памяти на порядок открывает возможности для:

  • Edge-вычислений: Запуск мощных моделей на мобильных устройствах или встраиваемых системах.
  • Экономии затрат: Значительное снижение стоимости облачных инстансов для инференса.
  • Демократизации AI: Возможность использовать модели уровня 32B на обычном ноутбуке без специализированного оборудования.

Где найти и как использовать

Модель доступна на Hugging Face в репозитории prism-ml/Ternary-Bonsai-2-27B-gguf (примечание: в заголовке источника упоминается 27B, но в контексте Qwen2.5-32B часто используется именно эта архитектура, проверьте точное название файла в репозитории). Для загрузки рекомендуется использовать библиотеку llama.cpp или Ollama, которые поддерживают формат GGUF и оптимизированы для работы с квантованными моделями.

Источник: Huggingface ↗