Релиз модели15 июля 2026 г., 02:17 МСК🤖 Auto

Bonsai 27B: Qwen3.6 в 1-бит и тернарном виде для телефонов

PrismML выпустила сжатые версии Qwen3.6-27B (1.125 и 1.71 бит/веса), которые помещаются в память смартфона и сохраняют до 94.6% качества оригинала.

Баннер новости 3583

Суть релиза: не переобучение, а новая упаковка

Компания PrismML представила модель Bonsai 27B, которая не является новой предварительно обученной нейросетью. Это низкобитная репрезентация оригинальной модели Qwen3.6-27B с сохранением исходной архитектуры. Ключевое отличие — использование бинарных {-1, +1} и тернарных {-1, 0, +1} весов, что позволяет запускать 27-миллиардную модель на устройствах с ограниченными ресурсами, таких как ноутбуки и смартфоны.

Технические характеристики и сжатие

Метод сжатия использует один общий масштаб FP16 на группу из 128 весов. Это обеспечивает эффективное снижение размера без катастрофической потери точности, характерной для традиционных методов квантования ниже 4 бит. Модель разделена на ~24.8B языковых весов, 0.46B башни зрения (Vision Tower, хранится в 4-bit HQQQ) и 2.5B эмбеддингов.

Вариант Бит на вес (bpw) Размер (Footprint) Средний балл (Thinking avg) Плотность (1/GB)
Qwen3.6-27B FP16 16.0 54 GB 85.07 0.051
Qwen3.6-27B Q4_K_XL 5.2 17.6 GB 84.99 0.155
Qwen3.6-27B IQ2_XXS 2.8 9.4 GB 72.73 0.199
Ternary Bonsai 27B 1.71 5.9 GB 80.49 0.400
1-bit Bonsai 27B 1.125 3.9 GB 76.11 0.530

Почему это важно: преодоление коллапса точности

Традиционные методы квантования (например, IQ2_XXS) часто демонстрируют ложную стабильность на простых бенчмарках (MMLU-Redux), но полностью «коллапсируют» на сложных задачах: IQ2_XXS набирает всего 57.5 на AIME26 и 56.4 на LiveCodeBench. Bonsai 27B решает эту проблему. Тернарная версия сохраняет 94.6% качества FP16, а 1-битная — 89.5%. Это делает её первой моделью класса 27B, способной работать на телефоне без критической деградации интеллектуальных способностей.

Производительность на устройствах

Ограничением для смартфонов (особенно iOS) является не только хранилище, но и оперативная память. На iPhone 12GB доступно лишь ~6GB для приложения. Bonsai 1-bit (3.9GB) оставляет пространство для KV-кэша. При использовании 4-bit KV-кэша окно контекста 262K токенов занимает всего ~4.3GB, что позволяет запускать модель локально.

Скорость генерации (tg128) на Apple M5 Max для бинарной версии достигает 66.4 токена/с, а на iPhone 17 Pro Max — 11.0 токена/с. Для ускорения также доступен DSpark-драфтер, дающий ускорение 1.37x на H100.

Доступность и лицензия

Обе версии (Ternary и 1-bit) выпущены под лицензией Apache 2.0. Модель совместима с llama.cpp (CUDA, Metal) и MLX. Тернарная версия является дефолтной в репозитории. Поддерживается вызов инструментов (tool calling) в формате OpenAI и режим «мышления» (thinking mode), который включен по умолчанию.

Бенчмарки

БенчмаркTernary Bonsai 27B1-bitFP16Qwen3.6-27B FP16Qwen3.6-27B IQ2_XXSQwen3.6-27B Q4_K_XLTernary
Thinking avg80.49%85.07%72.73%84.99%
Math91.66%95.33%93.4%
Coding81.88%88.74%85.96%
Knowledge and reasoning73.39%83.15%76.96%
Agentic and tool calling66.03%80%74.01%
Instruction following65.74%78.47%71.77%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗