Суть релиза: не переобучение, а новая упаковка
Компания PrismML представила модель Bonsai 27B, которая не является новой предварительно обученной нейросетью. Это низкобитная репрезентация оригинальной модели Qwen3.6-27B с сохранением исходной архитектуры. Ключевое отличие — использование бинарных {-1, +1} и тернарных {-1, 0, +1} весов, что позволяет запускать 27-миллиардную модель на устройствах с ограниченными ресурсами, таких как ноутбуки и смартфоны.
Технические характеристики и сжатие
Метод сжатия использует один общий масштаб FP16 на группу из 128 весов. Это обеспечивает эффективное снижение размера без катастрофической потери точности, характерной для традиционных методов квантования ниже 4 бит. Модель разделена на ~24.8B языковых весов, 0.46B башни зрения (Vision Tower, хранится в 4-bit HQQQ) и 2.5B эмбеддингов.
| Вариант | Бит на вес (bpw) | Размер (Footprint) | Средний балл (Thinking avg) | Плотность (1/GB) |
|---|---|---|---|---|
| Qwen3.6-27B FP16 | 16.0 | 54 GB | 85.07 | 0.051 |
| Qwen3.6-27B Q4_K_XL | 5.2 | 17.6 GB | 84.99 | 0.155 |
| Qwen3.6-27B IQ2_XXS | 2.8 | 9.4 GB | 72.73 | 0.199 |
| Ternary Bonsai 27B | 1.71 | 5.9 GB | 80.49 | 0.400 |
| 1-bit Bonsai 27B | 1.125 | 3.9 GB | 76.11 | 0.530 |
Почему это важно: преодоление коллапса точности
Традиционные методы квантования (например, IQ2_XXS) часто демонстрируют ложную стабильность на простых бенчмарках (MMLU-Redux), но полностью «коллапсируют» на сложных задачах: IQ2_XXS набирает всего 57.5 на AIME26 и 56.4 на LiveCodeBench. Bonsai 27B решает эту проблему. Тернарная версия сохраняет 94.6% качества FP16, а 1-битная — 89.5%. Это делает её первой моделью класса 27B, способной работать на телефоне без критической деградации интеллектуальных способностей.
Производительность на устройствах
Ограничением для смартфонов (особенно iOS) является не только хранилище, но и оперативная память. На iPhone 12GB доступно лишь ~6GB для приложения. Bonsai 1-bit (3.9GB) оставляет пространство для KV-кэша. При использовании 4-bit KV-кэша окно контекста 262K токенов занимает всего ~4.3GB, что позволяет запускать модель локально.
Скорость генерации (tg128) на Apple M5 Max для бинарной версии достигает 66.4 токена/с, а на iPhone 17 Pro Max — 11.0 токена/с. Для ускорения также доступен DSpark-драфтер, дающий ускорение 1.37x на H100.
Доступность и лицензия
Обе версии (Ternary и 1-bit) выпущены под лицензией Apache 2.0. Модель совместима с llama.cpp (CUDA, Metal) и MLX. Тернарная версия является дефолтной в репозитории. Поддерживается вызов инструментов (tool calling) в формате OpenAI и режим «мышления» (thinking mode), который включен по умолчанию.
Бенчмарки
| Бенчмарк | Ternary Bonsai 27B | 1-bit | FP16 | Qwen3.6-27B FP16 | Qwen3.6-27B IQ2_XXS | Qwen3.6-27B Q4_K_XL | Ternary |
|---|---|---|---|---|---|---|---|
| Thinking avg | 80.49% | — | — | 85.07% | 72.73% | 84.99% | — |
| Math | — | 91.66% | 95.33% | — | — | — | 93.4% |
| Coding | — | 81.88% | 88.74% | — | — | — | 85.96% |
| Knowledge and reasoning | — | 73.39% | 83.15% | — | — | — | 76.96% |
| Agentic and tool calling | — | 66.03% | 80% | — | — | — | 74.01% |
| Instruction following | — | 65.74% | 78.47% | — | — | — | 71.77% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
