Главная/Блог/Гайд/Bonsai 27B: Запуск Qwen3.6 на ноутбуках…
Гайд11 мин чтения · 15 июля 2026 г.

Bonsai 27B: Запуск Qwen3.6 на ноутбуках и телефонах с 1-битной квантованием

PrismML представили Bonsai 27B — экстремально сжатые версии Qwen3.6-27B, работающие на мобильных устройствах. Разбираем, как 1-битное квантование сохраняет 90% качества и меняет правила игры для локального AI.

Bonsai 27B: Запуск Qwen3.6 на ноутбуках и телефонах с 1-битной квантованием

В мире больших языковых моделей (LLM) мы привыкли к парадоксу: чем умнее модель, тем тяжелее она весит. Обычно запуск 27-миллиардной модели требует серверной видеокарты с 80 ГБ памяти или, в лучшем случае, мощной 24-гигабайтной карты. Однако команда PrismML совершила прорыв, выпустив Bonsai 27B. Это не новая модель, обученная с нуля, а результат революционного метода квантования базовой архитектуры Qwen3.6-27B. Они смогли сжать модель до размеров, позволяющих запускать её на обычных ноутбуках и даже смартфонах, сохранив при этом впечатляющую функциональность.

Главная интрига здесь заключается в степени сжатия. Bonsai 27B предлагает два варианта: тернарный (1.71 бита на вес) и бинарный (1.125 бита на вес). Для сравнения, стандартные модели работают в формате FP16 (16 бит) или даже в более экономичных 4-битных форматах. Снижение разрядности до уровня, близкого к бинарному, обычно приводит к катастрофической потере интеллекта модели. Но PrismML утверждает, что им удалось избежать этого коллапса, сохранив до 94.6% качества тернарной версии и 89.5% — бинарной по сравнению с оригиналом. Это открывает двери для локального запуска мощных агентов ИИ в условиях жестких ограничений по памяти и энергопотреблению.

01Архитектура и философия сжатия: Почему это не просто квантование

Чтобы понять масштаб достижения, нужно разобраться, чем Bonsai 27B отличается от привычных методов квантования, таких как GGUF (используемый в llama.cpp) или MLX. Традиционные подходы, такие как Q4_K_XL (4-бит) или IQ2_XXS (2-бит), часто сталкиваются с проблемой «коллапса» на сложных задачах. При экстремальном сжатии модель теряет способность к логическому выводу, программированию и работе с инструментами, хотя может сохранять хорошие результаты на простых тестах знаний.

PrismML подошли к задаче иначе. Они не просто уменьшили разрядность весов; они изменили способ их хранения и масштабирования. Архитектура Qwen3.6-27B остается неизменной, но способ представления весов внутри матриц стал гибридным. Каждый вес теперь является кодом, который масштабируется с помощью одного общего значения с плавающей точкой FP16 для группы из 128 весов. Это позволяет эффективно хранить информацию, минимизируя накладные расходы на метаданные.

💡
Техническая деталь. Тернарная модель использует значения {-1, 0, +1}. Поскольку логарифм по основанию 2 от 3 равен примерно 1.585 бита, а добавление одного FP16 масштаба на 128 весов дает 0.125 бита, итоговая плотность составляет 1.71 бита на вес. Бинарная модель, использующая только {-1, +1}, достигает 1.125 бита на вес. Это дает сокращение объема в 9.4 раза для тернарной и в 14.2 раза для бинарной версии по сравнению с FP16.

Важно отметить, что квантованию подвержены только матрично-емкие компоненты: эмбеддинги, проекции внимания (attention), проекции MLP и заголовок языковой модели (LM head). Нормализация и некоторые параметры масштаба остаются в более высокой точности, что помогает сохранить стабильность работы. В отличие от подходов вроде BitNet, которые требуют переобучения модели с нуля для предотвращения коллапса, Bonsai 27B сохраняет исходные веса Qwen3.6, адаптируя их под новую форму представления. Это критически важно, так как позволяет использовать знания, накопленные моделью в процессе первоначального обучения.

Модель является мультимодальной. Общая структура весов распределяется следующим образом: около 24.8 миллиарда весов отвечает за языковую часть, 0.46 миллиарда — за визуальный башню (vision tower), и 2.5 миллиарда — за эмбеддинги и заголовок. Примечательно, что визуальный башня хранится отдельно в 4-битном формате (HQQ), что позволяет оптимизировать использование памяти под разные задачи.

Визуализация архитектуры Bonsai 27B и сравнение размеров моделей
Визуализация архитектуры Bonsai 27B и сравнение размеров моделей

02Производительность: Цифры, которые удивляют

Самый очевидный вопрос при экстремальном сжатии: «Насколько умной остается модель?». PrismML провели обширное тестирование, используя EvalScope с vLLM на GPU H100, оценивая 15 различных бенчмарков в режиме «мышления» (thinking mode). Результаты показывают, что компромисс между размером и качеством гораздо менее болезнен, чем можно было ожидать.

Тернарная версия Bonsai 27B сохраняет 94.6% от базового уровня FP16, а бинарная — 89.5%. Для сравнения, стандартная 4-битная сборка Qwen3.6-27B (Q4_K_XL) имеет размер 17.6 ГБ и сохраняет 84.99% качества, а 2-битная сборка (IQ2_XXS) весит 9.4 ГБ, но падает до 72.73%. Это означает, что Bonsai 27B не только меньше, но и точнее, чем традиционные методы квантования того же или даже более высокого уровня.

Bonsai 27B: Запуск Qwen3.6 на ноутбуках и телефонах с 1-битной квантованием

Однако ключевым отличием является не просто средняя оценка, а устойчивость к сложным задачам. Традиционные сборки ниже 4 бит часто демонстрируют так называемый «селективный коллапс». Например, IQ2_XXS может показывать хорошие результаты на MMLU-Redux (88.93), что создает иллюзию работоспособности, но при этом падает до 57.5 на AIME26 (математика) и 56.4 на LiveCodeBench (программирование). Bonsai 27B избегает этой ловушки. Его бинарная версия набирает 91.66 в математике и 81.88 в программировании, что является выдающимся результатом для модели такого размера.

Вариант Бит/вес (bpw) Размер (Footprint) Средний балл (Thinking avg) Плотность (1/GB)
Qwen3.6-27B FP16 16.0 54 ГБ 85.07 0.051
Qwen3.6-27B Q4_K_XL 5.2 17.6 ГБ 84.99 0.155
Qwen3.6-27B IQ2_XXS 2.8 9.4 ГБ 72.73 0.199
Ternary Bonsai 27B 1.71 5.9 ГБ 80.49 0.400
1-bit Bonsai 27B 1.125 3.9 ГБ 76.11 0.530

Разница в плотности (количество операций на гигабайт памяти) колоссальна. Бинарная версия Bonsai имеет плотность 0.530, что в более чем 10 раз превышает плотность оригинальной FP16 модели. Это означает, что процессору или мобильному чипу нужно загружать в 10 раз меньше данных из памяти для каждого шага генерации, что напрямую влияет на скорость.

03Память как главное ограничение: Почему телефон — это не просто «мало памяти»

Запуск модели на телефоне — это не просто вопрос наличия файла весом 4 ГБ. iOS и Android имеют строгие ограничения на использование памяти отдельными приложениями. На iPhone с 12 ГБ физической памяти приложению доступно лишь около 6 ГБ. Оставшаяся память уходит под операционную систему, кэш и другие процессы.

Второй критический фактор — это кэш ключей и значений (KV cache). В моделях с полным вниманием (full-attention) этот кэш растет с каждым токеном. В Qwen3.6-27B только 16 из 64 слоев используют растущий кэш полного внимания. В формате FP16 это стоит около 64 КБ на токен. Для контекстного окна в 262K токенов это потребовало бы около 17.2 ГБ памяти, что невозможно на телефоне. Однако, благодаря тому, что ~75% внимания в Qwen3.6 является линейным, и использованию 4-битного KV кэша, этот объем сокращается до ~4.3 ГБ. Это делает возможным работу с длинными контекстами даже на мобильных устройствах.

Проблема коллапса при экстремальном сжатии часто связана с тем, что модель не может «запомнить» сложные паттерны. PrismML измерили это через forward-KL дивергенцию. Тернарный Bonsai показывает отклонение всего 0.0011 нат на наборе MATH-500 по сравнению с базой FP16, тогда как Q4_K_XL дает 0.0146. Это статистически значимое преимущество в точности распределения.

При работе с длинными контекстами (100K токенов) пиковое потребление памяти для бинарной версии с FP16 кэшем составляет 11.6 ГБ, а для тернарной — 14.7 ГБ. Для сравнения, стандартная Q4_K_XL требует около 25.6 ГБ. Таким образом, Bonsai 27B не просто помещается в память телефона, он оставляет запас для стабильной работы системы.

Bonsai 27B: Запуск Qwen3.6 на ноутбуках и телефонах с 1-битной квантованием
⚠️ Важно
Ограничения iOS. Помните, что на iPhone 12-16 ГБ доступно для приложения лишь половина физической памяти. Бинарная версия Bonsai (3.9 ГБ) + кэш + система укладываются в этот лимит, что делает её первой 27-миллиардной моделью, способной работать на телефоне в полноценном режиме.

04Скорость и DSpark: Как ускорить генерацию

Даже если модель помещается в память, скорость генерации (токенов в секунду) часто становится узким местом. На мобильных устройствах генерация ограничена пропускной способностью памяти (memory-bandwidth bound), а не вычислительной мощностью. Поскольку Bonsai 27B использует меньше байт на шаг, она может генерировать токены быстрее, чем более крупные модели, даже на менее мощном железе.

Тесты на различных платформах показали впечатляющие результаты. На MacBook M5 Max бинарная версия генерирует 66.4 токена в секунду при батче 128. На iPhone 17 Pro Max этот показатель составляет 11.0 токенов в секунду. Для сравнения, на серверной H100 бинарная версия достигает 104.8 токенов в секунду. Важно отметить, что префилл (подготовка контекста) ограничен вычислительной мощностью, поэтому ускорение здесь менее заметно, но сама генерация выигрывает колоссально.

PrismML также представили DSpeculative Decoding (DSpark) — специальный драфтер, обученный на целевой модели Bonsai 27B. На H100 при глубине драфта k=4 бинарная цель достигает длины принятия τ=3.6. Это дает скорость 143.8 токенов в секунду, что является ускорением в 1.37 раза. При этом верификация является без потерь (lossless), то есть выходные данные остаются идентичными распределению оригинальной модели. На Apple Silicon драфтер по умолчанию отключен при батче 1, так как накладные расходы на драфтинг могут перевесить выгоду на мобильных чипах.

05Как запустить Bonsai 27B: Практическое руководство

Одной из сильных сторон Bonsai 27B является открытость. Модель распространяется под лицензией Apache 2.0, что позволяет свободно использовать её в коммерческих и личных проектах. Поддержка включена в популярные фреймворки: llama.cpp (для CUDA и Metal) и MLX (для Apple Silicon).

По умолчанию в репозитории демо-версии установлена тернарная версия. Запустить сервер можно с помощью стандартных скриптов llama.cpp. Ниже приведен пример запуска сервера с поддержкой OpenAI API и интерфейса чата/визуализации:

terminalbash
scripts/start_llama_server.sh \
  --model Ternary_Bonsai_27B.gguf \
  --mmproj Ternary_Bonsai_27B_mmproj.gguf \
  --port 8080

Для генерации текста напрямую через командную строку или MLX можно использовать следующие команды. Обратите внимание, что для работы с изображениями требуется указать путь к визуальной модели (mmproj):

Bonsai 27B: Запуск Qwen3.6 на ноутбуках и телефонах с 1-битной квантованием
terminalbash
llama-cli \
  -m Ternary_Bonsai_27B_Q2_0.gguf \
  --mmproj Ternary_Bonsai_27B_mmproj.gguf \
  -p "Explain KV cache growth."

mlx_lm.generate \
  --model prismml/Ternary_Bonsai_27B_mlx_bit \
  --prompt "Explain KV cache growth."

Модель поддерживает вызовы инструментов (tool calling) в стиле OpenAI. Это критически важно для создания агентов. Пример запроса с инструментом для получения погоды:

terminaljson
curl http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "What is the weather in Lisbon?"}],
    "tools": [{
      "type": "function",
      "function": {
        "name": "get_weather",
        "parameters": {"type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"]}
      }
    }]
  }'

Ответ будет содержать вызовы инструментов в поле choices[0].message.tool_calls. Режим «мышления» (thinking mode) включен по умолчанию, но его можно переключать с помощью параметра thinking_budget_tokens в каждом запросе.

📌 Факт
Лицензия. Все веса и код доступны под лицензией Apache 2.0. Это означает, что вы можете использовать модель в коммерческих продуктах без необходимости открывать свой код, что делает Bonsai 27B привлекательным для стартапов и энтузиастов.

06Сценарии использования: Где это имеет смысл

Экстремальное квантование открывает четыре основных сценария применения, которые ранее были невозможны или требовали облачных решений:

  1. Локальные агенты на ноутбуках: Тернарная версия (5.9 ГБ) идеально подходит для запуска на ноутбуках с 16 ГБ памяти. Вы можете обрабатывать целые репозитории кода (контекст 262K токенов) для анализа, рефакторинга или поиска багов, не отправляя данные в облако. Это обеспечивает полную конфиденциальность исходного кода.
  2. Мобильное рассуждение: Бинарная версия (3.9 ГБ) позволяет запускать сложные логические задачи на iPhone. Исследования показывают, что модель генерирует 672 токена на 1% заряда батареи iPhone. Это делает её идеальной для помощников, работающих в офлайн-режиме или в условиях плохой связи.
  3. Конфиденциальные и офлайн-рабочие процессы: Поскольку модель работает полностью на устройстве, никакие промпты или данные не покидают ваш телефон или ноутбук. Это критически важно для юридических, медицинских или финансовых приложений, где конфиденциальность данных является приоритетом.
  4. Серверинг на одной GPU: В сочетании с 4-битным KV кэшем, модель качества 27B-класса может работать на одной видеокарте с 24 ГБ памяти (например, RTX 3090/4090). Это снижает стоимость развертывания для небольших команд или индивидуальных разработчиков.

07Что это значит на практике

Выпуск Bonsai 27B от PrismML знаменует собой сдвиг парадигмы в локальном искусственном интеллекте. Долгое время считалось, что для получения качественного результата необходимо жертвовать скоростью или размером модели. Bonsai 27B доказывает, что при правильном подходе к квантованию можно сохранить 90% интеллектуальных способностей 27-миллиардной модели, уменьшив её размер в 14 раз.

Для разработчиков это означает возможность создавать приложения, которые не зависят от облачных API. Для энтузиастов — возможность запускать мощные мультимодальные модели на устройствах, которые уже есть в кармане. Для бизнеса — путь к снижению затрат на инфраструктуру и обеспечению безопасности данных. Хотя бинарная версия все еще уступает оригиналу в некоторых сложных задачах, её способность работать на телефоне с приемлемой скоростью и точностью делает её первым в своем роде решением для массового внедрения локального AI.

Будущее за гибридными системами, где тяжелые вычисления остаются в облаке, а легковесные, но умные модели, такие как Bonsai 27B, обрабатывают данные на краю сети (edge). И с открытым кодом и лицензией Apache 2.0, PrismML дали всем нам инструменты, чтобы начать этот переход уже сегодня.

Источник: MarkTechPost ↗