Революция в сжатии: 27B параметров на смартфоне
Лаборатория PrismML анонсировала выход Bonsai 27B, флагманской мультимодальной модели семейства Bonsai. В основе лежит архитектура Qwen3.6 27B, но ключевое отличие — экстремальное квантование весов. До этого момента запуск моделей такого класса на мобильных устройствах был невозможен из-за требований к памяти: даже 4-битная версия занимала около 18 ГБ, что недоступно для современных смартфонов.
Решение PrismML — использование 1-битных (бинарных) и тернарных весов с групповым масштабированием FP16. Это позволяет сохранить целостность вычислений во всех слоях (включая attention и MLP) без использования «высокобитных» обходных путей. Модель поддерживает контекст 262K токенов, мультимодальный ввод (зрение, документы, скриншоты) и speculative decoding для ускорения генерации.
Два варианта: для ноутбука и для iPhone
Выпуск представлен в двух конфигурациях, оптимизированных под разные сценарии использования:
- Ternary Bonsai 27B (1.71 бит/вес): Размер 5.9 ГБ. Ориентирован на качество. Запускается на обычных ноутбуках, сохраняя полную способность к многошаговому рассуждению и вызову инструментов.
- 1-bit Bonsai 27B (1.125 бит/вес): Размер 3.9 ГБ. Ориентирован на компактность. Это первая модель класса 27B, которая физически помещается в оперативную память iPhone 17 Pro (где приложению доступно ~6 ГБ), оставляя ресурсы для KV-cache и активаций.
Сохранение интеллекта: бенчмарки
Несмотря на агрессивное сжатие, модель демонстрирует высокую эффективность. В режиме «мышления» (thinking mode) Ternary-версия сохраняет 95% от базовой модели, а 1-bit — 90%. Ниже приведено сравнение результатов по ключевым категориям:
| Категория (бенчмарки) | Qwen 3.6 27B (Baseline) | Ternary Bonsai 27B | 1-bit Bonsai 27B |
|---|---|---|---|
| Математика (GSM8K, MATH-500, AIME) | 95.3 | 93.4 | 91.7 |
| Кодинг (HumanEval+, LiveCodeBench) | 88.7 | 86.0 | 81.9 |
| Агентность и вызов инструментов (BFCL v3) | 80.0 | 74.0 | 66.0 |
| Знания / STEM (MMLU-Redux) | 83.1 | 77.0 | 73.4 |
| Зрение (MMMU Pro, OCRBench) | 72.6 | 65.2 | 59.6 |
| Общий результат (15 тестов) | 85.0 | 80.5 | 76.1 |
Почему это важно: эра локальных агентов
Главный сдвиг парадигмы заключается в переходе от одиночных ответов к длительным агентным сценариям. Облачные API накладывают ограничения: накопление стоимости за каждый токен, задержка сети и риски утечки приватных данных (скриншотов, файлов). Локальный запуск Bonsai 27B на устройстве пользователя делает маржинальную стоимость многошаговых циклов равной нулю и гарантирует приватность.
Модель также открывает путь к гибридным архитектурам, где сложные задачи решаются локально, а фронтьерные — в облаке. По метрике «интеллектуальной плотности» (intelligence density) 1-bit Bonsai 27B выдает 0.53 единицы на ГБ, что в 10 раз превышает показатели полнобитных аналогов и в 2.7 раза — лучшие альтернативы с низким битом.
Производительность и доступность
Скорость генерации токенов на NVIDIA GeForce RTX 5090 достигает 163 tok/s (1-bit) и 134 tok/s (Ternary). На чипе Apple M5 Max показатели составляют 87 tok/s и 58 tok/s соответственно. Модель доступна под лицензией Apache 2.0, работает нативно на устройствах Apple (через MLX) и NVIDIA (через CUDA). Разработчикам также доступна ограниченная по времени бесплатная API-превью.
Бенчмарки
| Бенчмарк | 1-bit Bonsai 27B | Ternary Bonsai 27B | Qwen 3.6 27B |
|---|---|---|---|
| Math (GSM8K, MATH-500, AIME25, AIME26) | 91.7% | 93.4% | 95.3% |
| Coding (HumanEval+, MBPP+, LiveCodeBench) | 81.9% | 86% | 88.7% |
| Agentic and Tool-calling (BFCL v3, TauBench) | 66% | 74% | 80% |
| Instruction following (IFEval, IFBench) | 65.8% | 71.8% | 78.4% |
| Knowledge / STEM (MMLU-Redux, MuSR) | 73.4% | 77% | 83.1% |
| Vision (MMMU Pro, OCRBench) | 59.6% | 65.2% | 72.6% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Prismml ↗
