Релиз модели15 июля 2026 г., 01:45 МСК🤖 Auto

Bonsai 27B: первый 27-миллиардный AI-модель, работающий на iPhone

PrismML представила Bonsai 27B — модель на базе Qwen3.6, которая помещается в память iPhone 17 Pro (3.9 ГБ) и сохраняет 90% интеллектуальных способностей оригинала.

Баннер новости 3582

Революция в сжатии: 27B параметров на смартфоне

Лаборатория PrismML анонсировала выход Bonsai 27B, флагманской мультимодальной модели семейства Bonsai. В основе лежит архитектура Qwen3.6 27B, но ключевое отличие — экстремальное квантование весов. До этого момента запуск моделей такого класса на мобильных устройствах был невозможен из-за требований к памяти: даже 4-битная версия занимала около 18 ГБ, что недоступно для современных смартфонов.

Решение PrismML — использование 1-битных (бинарных) и тернарных весов с групповым масштабированием FP16. Это позволяет сохранить целостность вычислений во всех слоях (включая attention и MLP) без использования «высокобитных» обходных путей. Модель поддерживает контекст 262K токенов, мультимодальный ввод (зрение, документы, скриншоты) и speculative decoding для ускорения генерации.

Два варианта: для ноутбука и для iPhone

Выпуск представлен в двух конфигурациях, оптимизированных под разные сценарии использования:

  • Ternary Bonsai 27B (1.71 бит/вес): Размер 5.9 ГБ. Ориентирован на качество. Запускается на обычных ноутбуках, сохраняя полную способность к многошаговому рассуждению и вызову инструментов.
  • 1-bit Bonsai 27B (1.125 бит/вес): Размер 3.9 ГБ. Ориентирован на компактность. Это первая модель класса 27B, которая физически помещается в оперативную память iPhone 17 Pro (где приложению доступно ~6 ГБ), оставляя ресурсы для KV-cache и активаций.

Сохранение интеллекта: бенчмарки

Несмотря на агрессивное сжатие, модель демонстрирует высокую эффективность. В режиме «мышления» (thinking mode) Ternary-версия сохраняет 95% от базовой модели, а 1-bit — 90%. Ниже приведено сравнение результатов по ключевым категориям:

Категория (бенчмарки) Qwen 3.6 27B (Baseline) Ternary Bonsai 27B 1-bit Bonsai 27B
Математика (GSM8K, MATH-500, AIME) 95.3 93.4 91.7
Кодинг (HumanEval+, LiveCodeBench) 88.7 86.0 81.9
Агентность и вызов инструментов (BFCL v3) 80.0 74.0 66.0
Знания / STEM (MMLU-Redux) 83.1 77.0 73.4
Зрение (MMMU Pro, OCRBench) 72.6 65.2 59.6
Общий результат (15 тестов) 85.0 80.5 76.1

Почему это важно: эра локальных агентов

Главный сдвиг парадигмы заключается в переходе от одиночных ответов к длительным агентным сценариям. Облачные API накладывают ограничения: накопление стоимости за каждый токен, задержка сети и риски утечки приватных данных (скриншотов, файлов). Локальный запуск Bonsai 27B на устройстве пользователя делает маржинальную стоимость многошаговых циклов равной нулю и гарантирует приватность.

Модель также открывает путь к гибридным архитектурам, где сложные задачи решаются локально, а фронтьерные — в облаке. По метрике «интеллектуальной плотности» (intelligence density) 1-bit Bonsai 27B выдает 0.53 единицы на ГБ, что в 10 раз превышает показатели полнобитных аналогов и в 2.7 раза — лучшие альтернативы с низким битом.

Производительность и доступность

Скорость генерации токенов на NVIDIA GeForce RTX 5090 достигает 163 tok/s (1-bit) и 134 tok/s (Ternary). На чипе Apple M5 Max показатели составляют 87 tok/s и 58 tok/s соответственно. Модель доступна под лицензией Apache 2.0, работает нативно на устройствах Apple (через MLX) и NVIDIA (через CUDA). Разработчикам также доступна ограниченная по времени бесплатная API-превью.

Бенчмарки

Бенчмарк1-bit Bonsai 27BTernary Bonsai 27BQwen 3.6 27B
Math (GSM8K, MATH-500, AIME25, AIME26)91.7%93.4%95.3%
Coding (HumanEval+, MBPP+, LiveCodeBench)81.9%86%88.7%
Agentic and Tool-calling (BFCL v3, TauBench)66%74%80%
Instruction following (IFEval, IFBench)65.8%71.8%78.4%
Knowledge / STEM (MMLU-Redux, MuSR)73.4%77%83.1%
Vision (MMMU Pro, OCRBench)59.6%65.2%72.6%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Prismml ↗