Главная/Блог/Гайд/Ternary Bonsai 2: 27B модель с весом…
Гайд8 мин чтения · 18 сентября 2026 г.

Ternary Bonsai 2: 27B модель с весом 5.9 ГБ и 98% эффективности

PrismML представили Ternary Bonsai 2 — квантованную версию Qwen3.8, которая занимает всего 5.9 ГБ, но сохраняет 98.2% производительности оригинала. Разбираем, как работает тернарная квантовизация и где её запускать.

Ternary Bonsai 2: 27B модель с весом 5.9 ГБ и 98% эффективности

В мире больших языковых моделей (LLM) вечным компромиссом остается баланс между размером модели, скоростью работы и интеллектуальными способностями. Обычно, чтобы получить высокую точность ответов, сложные рассуждения и понимание контекста, разработчикам приходится использовать модели с десятками миллиардов параметров, которые требуют мощных серверных GPU с огромным объемом видеопамяти. Однако команда PrismML недавно представила решение, которое бросает вызов этой парадигме. Их новая модель Ternary Bonsai 2 27B демонстрирует, что можно существенно сократить вычислительные затраты, не теряя при этом критически важную функциональность.

Это не просто еще одна квантованная версия популярной архитектуры. Это эксперимент с тернарными весами, который позволяет упаковать модель объемом 27.36 миллиарда параметров в файл размером всего 5.93 ГБ. Для сравнения, оригинальная модель Qwen3.8 в формате FP16 занимает около 53.8 ГБ. При этом, по заявлениям разработчиков, Ternary Bonsai 2 сохраняет 98.2% от средней производительности родителя на 20 различных бенчмарках. Это открывает двери для локального запуска мощных мультимодальных моделей на потребительском оборудовании, включая ноутбуки и игровые видеокарты среднего класса.

01Что такое Ternary Bonsai 2 и почему это важно?

Ternary Bonsai 2 27B — это тернарная версия модели Qwen3.8 27B. Важно понимать, что архитектура самой нейронной сети осталась неизменной. Модель по-прежнему имеет 27.36 миллиарда параметров, которые распределяются следующим образом: 24.35 миллиарда приходится на языковое ядро (backbone), 2.54 миллиарда — на эмбеддинги и заголовок языковой модели (LM head), и 0.47 миллиарда — на визуальную башню (vision tower), отвечающую за обработку изображений.

Языковое ядро использует гибридный механизм внимания: примерно 75% слоев работают с линейным вниманием, а 25% — с полным вниманием (full-attention). Это сочетание позволяет модели эффективно обрабатывать длинные контексты (до 262 тысяч токенов) и поддерживать мультимодальный ввод, включая текст и изображения. Главная инновация заключается в том, как хранятся веса этих слоев. В стандартных моделях веса хранятся в формате с плавающей запятой (обычно FP16 или BF16), что требует много памяти. В Ternary Bonsai 2 веса квантованы до трех значений: -1, 0 и +1.

Этот подход радикально снижает объем данных. Однако, чтобы сохранить точность, команда PrismML не квантовала все веса. Лишь 26.2 миллиона параметров, что составляет менее 0.1% от общего числа, остаются в высокой точности. Это веса пути рекуррентного состояния и веса нормализации. Остальная масса параметров, включая проекции внимания, многослойные перцептроны (MLP) и заголовок модели, переведена в тернарный формат. Визуальная башня в формате GGUF поставляется отдельно и весит 0.63 ГБ, загружаясь только тогда, когда требуется обработка изображений.

💡
Техническая деталь. Тернарные веса хранятся в специфическом формате GGUF. Существует два основных варианта упаковки: PTQ1_0 и PQ2_0. Они различаются по скорости распаковки и занимаемому месту, что позволяет выбирать оптимальный вариант под конкретное железо.

02Как работает тернарный формат: математика сжатия

Чтобы понять, как удалось достичь такого сжатия, нужно заглянуть в математику процесса. Каждый вес в тернарной модели принимает одно из трех значений: -1, 0 или +1. Математически это соответствует логарифму по основанию 2 от 3, то есть примерно 1.585 бита на вес. Однако, чтобы восстановить исходные значения, необходимо хранить масштабный коэффициент (scale). В данной реализации группа из 128 весов делится на один 16-битный (FP16) масштабный коэффициент.

Если сложить 1.585 бита на сами значения и 16 бит на масштаб, распределенные на 128 весов, мы получаем примерно 1.71 бита на вес. Если учесть, что небольшая часть весов (рекуррентные состояния) хранится в высокой точности, итоговый средний размер модели составляет 1.72 бита на параметр. Это колоссальное сжатие по сравнению с 16 битами в FP16.

Ternary Bonsai 2: 27B модель с весом 5.9 ГБ и 98% эффективности

Для практической реализации в формате GGUF описаны два метода упаковки:

  • PTQ1_0: Плотная упаковка тритов (тернарных значений). Размер файла составляет 5.93 ГБ. Этот формат оптимизирован для скорости декодирования на некоторых архитектурах GPU.
  • PQ2_0: Каждый трит хранится в 2-битном слоте. Размер файла увеличивается до 7.25 ГБ. Однако этот формат дешевле в плане вычислительных ресурсов для распаковки, что может быть выгоднее на других типах процессоров.

Кроме того, перед назначением тернарных значений применяется ротация в базисе. PrismML использует блочное преобразование Адамара (Hadamard rotation) с размером блока 1024. Во время выполнения (runtime) применяется обратное преобразование к активациям перед каждым умножением. Эта техника, известная как SpinQuant, помогает минимизировать ошибки квантования, сохраняя распределение данных более естественным для нейронной сети.

03Сравнение производительности: где модель сильна, а где слаба

Оценка эффективности Ternary Bonsai 2 проводилась командой PrismML с использованием EvalScope и vLLM на GPU H100. Все тесты выполнялись в режиме "thinking mode" (режим размышления), что важно для задач, требующих сложных рассуждений. Результаты показывают удивительно высокую сохранность способностей оригинальной модели Qwen3.8 27B.

В таблице ниже приведены средние баллы по ключевым категориям. Обратите внимание на столбец "Retention" (Сохранение), который показывает, какой процент от оригинала сохранила квантованная версия.

Способность Qwen3.6 27B Qwen3.8 27B (База) Ternary Bonsai 2 27B Retention
Знания и рассуждения 84.71 86.66 83.95 96.9%
Математика 94.64 97.06 96.57 99.5%
Программирование 82.57 82.17 81.58 99.3%
Агентность и вызов инструментов 80.05 79.74 77.57 97.3%
Следование инструкциям 74.53 81.25 82.66 101.7%
Зрение (Vision) 79.82 81.64 78.59 96.3%
Итого (20 бенчмарков) 83.6 85.4 83.9 98.2%

Особого внимания заслуживает сравнение с традиционными методами квантования. Например, сборка Qwen3.8 27B с квантованием IQ2_XXS занимает 7.3 ГБ, но набирает в среднем лишь 75.2 балла. На тесте AIME26 (сложная математика) Ternary Bonsai 2 набирает 95.83 против 78.6 у IQ2_XXS. На LiveCodeBench v6 разрыв еще более заметен: 90.07 против 70.05. Это доказывает, что тернарный подход значительно превосходит стандартные методы квантования в сохранении интеллектуальных способностей.

Ternary Bonsai 2: 27B модель с весом 5.9 ГБ и 98% эффективности
⚠️
Важное ограничение. Несмотря на высокие средние показатели, есть области, где модель теряет качество. Долгосрочная агентная работа (long-horizon agent work) страдает сильнее всего. На тесте Terminal-Bench 2.1 модель набирает 52.8 против 69.7 у оригинала, а на SWE-bench Verified — 60.8 против 80.6. Это составляет около 75% сохранности, что значительно ниже среднего показателя.

Также важно отметить, что модель не поддерживает "низкие усилия" (low effort) в рассуждениях. При среднем уровне усилий она набирает 79.3 против 82.6 у FP16 базовой модели. Все результаты являются собственными исследованиями PrismML и пока не были независимо воспроизведены другими сообществами.

04Скорость работы на реальном оборудовании

Один из главных вопросов при использовании квантованных моделей — насколько быстро они работают на доступном "железе". Тесты проводились PrismML с использованием собственных кастомных ядер (custom kernels) 16 сентября 2026 года. Декодирование выполнялось с размером батча 1.

Результаты впечатляют, особенно для потребительских видеокарт:

  • NVIDIA RTX 5090: 142.5 токенов в секунду. Энергоэффективность составляет 0.582 мВт на токен. Это один из самых быстрых результатов, показанных для модели такого размера.
  • NVIDIA RTX 4090: 96.7 токенов в секунду (с упаковкой PTQ1_0). Это уровень, достаточный для комфортного общения в реальном времени.
  • NVIDIA L4 (72 Вт): 32.1 токена в секунду. Хороший результат для энергоэффективных серверных решений.
  • Apple M5 Max: 46.8 токенов в секунду.
  • Apple M5 Pro: 27.7 токенов в секунду.

Интересно, что ни один из форматов упаковки (PTQ1_0 или PQ2_0) не является универсально лучшим. PTQ1_0 быстрее на картах архитектуры Ada и на L4. PQ2_0 выигрывает на архитектурах Blackwell, Hopper, Ampere и на Apple Silicon, а также показывает лучшую скорость при обработке промптов (prompt processing) на всех платформах.

Команда PrismML также заявляет, что их модель обеспечивает на 40% лучшую энергоэффективность по сравнению с полноточной моделью на 8 миллиардов параметров. Это делает Ternary Bonsai 2 привлекательным выбором для устройств с ограниченным питанием.

Ternary Bonsai 2: 27B модель с весом 5.9 ГБ и 98% эффективности

05Как запустить Ternary Bonsai 2 локально

Запуск этой модели требует специфического программного обеспечения. Стандартная версия llama.cpp не поддерживает типы PTQ1_0 и PQ2_0, поэтому необходимо использовать форк от PrismML. Также доступна поддержка через MLX runtime для пользователей Apple.

Официальный путь запуска описан в репозитории Bonsai-demo. Процесс установки прост:

  1. Клонируйте репозиторий.
  2. Запустите скрипт установки: ./setup.sh
  3. Запустите сервер чата, поддержки зрения и инструментов: ./scripts/start_llama_server.sh

После этого модель будет доступна по адресу localhost:8080. Пользователи Mac могут использовать пакет MLX, который требует встроенного загрузчика. Также доступна демонстрация через WebGPU, позволяющая запускать модель прямо в браузере, что открывает возможности для тестирования без установки дополнительного ПО.

📌
Ресурсы. Все материалы, включая белые книги (whitepaper), веса моделей, репозиторий GitHub и документацию, доступны на официальном сайте PrismML. Также можно следить за обновлениями в Twitter и на Reddit.

06Что это значит на практике

Выход Ternary Bonsai 2 27B знаменует собой важный шаг в демократизации доступа к мощным AI-моделям. Раньше запуск модели с 27 миллиардами параметров требовал либо облачных сервисов, либо дорогостоящего оборудования с большим объемом VRAM. Теперь же, благодаря тернарной квантовизации, такие модели можно запускать на ноутбуках с 16 ГБ оперативной памяти или на однопользовательских GPU с 24 ГБ видеопамяти, таких как RTX 3090/4090.

Для разработчиков и энтузиастов это означает возможность локально тестировать агентов, использовать модели для кодирования (Cline coding agents) и обработки изображений без риска утечки данных в облако. Высокая скорость на RTX 5090 и M5 Max делает эти модели практически применимыми для интерактивных задач. Однако, как и в любом технологическом прорыве, есть свои нюансы. Потеря качества в долгосрочных агентных сценариях и необходимость использования специфических форков llama.cpp требуют от пользователей определенной технической подготовки.

Тем не менее, сохранение 98.2% производительности при сокращении размера в 9 раз — это впечатляющий результат. Он показывает, что тернарная квантовизация с ротацией Адамара является жизнеспособной альтернативой традиционным методам сжатия. В будущем мы можем увидеть еще более оптимизированные версии этих моделей, которые станут стандартом для локального развертывания AI в edge-устройствах и мобильных приложениях.

Если вы работаете с AI-инфраструктурой в России или странах СНГ, стоит обратить внимание на доступность этих моделей. Поскольку веса распространяются под лицензией Apache 2.0, их можно свободно использовать в коммерческих и некоммерческих проектах. Локальный запуск на отечественном оборудовании или на гибридных облачных решениях может стать эффективным способом снижения затрат на AI-интеграции. Главное — правильно настроить окружение и выбрать оптимальный формат упаковки (PTQ1_0 или PQ2_0) в зависимости от вашего GPU.

Источник: MarkTechPost ↗