В мире больших языковых моделей (LLM) вечным компромиссом остается баланс между размером модели, скоростью работы и интеллектуальными способностями. Обычно, чтобы получить высокую точность ответов, сложные рассуждения и понимание контекста, разработчикам приходится использовать модели с десятками миллиардов параметров, которые требуют мощных серверных GPU с огромным объемом видеопамяти. Однако команда PrismML недавно представила решение, которое бросает вызов этой парадигме. Их новая модель Ternary Bonsai 2 27B демонстрирует, что можно существенно сократить вычислительные затраты, не теряя при этом критически важную функциональность.
Это не просто еще одна квантованная версия популярной архитектуры. Это эксперимент с тернарными весами, который позволяет упаковать модель объемом 27.36 миллиарда параметров в файл размером всего 5.93 ГБ. Для сравнения, оригинальная модель Qwen3.8 в формате FP16 занимает около 53.8 ГБ. При этом, по заявлениям разработчиков, Ternary Bonsai 2 сохраняет 98.2% от средней производительности родителя на 20 различных бенчмарках. Это открывает двери для локального запуска мощных мультимодальных моделей на потребительском оборудовании, включая ноутбуки и игровые видеокарты среднего класса.
01Что такое Ternary Bonsai 2 и почему это важно?
Ternary Bonsai 2 27B — это тернарная версия модели Qwen3.8 27B. Важно понимать, что архитектура самой нейронной сети осталась неизменной. Модель по-прежнему имеет 27.36 миллиарда параметров, которые распределяются следующим образом: 24.35 миллиарда приходится на языковое ядро (backbone), 2.54 миллиарда — на эмбеддинги и заголовок языковой модели (LM head), и 0.47 миллиарда — на визуальную башню (vision tower), отвечающую за обработку изображений.
Языковое ядро использует гибридный механизм внимания: примерно 75% слоев работают с линейным вниманием, а 25% — с полным вниманием (full-attention). Это сочетание позволяет модели эффективно обрабатывать длинные контексты (до 262 тысяч токенов) и поддерживать мультимодальный ввод, включая текст и изображения. Главная инновация заключается в том, как хранятся веса этих слоев. В стандартных моделях веса хранятся в формате с плавающей запятой (обычно FP16 или BF16), что требует много памяти. В Ternary Bonsai 2 веса квантованы до трех значений: -1, 0 и +1.
Этот подход радикально снижает объем данных. Однако, чтобы сохранить точность, команда PrismML не квантовала все веса. Лишь 26.2 миллиона параметров, что составляет менее 0.1% от общего числа, остаются в высокой точности. Это веса пути рекуррентного состояния и веса нормализации. Остальная масса параметров, включая проекции внимания, многослойные перцептроны (MLP) и заголовок модели, переведена в тернарный формат. Визуальная башня в формате GGUF поставляется отдельно и весит 0.63 ГБ, загружаясь только тогда, когда требуется обработка изображений.
02Как работает тернарный формат: математика сжатия
Чтобы понять, как удалось достичь такого сжатия, нужно заглянуть в математику процесса. Каждый вес в тернарной модели принимает одно из трех значений: -1, 0 или +1. Математически это соответствует логарифму по основанию 2 от 3, то есть примерно 1.585 бита на вес. Однако, чтобы восстановить исходные значения, необходимо хранить масштабный коэффициент (scale). В данной реализации группа из 128 весов делится на один 16-битный (FP16) масштабный коэффициент.
Если сложить 1.585 бита на сами значения и 16 бит на масштаб, распределенные на 128 весов, мы получаем примерно 1.71 бита на вес. Если учесть, что небольшая часть весов (рекуррентные состояния) хранится в высокой точности, итоговый средний размер модели составляет 1.72 бита на параметр. Это колоссальное сжатие по сравнению с 16 битами в FP16.

Для практической реализации в формате GGUF описаны два метода упаковки:
- PTQ1_0: Плотная упаковка тритов (тернарных значений). Размер файла составляет 5.93 ГБ. Этот формат оптимизирован для скорости декодирования на некоторых архитектурах GPU.
- PQ2_0: Каждый трит хранится в 2-битном слоте. Размер файла увеличивается до 7.25 ГБ. Однако этот формат дешевле в плане вычислительных ресурсов для распаковки, что может быть выгоднее на других типах процессоров.
Кроме того, перед назначением тернарных значений применяется ротация в базисе. PrismML использует блочное преобразование Адамара (Hadamard rotation) с размером блока 1024. Во время выполнения (runtime) применяется обратное преобразование к активациям перед каждым умножением. Эта техника, известная как SpinQuant, помогает минимизировать ошибки квантования, сохраняя распределение данных более естественным для нейронной сети.
03Сравнение производительности: где модель сильна, а где слаба
Оценка эффективности Ternary Bonsai 2 проводилась командой PrismML с использованием EvalScope и vLLM на GPU H100. Все тесты выполнялись в режиме "thinking mode" (режим размышления), что важно для задач, требующих сложных рассуждений. Результаты показывают удивительно высокую сохранность способностей оригинальной модели Qwen3.8 27B.
В таблице ниже приведены средние баллы по ключевым категориям. Обратите внимание на столбец "Retention" (Сохранение), который показывает, какой процент от оригинала сохранила квантованная версия.
| Способность | Qwen3.6 27B | Qwen3.8 27B (База) | Ternary Bonsai 2 27B | Retention |
|---|---|---|---|---|
| Знания и рассуждения | 84.71 | 86.66 | 83.95 | 96.9% |
| Математика | 94.64 | 97.06 | 96.57 | 99.5% |
| Программирование | 82.57 | 82.17 | 81.58 | 99.3% |
| Агентность и вызов инструментов | 80.05 | 79.74 | 77.57 | 97.3% |
| Следование инструкциям | 74.53 | 81.25 | 82.66 | 101.7% |
| Зрение (Vision) | 79.82 | 81.64 | 78.59 | 96.3% |
| Итого (20 бенчмарков) | 83.6 | 85.4 | 83.9 | 98.2% |
Особого внимания заслуживает сравнение с традиционными методами квантования. Например, сборка Qwen3.8 27B с квантованием IQ2_XXS занимает 7.3 ГБ, но набирает в среднем лишь 75.2 балла. На тесте AIME26 (сложная математика) Ternary Bonsai 2 набирает 95.83 против 78.6 у IQ2_XXS. На LiveCodeBench v6 разрыв еще более заметен: 90.07 против 70.05. Это доказывает, что тернарный подход значительно превосходит стандартные методы квантования в сохранении интеллектуальных способностей.

Также важно отметить, что модель не поддерживает "низкие усилия" (low effort) в рассуждениях. При среднем уровне усилий она набирает 79.3 против 82.6 у FP16 базовой модели. Все результаты являются собственными исследованиями PrismML и пока не были независимо воспроизведены другими сообществами.
04Скорость работы на реальном оборудовании
Один из главных вопросов при использовании квантованных моделей — насколько быстро они работают на доступном "железе". Тесты проводились PrismML с использованием собственных кастомных ядер (custom kernels) 16 сентября 2026 года. Декодирование выполнялось с размером батча 1.
Результаты впечатляют, особенно для потребительских видеокарт:
- NVIDIA RTX 5090: 142.5 токенов в секунду. Энергоэффективность составляет 0.582 мВт на токен. Это один из самых быстрых результатов, показанных для модели такого размера.
- NVIDIA RTX 4090: 96.7 токенов в секунду (с упаковкой PTQ1_0). Это уровень, достаточный для комфортного общения в реальном времени.
- NVIDIA L4 (72 Вт): 32.1 токена в секунду. Хороший результат для энергоэффективных серверных решений.
- Apple M5 Max: 46.8 токенов в секунду.
- Apple M5 Pro: 27.7 токенов в секунду.
Интересно, что ни один из форматов упаковки (PTQ1_0 или PQ2_0) не является универсально лучшим. PTQ1_0 быстрее на картах архитектуры Ada и на L4. PQ2_0 выигрывает на архитектурах Blackwell, Hopper, Ampere и на Apple Silicon, а также показывает лучшую скорость при обработке промптов (prompt processing) на всех платформах.
Команда PrismML также заявляет, что их модель обеспечивает на 40% лучшую энергоэффективность по сравнению с полноточной моделью на 8 миллиардов параметров. Это делает Ternary Bonsai 2 привлекательным выбором для устройств с ограниченным питанием.

05Как запустить Ternary Bonsai 2 локально
Запуск этой модели требует специфического программного обеспечения. Стандартная версия llama.cpp не поддерживает типы PTQ1_0 и PQ2_0, поэтому необходимо использовать форк от PrismML. Также доступна поддержка через MLX runtime для пользователей Apple.
Официальный путь запуска описан в репозитории Bonsai-demo. Процесс установки прост:
- Клонируйте репозиторий.
- Запустите скрипт установки:
./setup.sh - Запустите сервер чата, поддержки зрения и инструментов:
./scripts/start_llama_server.sh
После этого модель будет доступна по адресу localhost:8080. Пользователи Mac могут использовать пакет MLX, который требует встроенного загрузчика. Также доступна демонстрация через WebGPU, позволяющая запускать модель прямо в браузере, что открывает возможности для тестирования без установки дополнительного ПО.
06Что это значит на практике
Выход Ternary Bonsai 2 27B знаменует собой важный шаг в демократизации доступа к мощным AI-моделям. Раньше запуск модели с 27 миллиардами параметров требовал либо облачных сервисов, либо дорогостоящего оборудования с большим объемом VRAM. Теперь же, благодаря тернарной квантовизации, такие модели можно запускать на ноутбуках с 16 ГБ оперативной памяти или на однопользовательских GPU с 24 ГБ видеопамяти, таких как RTX 3090/4090.
Для разработчиков и энтузиастов это означает возможность локально тестировать агентов, использовать модели для кодирования (Cline coding agents) и обработки изображений без риска утечки данных в облако. Высокая скорость на RTX 5090 и M5 Max делает эти модели практически применимыми для интерактивных задач. Однако, как и в любом технологическом прорыве, есть свои нюансы. Потеря качества в долгосрочных агентных сценариях и необходимость использования специфических форков llama.cpp требуют от пользователей определенной технической подготовки.
Тем не менее, сохранение 98.2% производительности при сокращении размера в 9 раз — это впечатляющий результат. Он показывает, что тернарная квантовизация с ротацией Адамара является жизнеспособной альтернативой традиционным методам сжатия. В будущем мы можем увидеть еще более оптимизированные версии этих моделей, которые станут стандартом для локального развертывания AI в edge-устройствах и мобильных приложениях.
Если вы работаете с AI-инфраструктурой в России или странах СНГ, стоит обратить внимание на доступность этих моделей. Поскольку веса распространяются под лицензией Apache 2.0, их можно свободно использовать в коммерческих и некоммерческих проектах. Локальный запуск на отечественном оборудовании или на гибридных облачных решениях может стать эффективным способом снижения затрат на AI-интеграции. Главное — правильно настроить окружение и выбрать оптимальный формат упаковки (PTQ1_0 или PQ2_0) в зависимости от вашего GPU.
Источник: MarkTechPost ↗
