Релиз модели18 сентября 2026 г., 21:17 МСК🤖 Auto

Ternary Bonsai 2: 5.9 ГБ LLM с 98.2% от Qwen3.8

PrismML выпустила квантованную модель Ternary Bonsai 2 27B, которая занимает всего 5.9 ГБ, но сохраняет 98.2% эффективности оригинального Qwen3.8 27B.

Баннер новости 7820

Революция в сжатии: 9.1x меньше, почти та же мощь

Лаборатория PrismML представила Ternary Bonsai 2 27B — версию модели Qwen3.8 27B с тернарными весами. Ключевое достижение: размер весов сократился с 53.80 ГБ (FP16) до 5.93 ГБ (формат PTQ1_0). При этом модель сохраняет 98.2% от среднего балла родителя по 20 бенчмаркам. Это позволяет запускать 27-миллиардную модель на ноутбуке с 16 ГБ ОЗУ или одной видеокартой с 24 ГБ памяти.

Техническая суть: Тернарные веса и ротация

Модель использует архитектуру Qwen3.8 (27.36B параметров), но веса квантованы до трех значений: -1, 0 и +1. Для хранения масштаба используется 1 FP16 значение на группу из 128 весов, что дает плотность 1.76 бит на вес. Для минимизации потерь качества применяется блочная ротация Хадамара (Hadamard rotation) перед квантованием, заимствованная из метода SpinQuant. Лишь 0.0976% параметров (нормализация и рекуррентные состояния) остаются в высокой точности.

Результаты бенчмарков: Где теряется качество?

Модель демонстрирует выдающиеся результаты в математике и коде, но страдает в сложных агентных сценариях. Ниже приведено сравнение с оригиналом Qwen3.8 27B и стандартным квантованием IQ2_XXS:

Категория Qwen3.8 27B (FP16) Ternary Bonsai 2 27B Retention IQ2_XXS (7.3 GB)
Overall (20 benchmarks) 85.4 83.9 98.2% 75.2
Math 97.06 96.57 99.5% -
Coding 82.17 81.58 99.3% -
Knowledge & Reasoning 86.66 83.95 96.9% -
Agentic & Tool Calling 79.74 77.57 97.3% -
SWE-bench Verified 80.6 60.8 ~75% -
AIME26 - 95.83 - 78.6

Заметное падение (до ~75% от оригинала) наблюдается в задачах долгосрочного планирования агентов: Terminal-Bench 2.1 (52.8 против 69.7) и SWE-bench Verified (60.8 против 80.6). Также модель не поддерживает режим «low effort» для рассуждений.

Производительность и совместимость

На RTX 5090 модель генерирует 142.5 токенов в секунду при энергопотреблении 0.582 мВт/токен. На Apple M5 Max — 46.8 т/с. Важно отметить: стандартный llama.cpp не поддерживает новые форматы упаковки (PTQ1_0 и PQ2_0). Для запуска требуется форк от PrismML или runtime MLX. Модель доступна под лицензией Apache 2.0.

Бенчмарки

БенчмаркTernary Bonsai 2 27BQwen3.8 27BQwen3.8 27B (IQ2_XXS)
SWE-bench Verified60.8%80.6%
Terminal-Bench 2.152.8%69.7%
AIME2695.83%78.6%
LiveCodeBench v690.07%70.05%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗