Релиз модели18 сентября 2026 г., 21:48 МСК🤖 Auto

PrismML выпустила Bonsai 2 27B: 98% качества при сжатии в 9 раз

Лаборатория PrismML представила модель Ternary Bonsai 2 27B, которая сохраняет 98,2% эффективности оригинала Qwen3.8, занимая всего 5,9 ГБ памяти. Это открывает путь к мощным AI-агентам на локальных устройствах.

Баннер новости 7823

Революционное сжатие без потери интеллекта

Компания PrismML анонсировала релиз модели Ternary Bonsai 2 27B, основанной на архитектуре Qwen3.8 27B. Главная инновация заключается в использовании тернарных весов ({−1, 0, +1}) с групповым масштабированием FP16, что позволяет достичь эффективной плотности 1,76 бита на вес. В результате общий объем модели составляет всего 5,9 ГБ, что делает её более чем в 9 раз меньше оригинала.

Несмотря на агрессивное сжатие, модель сохраняет 98,2% совокупной производительности по бенчмаркам по сравнению с полноточной версией. Разработчики характеризуют этот результат как «почти без потерь» (near-lossless), что критически важно для задач, где малейшая деградация качества приводит к ошибкам в цепочках рассуждений.

Сравнение производительности: Bonsai 2 vs Qwen3.8

Модель демонстрирует выдающиеся результаты в сложных задачах, таких как кодинг, работа с инструментами (agentic) и зрительное восприятие. Ниже приведена сравнительная таблица ключевых метрик (в режиме мышления/thinking mode):

Категория / Бенчмарк Ternary Bonsai 2 27B Qwen3.8 27B (Full Precision) Qwen3.6 27B
Agentic & Tool Calling (τ²-bench, BFCLv3) 77.57 79.74 80.05
Coding (HumanEval+, LiveCodeBench v6) 81.58 82.17 82.57
Instruction Following (IFBench, IFEval) 82.66 81.25 74.53
Knowledge & Reasoning (MMLU-Redux, GPQA) 83.95 86.66 84.71
Math (AIME 2026, GSM8K, MATH-500) 96.57 97.06 94.66
Vision (CharXiv, A-OKVQA, OCRBench) 78.59 81.64 79.82
Overall Score 83.9 85.4 83.6

Скорость и энергоэффективность на железе

Благодаря низкой битности, модель демонстрирует высокую пропускную способность и экономичность. На видеокарте NVIDIA GeForce RTX 5090 скорость генерации достигает 143 токенов в секунду, а на чипе Apple M5 Max — 46,8 токенов/с. На RTX 4090 энергопотребление составляет всего 0,714 мВт·ч на токен, что на 40% эффективнее, чем у 8-миллиардных моделей в полноточной реализации.

Практическое применение и доступность

Модель поддерживает контекстное окно в 262K токенов и работает с мультимодальным вводом (текст + изображения). Она лицензирована под Apache 2.0 и доступна для запуска на NVIDIA GPU (через CUDA) и устройствах Apple (Mac, iPhone, iPad) через MLX. Разработчики подчеркивают, что такая плотность интеллекта позволяет запускать локальных AI-агентов для кодинга, анализа документов и управления компьютером без постоянной отправки данных в облако.

Бенчмарки

БенчмаркTernary Bonsai 2 27BQwen3.6 27BQwen3.8 27B
Agentic & Tool Calling (τ²-bench, BFCLv3)77.57%80.05%79.74%
Coding (HumanEval+, LiveCodeBench v6, MBPP+, Big81.58%82.57%82.17%
Instruction Following (IFBench, IFEval)82.66%74.53%81.25%
Knowledge & Reasoning (MMLU-Redux, GPQA Diamond,83.95%84.71%86.66%
Math (AIME 2026, AIME 2025, GSM8K, MATH-500)96.57%94.64%97.06%
Vision (CharXiv, A-OKVQA, OmniDocBench v1.6, Rea78.59%79.82%81.64%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Prismml ↗