Революционное сжатие без потери интеллекта
Компания PrismML анонсировала релиз модели Ternary Bonsai 2 27B, основанной на архитектуре Qwen3.8 27B. Главная инновация заключается в использовании тернарных весов ({−1, 0, +1}) с групповым масштабированием FP16, что позволяет достичь эффективной плотности 1,76 бита на вес. В результате общий объем модели составляет всего 5,9 ГБ, что делает её более чем в 9 раз меньше оригинала.
Несмотря на агрессивное сжатие, модель сохраняет 98,2% совокупной производительности по бенчмаркам по сравнению с полноточной версией. Разработчики характеризуют этот результат как «почти без потерь» (near-lossless), что критически важно для задач, где малейшая деградация качества приводит к ошибкам в цепочках рассуждений.
Сравнение производительности: Bonsai 2 vs Qwen3.8
Модель демонстрирует выдающиеся результаты в сложных задачах, таких как кодинг, работа с инструментами (agentic) и зрительное восприятие. Ниже приведена сравнительная таблица ключевых метрик (в режиме мышления/thinking mode):
| Категория / Бенчмарк | Ternary Bonsai 2 27B | Qwen3.8 27B (Full Precision) | Qwen3.6 27B |
|---|---|---|---|
| Agentic & Tool Calling (τ²-bench, BFCLv3) | 77.57 | 79.74 | 80.05 |
| Coding (HumanEval+, LiveCodeBench v6) | 81.58 | 82.17 | 82.57 |
| Instruction Following (IFBench, IFEval) | 82.66 | 81.25 | 74.53 |
| Knowledge & Reasoning (MMLU-Redux, GPQA) | 83.95 | 86.66 | 84.71 |
| Math (AIME 2026, GSM8K, MATH-500) | 96.57 | 97.06 | 94.66 |
| Vision (CharXiv, A-OKVQA, OCRBench) | 78.59 | 81.64 | 79.82 |
| Overall Score | 83.9 | 85.4 | 83.6 |
Скорость и энергоэффективность на железе
Благодаря низкой битности, модель демонстрирует высокую пропускную способность и экономичность. На видеокарте NVIDIA GeForce RTX 5090 скорость генерации достигает 143 токенов в секунду, а на чипе Apple M5 Max — 46,8 токенов/с. На RTX 4090 энергопотребление составляет всего 0,714 мВт·ч на токен, что на 40% эффективнее, чем у 8-миллиардных моделей в полноточной реализации.
Практическое применение и доступность
Модель поддерживает контекстное окно в 262K токенов и работает с мультимодальным вводом (текст + изображения). Она лицензирована под Apache 2.0 и доступна для запуска на NVIDIA GPU (через CUDA) и устройствах Apple (Mac, iPhone, iPad) через MLX. Разработчики подчеркивают, что такая плотность интеллекта позволяет запускать локальных AI-агентов для кодинга, анализа документов и управления компьютером без постоянной отправки данных в облако.
Бенчмарки
| Бенчмарк | Ternary Bonsai 2 27B | Qwen3.6 27B | Qwen3.8 27B |
|---|---|---|---|
| Agentic & Tool Calling (τ²-bench, BFCLv3) | 77.57% | 80.05% | 79.74% |
| Coding (HumanEval+, LiveCodeBench v6, MBPP+, Big | 81.58% | 82.57% | 82.17% |
| Instruction Following (IFBench, IFEval) | 82.66% | 74.53% | 81.25% |
| Knowledge & Reasoning (MMLU-Redux, GPQA Diamond, | 83.95% | 84.71% | 86.66% |
| Math (AIME 2026, AIME 2025, GSM8K, MATH-500) | 96.57% | 94.64% | 97.06% |
| Vision (CharXiv, A-OKVQA, OmniDocBench v1.6, Rea | 78.59% | 79.82% | 81.64% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Prismml ↗
