Суть оптимизации: меньше слов, тот же результат
Лаборатория BottleCap AI представила модель ThinkingCap-Qwen3.8-27B — вторую в серии ThinkingCap. Это форк базовой модели Qwen3.8-27B от команды Qwen, переобученный для одной узкой задачи: сокращения длины цепочек рассуждений (reasoning traces). Исследователи не меняли стиль ответов или объем знаний, а сфокусировались на удалении «лишних» токенов, которые не влияют на финальный ответ.
Ключевая метрика: в среднем по 12 бенчмаркам модель использует на 37.2% меньше токенов на этапе рассуждения. Среднее количество токенов упало с 15,735 до 12,144. При этом макро-средняя точность снизилась незначительно — с 86.65% до 85.79% (потеря 0.86pp).
Детальные результаты по бенчмаркам
Тестирование проводилось в режиме reasoning_effort=xhigh. Оптимизация наиболее эффективна на задачах, требующих больших объемов контекста или многоязычных данных. Ниже приведена сводка изменений:
| Бенчмарк | Изменение токенов | Изменение точности | Примечание |
|---|---|---|---|
| MMMLU | -65.5% (1656 → 571) | Не указано | Самое сильное сокращение |
| MMLU-Pro | -57.3% | Не указано | — |
| GPQA-Diamond | -43.1% (12772 → 7267) | Не указано | — |
| AA-LCR (Long Context) | -38.6% | +2.25pp (81.75% → 84.00%) | Точность выросла |
| LiveCodeBench v6 | -20.3% | +0.07pp | Точность выросла |
| IFBench | -46.4% | ~0% (79.75% → 79.71%) | Точность стабильна |
| τ²-bench (Agentic) | -30.9% | -1.01pp | — |
| AIME 2026 (Математика) | -30.2% | -3.85pp (98.13% → 94.27%) | Самая высокая цена оптимизации |
Влияние на стоимость и надежность
Сокращение токенов рассуждения напрямую влияет на стоимость инференса. BottleCap также отмечает улучшение надежности: при лимите в 16K токенов на ответ доля усеченных ответов (truncated traces) упала с 0.51% до 0.34%, а количество зацикливаний (looping) — с 0.06% до 0.05%.
Модель сохраняет совместимость с базовым Qwen3.8-27B. Она работает через vLLM (0.29.0) и SGLang, используя тот же шаблон чата и парсер qwen3_xml. Доступны сборки в форматах FP8, NVFP4, GGUF и MLX, что позволяет запускать модель на NVIDIA Hopper/Blackwell, Apple Silicon (Mac с 32GB RAM) и других платформах.
Лицензирование и доступ
Веса модели находятся в закрытом репозитории (gated). Лицензия — PolyForm Small Business 1.0.0 с дополнительным разрешением BottleCap на личное использование. Для коммерческого применения, выходящего за рамки малого бизнеса, требуется отдельное соглашение с BottleCap. Базовая модель Qwen остается под лицензией Apache-2.0.
Источник: MarkTechPost ↗