Релиз модели24 сентября 2026 г., 22:21 МСК🤖 Auto

ThinkingCap-Qwen3.8-27B: -37% токенов рассуждения при потере 0.86% точности

BottleCap AI выпустила оптимизированную версию Qwen3.8-27B, сокращающую затраты на «мышление» модели на 37.2% с минимальной ценой в виде падения макро-точности всего на 0.86 процентных пункта.

Суть оптимизации: меньше слов, тот же результат

Лаборатория BottleCap AI представила модель ThinkingCap-Qwen3.8-27B — вторую в серии ThinkingCap. Это форк базовой модели Qwen3.8-27B от команды Qwen, переобученный для одной узкой задачи: сокращения длины цепочек рассуждений (reasoning traces). Исследователи не меняли стиль ответов или объем знаний, а сфокусировались на удалении «лишних» токенов, которые не влияют на финальный ответ.

Ключевая метрика: в среднем по 12 бенчмаркам модель использует на 37.2% меньше токенов на этапе рассуждения. Среднее количество токенов упало с 15,735 до 12,144. При этом макро-средняя точность снизилась незначительно — с 86.65% до 85.79% (потеря 0.86pp).

Детальные результаты по бенчмаркам

Тестирование проводилось в режиме reasoning_effort=xhigh. Оптимизация наиболее эффективна на задачах, требующих больших объемов контекста или многоязычных данных. Ниже приведена сводка изменений:

Бенчмарк Изменение токенов Изменение точности Примечание
MMMLU -65.5% (1656 → 571) Не указано Самое сильное сокращение
MMLU-Pro -57.3% Не указано —
GPQA-Diamond -43.1% (12772 → 7267) Не указано —
AA-LCR (Long Context) -38.6% +2.25pp (81.75% → 84.00%) Точность выросла
LiveCodeBench v6 -20.3% +0.07pp Точность выросла
IFBench -46.4% ~0% (79.75% → 79.71%) Точность стабильна
τ²-bench (Agentic) -30.9% -1.01pp —
AIME 2026 (Математика) -30.2% -3.85pp (98.13% → 94.27%) Самая высокая цена оптимизации

Влияние на стоимость и надежность

Сокращение токенов рассуждения напрямую влияет на стоимость инференса. BottleCap также отмечает улучшение надежности: при лимите в 16K токенов на ответ доля усеченных ответов (truncated traces) упала с 0.51% до 0.34%, а количество зацикливаний (looping) — с 0.06% до 0.05%.

Модель сохраняет совместимость с базовым Qwen3.8-27B. Она работает через vLLM (0.29.0) и SGLang, используя тот же шаблон чата и парсер qwen3_xml. Доступны сборки в форматах FP8, NVFP4, GGUF и MLX, что позволяет запускать модель на NVIDIA Hopper/Blackwell, Apple Silicon (Mac с 32GB RAM) и других платформах.

Лицензирование и доступ

Веса модели находятся в закрытом репозитории (gated). Лицензия — PolyForm Small Business 1.0.0 с дополнительным разрешением BottleCap на личное использование. Для коммерческого применения, выходящего за рамки малого бизнеса, требуется отдельное соглашение с BottleCap. Базовая модель Qwen остается под лицензией Apache-2.0.

Источник: MarkTechPost ↗