Alibaba представила поколение моделей Qwen 3.8 в августе 2026 года. В линейку вошли четыре модели, которые кардинально различаются по архитектуре, лицензированию и требованиям к «железу». Для практиков важно понимать: не все модели можно скачать, а те, что доступны, требуют разного объема VRAM и имеют разные ограничения коммерческого использования. Ниже — конкретика по запуску, бенчмаркам и стоимости.
01Архитектура и доступность весов
В линейке Qwen 3.8 есть два типа моделей: плотные (dense) и смешанные (MoE). Это критически влияет на выбор GPU.
- Qwen3.8-27B: Плотная модель. Доступна на Hugging Face под лицензией Apache 2.0. Поддерживает текст, изображения и видео. Идеальный кандидат для локального запуска на одном-двух современных GPU.
- Qwen3.8-2.4T-A95B: MoE-модель. Несмотря на малое число активных параметров, все весовые коэффициенты должны быть загружены в память. Лицензия Qwen3.8-Max License. Поддерживает только текст. Требует мульти-GPU инфраструктуры (A100/H100 кластеры).
- Qwen3.8-Max и Flash: Закрытые API-модели. Max — это улучшенная версия 2.4T с поддержкой мультимедиа и контекстом 1M токенов. Flash — легковесная версия на базе архитектуры Qwen4. Весов нет в открытом доступе.
02Локальный запуск Qwen3.8-27B
Модель Qwen3.8-27B — самый доступный вариант для энтузиастов. При формате bf16 весы занимают значительный объем памяти. В формате fp8 объем снижается, что позволяет запустить модель на одном GPU с 24 ГБ VRAM с квантованием (GGUF/AWQ) или на двух GPU с 24 ГБ.
Для запуска через vLLM с нативным контекстом 262K токенов используйте следующую команду:
vllm serve Qwen/Qwen3.8-27B \
--port 8000 \
--tensor-parallel-size 2 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coderЕсли вам нужен контекст 1 000 000 токенов, необходимо применить технику масштабирования RoPE YaRN. Обратите внимание: статический YaRN может снизить качество ответов на коротких промптах. Используйте его только при необходимости обработки длинных документов.
03Сравнение производительности (Artificial Analysis)
Согласно тестам от 11 сентября 2026 года, локальные веса 2.4T и 27B показывают результаты, близкие к закрытому Max, особенно в задачах кодирования. Однако Max выигрывает за счет оптимизаций серверной части и встроенных инструментов.
| Модель | Intelligence Index | Coding Index | Agentic Index |
|---|---|---|---|
| Qwen3.8 Max (0902) | Значительно выше | Выше | Выше |
| Qwen3.8 2.4T A95B | Очень близко к Max | На уровне Max | На уровне Max |
| Qwen3.8 27B (xhigh) | Ниже Max | Ниже Max | Ниже Max |
Обратите внимание: 27B-модель тестировалась с уровнем рассуждения xhigh. Снижение effort может улучшить скорость, но ухудшит качество сложных логических задач.
04Лицензии и коммерческое использование
Лицензионные условия для открытых весов Qwen 3.8 строже, чем стандартный Apache 2.0.
- Qwen3.8-27B (Apache 2.0): Полная свобода. Нет ограничений по выручке или числу пользователей. Можно использовать в коммерческих продуктах без ограничений.
- Qwen3.8-2.4T-A95B (Qwen3.8-Max License): Требует указания имени модели в интерфейсе, если у продукта >100 млн активных пользователей или выручка >$20 млн/мес. Для бизнеса Model-as-a-Service (MaaS) с выручкой >$50 млн/год требуется отдельная лицензия.
- Qwen3.8-Flash-Next (Qwen Community License 1.0): Аналогичные ограничения по MaaS, но без порога в $50 млн — лицензия нужна сразу, если вы предоставляете инференс третьим лицам.
05Стоимость API (OpenRouter, $ за 1M токенов)
Если вы не хотите запускать модели локально, цены на OpenRouter (на 11.09.2026) следующие:
| Модель | Input ($) | Output ($) | Примечание |
|---|---|---|---|
| Qwen3.8-Max | Высокая | Высокая | Только API, мультимедиа |
| Qwen3.8-2.4T-A95B | Высокая | Высокая | Текст, открытые веса |
| Qwen3.8-27B | Низкая | Средняя | Разброс цен у провайдеров |
| Qwen3.8-Flash | Очень низкая | Очень низкая | Самая дешевая опция |
При использовании Prompt Caching цены на чтение кэша ниже: для Max — значительно дешевле базовой ставки, для Flash — минимальные. Для 27B цена чтения кэша варьируется в зависимости от провайдера, но остается низкой.
Источник: OpenRouter ↗
