Главная/Блог/Обзор/Qwen 3.8: Локальный запуск, VRAM и цены…
Обзор3 мин чтения · 28 сентября 2026 г.

Qwen 3.8: Локальный запуск, VRAM и цены на модели от Alibaba

Разбор линейки Qwen 3.8: как запустить 27B и 2.4T локально, требования к VRAM, сравнение лицензий и стоимость API-запросов.

Qwen 3.8: Локальный запуск, VRAM и цены на модели от Alibaba

Alibaba представила поколение моделей Qwen 3.8 в августе 2026 года. В линейку вошли четыре модели, которые кардинально различаются по архитектуре, лицензированию и требованиям к «железу». Для практиков важно понимать: не все модели можно скачать, а те, что доступны, требуют разного объема VRAM и имеют разные ограничения коммерческого использования. Ниже — конкретика по запуску, бенчмаркам и стоимости.

01Архитектура и доступность весов

В линейке Qwen 3.8 есть два типа моделей: плотные (dense) и смешанные (MoE). Это критически влияет на выбор GPU.

  • Qwen3.8-27B: Плотная модель. Доступна на Hugging Face под лицензией Apache 2.0. Поддерживает текст, изображения и видео. Идеальный кандидат для локального запуска на одном-двух современных GPU.
  • Qwen3.8-2.4T-A95B: MoE-модель. Несмотря на малое число активных параметров, все весовые коэффициенты должны быть загружены в память. Лицензия Qwen3.8-Max License. Поддерживает только текст. Требует мульти-GPU инфраструктуры (A100/H100 кластеры).
  • Qwen3.8-Max и Flash: Закрытые API-модели. Max — это улучшенная версия 2.4T с поддержкой мультимедиа и контекстом 1M токенов. Flash — легковесная версия на базе архитектуры Qwen4. Весов нет в открытом доступе.
⚠️
Важно про VRAM для 2.4T. Не путайте активные параметры с требуемой памятью. Требуется огромный объем VRAM, что недоступно для домашних ПК.

02Локальный запуск Qwen3.8-27B

Модель Qwen3.8-27B — самый доступный вариант для энтузиастов. При формате bf16 весы занимают значительный объем памяти. В формате fp8 объем снижается, что позволяет запустить модель на одном GPU с 24 ГБ VRAM с квантованием (GGUF/AWQ) или на двух GPU с 24 ГБ.

Для запуска через vLLM с нативным контекстом 262K токенов используйте следующую команду:

terminalbash
vllm serve Qwen/Qwen3.8-27B \
  --port 8000 \
  --tensor-parallel-size 2 \
  --max-model-len 262144 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

Если вам нужен контекст 1 000 000 токенов, необходимо применить технику масштабирования RoPE YaRN. Обратите внимание: статический YaRN может снизить качество ответов на коротких промптах. Используйте его только при необходимости обработки длинных документов.

💡
Мультимедиа. В отличие от версии 2.4T, локальная 27B-версия поддерживает ввод изображений и видео. Проверка отправки изображения на 2.4T-версию возвращает ошибку 404.

03Сравнение производительности (Artificial Analysis)

Согласно тестам от 11 сентября 2026 года, локальные веса 2.4T и 27B показывают результаты, близкие к закрытому Max, особенно в задачах кодирования. Однако Max выигрывает за счет оптимизаций серверной части и встроенных инструментов.

Модель Intelligence Index Coding Index Agentic Index
Qwen3.8 Max (0902) Значительно выше Выше Выше
Qwen3.8 2.4T A95B Очень близко к Max На уровне Max На уровне Max
Qwen3.8 27B (xhigh) Ниже Max Ниже Max Ниже Max

Обратите внимание: 27B-модель тестировалась с уровнем рассуждения xhigh. Снижение effort может улучшить скорость, но ухудшит качество сложных логических задач.

04Лицензии и коммерческое использование

Лицензионные условия для открытых весов Qwen 3.8 строже, чем стандартный Apache 2.0.

  • Qwen3.8-27B (Apache 2.0): Полная свобода. Нет ограничений по выручке или числу пользователей. Можно использовать в коммерческих продуктах без ограничений.
  • Qwen3.8-2.4T-A95B (Qwen3.8-Max License): Требует указания имени модели в интерфейсе, если у продукта >100 млн активных пользователей или выручка >$20 млн/мес. Для бизнеса Model-as-a-Service (MaaS) с выручкой >$50 млн/год требуется отдельная лицензия.
  • Qwen3.8-Flash-Next (Qwen Community License 1.0): Аналогичные ограничения по MaaS, но без порога в $50 млн — лицензия нужна сразу, если вы предоставляете инференс третьим лицам.
📌
Для РФ. Apache 2.0 (27B) не имеет географических ограничений. Лицензии Qwen требуют соблюдения условий, но их enforcement из РФ затруднен, однако для легального экспорта продуктов в США/ЕС нужно соблюдать условия MaaS.

05Стоимость API (OpenRouter, $ за 1M токенов)

Если вы не хотите запускать модели локально, цены на OpenRouter (на 11.09.2026) следующие:

Модель Input ($) Output ($) Примечание
Qwen3.8-Max Высокая Высокая Только API, мультимедиа
Qwen3.8-2.4T-A95B Высокая Высокая Текст, открытые веса
Qwen3.8-27B Низкая Средняя Разброс цен у провайдеров
Qwen3.8-Flash Очень низкая Очень низкая Самая дешевая опция

При использовании Prompt Caching цены на чтение кэша ниже: для Max — значительно дешевле базовой ставки, для Flash — минимальные. Для 27B цена чтения кэша варьируется в зависимости от провайдера, но остается низкой.

Источник: OpenRouter ↗