Релиз модели2 сентября 2026 г., 09:46 МСК🤖 Auto

Qwen3.8-Max-0902: Новый стандарт кодинга и 1M контекста

Alibaba Cloud выпустила обновленный снимок модели Qwen3.8-Max с улучшенным автономным программированием, мультимодальным анализом и поддержкой 1 миллиона токенов контекста.

Баннер новости 6568

Прорыв в инженерном кодинге и автономной разработке

Модель Qwen3.8-Max-0902 (alias qwen3.8-max-2026-09-02) позиционируется как значительное улучшение базовой версии Qwen3.8-Max. Ключевое изменение касается способности к сложному инженерному программированию: модель теперь эффективнее справляется с проектами масштаба enterprise и автономной разработкой на длительных горизонтах. Улучшена работа в режиме «коллаборативных агентов» — модель демонстрирует большую стабильность при оркестровке множества инструментов и выполнении задач от начала до конца.

Мультимодальность и работа с данными

Нативное понимание визуального контента было доработано для повышения точности в трех ключевых областях:

  • Анализ графиков и диаграмм: более точное извлечение данных из визуализаций.
  • Парсинг документов: улучшенная структура и извлечение информации из сложных PDF/Word файлов.
  • Мультимодальное восприятие: общая надежность анализа изображений и видео.

Технические характеристики и лимиты

Модель сохраняет поддержку окна контекста в 1 миллион токенов, режим глубокого мышления (Thinking Mode) и полный набор встроенных инструментов. Ниже приведены ключевые технические параметры и ограничения API:

Параметр Значение
Максимальный контекст 1 000 000 токенов
Максимальный ввод (Input) 991K токенов (131K в режиме мышления)
Максимальный вывод (Output) 131 000 токенов
Максимальное время рассуждения 262 000 токенов
Лимит скорости (TPM) 1 000 000 токенов в минуту
Лимит запросов (RPM) 15 000 запросов в минуту

Стоимость и встроенные инструменты

Для оптимизации затрат внедрена система кэширования контекста. Модель поддерживает встроенные инструменты: code_interpreter, web_search, web_extractor, а также поиск по изображениям и тексту (i2i/t2i_search). Доступна функция Prefix Completion для строгого продолжения текста и Structured Outputs для гарантированного формата JSON.

Тип операции Цена за 1M токенов
Входные токены (Input) $0.25
Выходные токены (Output) $1.00 (стандартная ставка для Max-серии, уточняется в docs)
Создание кэша (Explicit Cache Creation) $2.50
Чтение из кэша (Explicit Cache Read) $0.17

Интеграция через API

Модель доступна через DashScope API с совместимостью OpenAI. Разработчики могут использовать параметр enable_thinking для активации режима рассуждений, что позволяет отслеживать процесс «мышления» модели отдельно от финального ответа. Поддерживается потоковая передача (streaming) и пакетная обработка запросов для снижения затрат.

Источник: Qwencloud ↗