Релиз модели18 сентября 2026 г., 12:16 МСК🤖 Auto

Qwen3.8-Omni-Flash: Агентный мультимодальный AI с контекстом 1M токенов

Alibaba представила Qwen3.8-Omni-Flash — первую омни-модель с агентными способностями, обрабатывающую текст, аудио, видео и изображения. Модель доступна через API с ценой $0.15 за 1M входных токенов.

Баннер новости 7785

Агентный подход к мультимодальности

Команда Qwen из Alibaba выпустила Qwen3.8-Omni-Flash, позиционируя её как первую омни-модель, построенную вокруг агентных возможностей. В отличие от традиционных моделей, которые просто анализируют контент, эта архитектура реализует цикл: понимание контента → планирование задачи → выполнение с помощью инструментов → выдача результата.

Модель принимает на вход текст, изображения, аудио и видео, но возвращает только текст. Базовая архитектура основана на Qwen3.8-Flash-Next (открытые веса которой появились в августе 2026 года). Ключевая особенность — агентное восприятие для длинных видео: модель не просматривает файл от начала до конца, а ищет доказательства, необходимые для ответа, что снижает расход токенов.

Технические характеристики и бенчмарки

Модель поддерживает контекстное окно в 1 миллион токенов (до 991K на вход, 131K на выход). По умолчанию включен режим рассуждений (reasoning) с уровнем усилия xhigh. Ниже приведены сравнительные результаты с предыдущей версией Qwen3.5-Omni-Plus:

Метрика / Бенчмарк Результат Qwen3.8-Omni-Flash Прирост / Эффект
Средний балл (29 тестов) Улучшение более чем на 25%
WildClawBench-MM +36.5 баллов
UniClawBench 69.6
OmniVideoBench (точность) 67.8 +4.4 (рост с 63.4)
Расход токенов (OmniVideoBench) 79,117 Снижение на 45.7% (было 145,736)
LongAudioSpan +8.3 балла

Alibaba заявляет, что аудио-визуальные показатели сопоставимы с Gemini 3.8 Flash, а общее аудио-производство превосходит его. Агентные способности (WildClawBench-MM и UniClawBench) в среднем выросли на 19.5 балла.

Стоимость и ограничения

Модель доступна только через API на платформах QwenCloud, Alibaba Cloud Model Studio и Qwen Studio. Открытые веса для самостоятельного хостинга не предоставлены. Тарификация в QwenCloud:

  • Входные токены: $0.15 за 1M токенов.
  • Выходные токены: $0.47 за 1M токенов.
  • Кэш (implicit cache hits): $0.016 за 1M токенов.

Alibaba утверждает, что затраты на ввод аудио снизились более чем на 98%, а аудио-визуального ввода — более чем на 93% по сравнению с предшественником. Поддерживаются видео до 2 часов (2 ГБ) и аудио до 3 часов. Доступно в 6 регионах: Пекин, Сингапур, Гонконг, Токио, Франкфурт и Вирджиния.

Инструментарий для разработчиков

Поскольку модель выдает только текст, для работы с медиа используются открытые плагины Qwen-MM-Plugins (лицензия Apache-2.0). Они позволяют интегрировать мультимодальные навыки в различные агентные фреймворки (Claude Code, Codex, Qoder и др.). Основные демо-функции плагинов:

  • omni-memory: создание аудио-визуальной памяти длинных видео.
  • omni-video2note: конвертация обучающих видео в PDF с иллюстрациями.
  • omni-chatcut: генерация музыкальных клипов, комментариев к фильмам и перевод видео с сохранением голоса.

API поддерживает протоколы DashScope и OpenAI, включая Function Calling, веб-поиск, структурированные выводы и кэширование контекста.

Источник: MarkTechPost ↗