Агентный подход к мультимодальности
Команда Qwen из Alibaba выпустила Qwen3.8-Omni-Flash, позиционируя её как первую омни-модель, построенную вокруг агентных возможностей. В отличие от традиционных моделей, которые просто анализируют контент, эта архитектура реализует цикл: понимание контента → планирование задачи → выполнение с помощью инструментов → выдача результата.
Модель принимает на вход текст, изображения, аудио и видео, но возвращает только текст. Базовая архитектура основана на Qwen3.8-Flash-Next (открытые веса которой появились в августе 2026 года). Ключевая особенность — агентное восприятие для длинных видео: модель не просматривает файл от начала до конца, а ищет доказательства, необходимые для ответа, что снижает расход токенов.
Технические характеристики и бенчмарки
Модель поддерживает контекстное окно в 1 миллион токенов (до 991K на вход, 131K на выход). По умолчанию включен режим рассуждений (reasoning) с уровнем усилия xhigh. Ниже приведены сравнительные результаты с предыдущей версией Qwen3.5-Omni-Plus:
| Метрика / Бенчмарк | Результат Qwen3.8-Omni-Flash | Прирост / Эффект |
|---|---|---|
| Средний балл (29 тестов) | — | Улучшение более чем на 25% |
| WildClawBench-MM | — | +36.5 баллов |
| UniClawBench | 69.6 | — |
| OmniVideoBench (точность) | 67.8 | +4.4 (рост с 63.4) |
| Расход токенов (OmniVideoBench) | 79,117 | Снижение на 45.7% (было 145,736) |
| LongAudioSpan | — | +8.3 балла |
Alibaba заявляет, что аудио-визуальные показатели сопоставимы с Gemini 3.8 Flash, а общее аудио-производство превосходит его. Агентные способности (WildClawBench-MM и UniClawBench) в среднем выросли на 19.5 балла.
Стоимость и ограничения
Модель доступна только через API на платформах QwenCloud, Alibaba Cloud Model Studio и Qwen Studio. Открытые веса для самостоятельного хостинга не предоставлены. Тарификация в QwenCloud:
- Входные токены: $0.15 за 1M токенов.
- Выходные токены: $0.47 за 1M токенов.
- Кэш (implicit cache hits): $0.016 за 1M токенов.
Alibaba утверждает, что затраты на ввод аудио снизились более чем на 98%, а аудио-визуального ввода — более чем на 93% по сравнению с предшественником. Поддерживаются видео до 2 часов (2 ГБ) и аудио до 3 часов. Доступно в 6 регионах: Пекин, Сингапур, Гонконг, Токио, Франкфурт и Вирджиния.
Инструментарий для разработчиков
Поскольку модель выдает только текст, для работы с медиа используются открытые плагины Qwen-MM-Plugins (лицензия Apache-2.0). Они позволяют интегрировать мультимодальные навыки в различные агентные фреймворки (Claude Code, Codex, Qoder и др.). Основные демо-функции плагинов:
- omni-memory: создание аудио-визуальной памяти длинных видео.
- omni-video2note: конвертация обучающих видео в PDF с иллюстрациями.
- omni-chatcut: генерация музыкальных клипов, комментариев к фильмам и перевод видео с сохранением голоса.
API поддерживает протоколы DashScope и OpenAI, включая Function Calling, веб-поиск, структурированные выводы и кэширование контекста.
Источник: MarkTechPost ↗
