Релиз модели10 августа 2026 г., 13:45 МСК🤖 Auto

Qwen выпустил мультимодальные плагины для AI-агентов

Команда Qwen представила набор нативных мультимодальных плагинов, позволяющих моделям Qwen работать с видео, 3D-моделями и CAD-системами через единый интерфейс.

Баннер новости 5426

Что такое Qwen-MM-Plugins

Лаборатория Qwen (Alibaba Group) открыла доступ к проекту Qwen-MM-Plugins — набору нативных мультимодальных плагинов для AI-агентов. Проект позволяет моделям Qwen не просто «видеть» контент, но и активно взаимодействовать с ним: редактировать видео, управлять 3D-редакторами и анализировать длинные видеоролики. Все плагины распространяются под лицензией Apache-2.0.

Ключевые возможности и компоненты

Архитектура решения разделена на два уровня: skill (навык, который знает модель о существовании инструмента) и MCP server (сам сервер инструментов, запускаемый по требованию). Это обеспечивает гибкость: можно использовать только базовое распознавание или подключать сложные внешние приложения.

Основные доступные модули:

  • core: Базовая мультимодальность. Динамическое чтение изображений, видео, документов и 3D-моделей. Включает OCR, grounding (локализацию объектов), сегментацию, распознавание речи (ASR) и веб-поиск.
  • video-memory: Память для длинных видео. Использует иерархическую графовую память для ответов на вопросы по часовым лекциям или записям.
  • video-edit: Генерация и редактирование видео, изображений и аудио.
  • blender: Управление Blender через Python-клиент (22 инструмента). Модель может создавать модели, настраивать материалы, освещение и рендеринг.
  • freecad: Параметрическое CAD-моделирование (14 инструментов). Поддержка импорта/экспорта STEP/STL и FEM-анализа.
  • edu-agent: Генерация обучающих видео на китайском языке по математическим или научным задачам (только навык, без MCP).

Технические особенности и интеграция

Особенность системы — динамическое разрешение (dynamic-resolution). При анализе изображений или видео каждый кадр автоматически масштабируется под сетку патчей VL-модели. Это позволяет детально считывать мелкий текст на 4K-скриншотах или анализировать мелкие объекты без ручного ресайза.

Установка упрощена через скрипт install.sh, который автоматически настраивает интеграцию с популярными AI-харами:

  • Claude Code
  • Codex
  • Qoder
  • OpenClaw
  • Qwen Code
  • Gemini CLI

Для работы требуются системные инструменты: ffmpeg (для видео/аудио), а также опционально libreoffice, texlive, chromium и установленные blender / freecad. Зависимости Python устанавливаются автоматически через uvx.

Примеры использования

Разработчики предоставляют «cookbooks» с примерами кода. Вот как выглядит взаимодействие:

Задача Пример промпта / команды
Анализ данных @dashboard-4k.png Read every number in this dashboard.
OCR и расчеты @receipt.jpg OCR this and total the line items.
Локализация объектов @street.jpg Draw a box around every car in the scene.
Анализ видео @lecture-2h.mp4 What are the main points, with timestamps?
3D-моделирование Model a low-poly wooden stool, add a warm key light, and render it.
CAD-проектирование Model an M6 hex bolt 30 mm long and export it as STEP.

Проект доступен на GitHub. Для работы с API-инструментами требуется ключ DASHSCOPE_API_KEY, для веб-поиска — SERPER_API_KEY.

Источник: Github ↗