Что такое Qwen-MM-Plugins
Лаборатория Qwen (Alibaba Group) открыла доступ к проекту Qwen-MM-Plugins — набору нативных мультимодальных плагинов для AI-агентов. Проект позволяет моделям Qwen не просто «видеть» контент, но и активно взаимодействовать с ним: редактировать видео, управлять 3D-редакторами и анализировать длинные видеоролики. Все плагины распространяются под лицензией Apache-2.0.
Ключевые возможности и компоненты
Архитектура решения разделена на два уровня: skill (навык, который знает модель о существовании инструмента) и MCP server (сам сервер инструментов, запускаемый по требованию). Это обеспечивает гибкость: можно использовать только базовое распознавание или подключать сложные внешние приложения.
Основные доступные модули:
- core: Базовая мультимодальность. Динамическое чтение изображений, видео, документов и 3D-моделей. Включает OCR, grounding (локализацию объектов), сегментацию, распознавание речи (ASR) и веб-поиск.
- video-memory: Память для длинных видео. Использует иерархическую графовую память для ответов на вопросы по часовым лекциям или записям.
- video-edit: Генерация и редактирование видео, изображений и аудио.
- blender: Управление Blender через Python-клиент (22 инструмента). Модель может создавать модели, настраивать материалы, освещение и рендеринг.
- freecad: Параметрическое CAD-моделирование (14 инструментов). Поддержка импорта/экспорта STEP/STL и FEM-анализа.
- edu-agent: Генерация обучающих видео на китайском языке по математическим или научным задачам (только навык, без MCP).
Технические особенности и интеграция
Особенность системы — динамическое разрешение (dynamic-resolution). При анализе изображений или видео каждый кадр автоматически масштабируется под сетку патчей VL-модели. Это позволяет детально считывать мелкий текст на 4K-скриншотах или анализировать мелкие объекты без ручного ресайза.
Установка упрощена через скрипт install.sh, который автоматически настраивает интеграцию с популярными AI-харами:
- Claude Code
- Codex
- Qoder
- OpenClaw
- Qwen Code
- Gemini CLI
Для работы требуются системные инструменты: ffmpeg (для видео/аудио), а также опционально libreoffice, texlive, chromium и установленные blender / freecad. Зависимости Python устанавливаются автоматически через uvx.
Примеры использования
Разработчики предоставляют «cookbooks» с примерами кода. Вот как выглядит взаимодействие:
| Задача | Пример промпта / команды |
|---|---|
| Анализ данных | @dashboard-4k.png Read every number in this dashboard. |
| OCR и расчеты | @receipt.jpg OCR this and total the line items. |
| Локализация объектов | @street.jpg Draw a box around every car in the scene. |
| Анализ видео | @lecture-2h.mp4 What are the main points, with timestamps? |
| 3D-моделирование | Model a low-poly wooden stool, add a warm key light, and render it. |
| CAD-проектирование | Model an M6 hex bolt 30 mm long and export it as STEP. |
Проект доступен на GitHub. Для работы с API-инструментами требуется ключ DASHSCOPE_API_KEY, для веб-поиска — SERPER_API_KEY.
Источник: Github ↗
