Декомпозиция архитектуры V1.0.0
Проект ComfyUI-Minimax-H3-Promptor от лаборатории 1038lab представляет собой специализированный набор узлов для создания промптов кинематографического качества, оптимизированных под видео-генератор MiniMax H3. Ключевое нововведение версии 1.0.0 — полная декомпозиция пайплайна на два независимых узла, что позволяет избежать дублирования затрат на вызовы LLM-моделей с компьютерным зрением.
- H3_Vision_Analyzer: Выступает в роли виртуального оператора. Анализирует входные медиа (до 4 изображений и батч видеокадров) и выдает структурированный текстовый контекст (
vision_context). - H3_Promptor: Ядро системы. Берет текстовое описание сцены и контекст от анализатора, формируя финальный промпт. Он не обрабатывает изображения напрямую, что значительно ускоряет работу и снижает стоимость API.
Гибкость ввода и автоматическое определение режима
Система использует скрытый маркер [MEDIA_SIGNATURE] для автоматического определения типа генерации на основе подключенных медиа. Пользователю не нужно вручную переключать режимы — узел сам распознает задачу:
| Подключенные медиа | Автоматический режим | Описание |
|---|---|---|
| Нет медиа | T2V | Text-to-Video (генерация из текста) |
| 1 изображение | I2V | Image-to-Video (анимация одного кадра) |
| 2 изображения | FL2VA | First & Last Frame (контроль начала и конца) |
| 3-4 изображения | Ref2VA | Omni Reference (многофреймовая референсная анимация) |
| Видео | V2V | Video-to-Video (трансформация исходного видео) |
Поддержка мульти-LLM и кастомизация
Интеграция реализована через нативные API без оберткок, поддерживая четыре основных провайдера. Это дает пользователям свободу выбора модели в зависимости от доступных ключей и требуемой точности:
| Провайдер | Файл провайдера | Модель по умолчанию | Метод аутентификации |
|---|---|---|---|
| OpenAI | provider_openai.py | gpt-4o | Bearer Token |
| Ollama | provider_ollama.py | llama3.1 | Локально (без ключа) |
| Gemini | provider_gemini.py | gemini-2.5-flash | URL param (?key=) |
| Claude | provider_claude.py | claude-sonnet-4-20250514 | x-api-key Header |
Для тонкой настройки анализа изображений используется файл vision_prompts.json. Пользователь может добавлять собственные стратегии анализа (например, фокус только на освещении или цветовой палитре), которые подтягиваются в выпадающие списки узлов после перезапуска ComfyUI. Также доступна настройка длительности видео (4-15 секунд) с синхронизацией темпа повествования под 24 FPS.
Установка и требования
Репозиторий распространяется под лицензией GPL-3.0. Установка стандартная для ComfyUI: клонирование в папку custom_nodes и установка зависимостей через pip install -r requirements.txt. Настройка API-ключей возможна как через глобальный config.json, так и напрямую в интерфейсе каждого узла, что позволяет гибко управлять доступом к разным моделям в рамках одной сцены.
Источник: Github ↗
