Инструменты7 августа 2026 г., 11:46 МСК🤖 Auto

ComfyUI MiniMax H3-Promptor: Архитектура V1.0 для кинематографичных видео

Новый узел ComfyUI разделяет анализ изображений и генерацию промптов для MiniMax H3, снижая затраты API и позволяя точно контролировать структуру сцен через 4 слота изображений и видео.

Баннер новости 5290

Декомпозиция архитектуры V1.0.0

Проект ComfyUI-Minimax-H3-Promptor от лаборатории 1038lab представляет собой специализированный набор узлов для создания промптов кинематографического качества, оптимизированных под видео-генератор MiniMax H3. Ключевое нововведение версии 1.0.0 — полная декомпозиция пайплайна на два независимых узла, что позволяет избежать дублирования затрат на вызовы LLM-моделей с компьютерным зрением.

  • H3_Vision_Analyzer: Выступает в роли виртуального оператора. Анализирует входные медиа (до 4 изображений и батч видеокадров) и выдает структурированный текстовый контекст (vision_context).
  • H3_Promptor: Ядро системы. Берет текстовое описание сцены и контекст от анализатора, формируя финальный промпт. Он не обрабатывает изображения напрямую, что значительно ускоряет работу и снижает стоимость API.

Гибкость ввода и автоматическое определение режима

Система использует скрытый маркер [MEDIA_SIGNATURE] для автоматического определения типа генерации на основе подключенных медиа. Пользователю не нужно вручную переключать режимы — узел сам распознает задачу:

Подключенные медиа Автоматический режим Описание
Нет медиа T2V Text-to-Video (генерация из текста)
1 изображение I2V Image-to-Video (анимация одного кадра)
2 изображения FL2VA First & Last Frame (контроль начала и конца)
3-4 изображения Ref2VA Omni Reference (многофреймовая референсная анимация)
Видео V2V Video-to-Video (трансформация исходного видео)

Поддержка мульти-LLM и кастомизация

Интеграция реализована через нативные API без оберткок, поддерживая четыре основных провайдера. Это дает пользователям свободу выбора модели в зависимости от доступных ключей и требуемой точности:

Провайдер Файл провайдера Модель по умолчанию Метод аутентификации
OpenAI provider_openai.py gpt-4o Bearer Token
Ollama provider_ollama.py llama3.1 Локально (без ключа)
Gemini provider_gemini.py gemini-2.5-flash URL param (?key=)
Claude provider_claude.py claude-sonnet-4-20250514 x-api-key Header

Для тонкой настройки анализа изображений используется файл vision_prompts.json. Пользователь может добавлять собственные стратегии анализа (например, фокус только на освещении или цветовой палитре), которые подтягиваются в выпадающие списки узлов после перезапуска ComfyUI. Также доступна настройка длительности видео (4-15 секунд) с синхронизацией темпа повествования под 24 FPS.

Установка и требования

Репозиторий распространяется под лицензией GPL-3.0. Установка стандартная для ComfyUI: клонирование в папку custom_nodes и установка зависимостей через pip install -r requirements.txt. Настройка API-ключей возможна как через глобальный config.json, так и напрямую в интерфейсе каждого узла, что позволяет гибко управлять доступом к разным моделям в рамках одной сцены.

Источник: Github ↗