Локальная рабочая станция для музыкантов и продюсеров
Платформа ComfyMax MusicLab представляет собой локальное рабочее пространство для анализа музыки и подготовки сцен, построенное вокруг редактора волновых форм. Ключевое отличие проекта — полная автономность: обработка данных происходит на стороне пользователя, что исключает необходимость использования облачных кредитов или отправки аудио в сторонние сервисы. Инструмент интегрирует ручное маркирование, визуализацию аккордов и ритма, а также редактируемые тексты песен.
Технический стек и архитектура
Программа работает в изолированной среде Python 3.11, не пересекаясь с основной средой ComfyUI. Архитектура обработки данных строго линейна: загрузка трека → локальное разделение через Demucs → редактирование маркеров → создание сцен → экспорт. Для транскрипции используется модель faster-whisper (по умолчанию small, int8), а для выделения вокала — Demucs htdmucs. Также поддерживается опциональная символьная транскрипция через SheetSage2, которая устанавливается отдельно из-за большого размера модели.
Метрики и особенности анализа
Система не полагается на «черный ящик»: она предоставляет детализированные данные о каждом этапе. Анализ включает выделение вокальных и инструментальных регионов, фраз и слов с таймкодами. Важно отметить, что система не удаляет тишину и не обрезает интро/аутро на этапе декодирования, сохраняя целостность исходного файла (проверка SHA-256). Алгоритм использует энергию вокального стема в 50-мс фреймах для определения границ, что позволяет улавливать даже безсловесное пение.
| Компонент | Роль в системе | Технические детали |
|---|---|---|
| Demucs (htdmucs) | Разделение дорожек | Выделение вокала; поддержка CUDA 12.8 (RTX 5060 Ti+); fallback на CPU при нехватке VRAM (<4 ГБ) |
| faster-whisper | Транскрипция | Модели: small (default), medium, large-v3; режим int8 для экономии ресурсов; отключен Speech VAD для пения |
| SheetSage2 | Символьная нотация | ABC/event transcription; устанавливается отдельно через Install_SheetSage.bat |
| Output Files | Результаты | analysis.txt/json, vocals.wav (44.1kHz), analysis_mix.wav, analysis.log, failure.json |
Установка и требования
Инструмент поддерживает Windows 10/11 (64-bit). Требуется наличие FFmpeg в PATH и Python 3.11 (или утилиты uv). Установка осуществляется через PowerShell-скрипт setup.ps1, который создает виртуальное окружение (.venv) и устанавливает зависимости. Поддерживается как GPU-режим (CUDA 12.8), так и CPU-only установка. Пользователи могут явно указывать устройства через флаги -Device cuda или -Device cpu при запуске анализа.
Почему это важно
ComfyMax MusicLab закрывает критическую нишу для создателей контента, которым нужна точная, редактируемая разметка аудио без ограничений по длине или конфиденциальности облачных API. Гибкая настройка порогов чувствительности (через флаги --floor, --relative) и возможность ручного исправления «подозрительных» слов (suspect flags) делают инструмент мощным помощником для саунд-дизайнеров и музыкантов, работающих с локальными AI-моделями.
Источник: Github ↗
