Инструменты11 июля 2026 г., 21:45 МСК🤖 Auto

AudioGhost AI: Выделение звука текстом на RTX 3060

Open-source проект на базе Meta SAM-Audio позволяет извлекать любые звуковые объекты по текстовому описанию, снижая требования к VRAM до 4 ГБ.

Баннер новости 3392

Технология объектно-ориентированного разделения звука

Разработчики представили AudioGhost AI — инструмент с открытым исходным кодом, использующий модель SAM-Audio от Meta AI Research. В отличие от традиционных сепараторов, которые работают только с фиксированными классами (вокал, барабаны), AudioGhost позволяет использовать текстовые подсказки (natural language) для выделения конкретных звуков: «лай собаки», «шум толпы» или «фоновая музыка».

Система работает через стек Next.js (frontend) и FastAPI + Celery (backend), обрабатывая аудиофайлы (MP3, WAV, FLAC) и видео. Архитектура поддерживает асинхронную обработку задач через Redis, что делает её пригодной для интеграции в более сложные пайплайны.

Оптимизация памяти: от 11 ГБ к 4 ГБ VRAM

Ключевое преимущество проекта — модификация оригинальной модели Meta под названием SAM Audio Lite. Разработчики отключили компоненты, необходимые только для видеоанализа (Vision Encoder, Visual Ranker, Text Ranker, Span Predictor), что позволило сократить потребление видеопамяти примерно на 40%.

Это открывает доступ к мощной модели для пользователей с картами среднего уровня. Ниже приведены сравнительные метрики потребления VRAM и скорости обработки на базе GPU NVIDIA (тестирование на RTX 4090 для эталонной скорости, но оптимизация работает на всех CUDA-совместимых картах):

Модель VRAM (Lite Mode, bfloat16) VRAM (High Quality, float32) Рекомендуемая видеокарта Скорость (субъективные запуски)
Small ~6 GB ~10 GB RTX 3060 6GB / RTX 3070 8GB ~10x realtime
Base ~7 GB ~13 GB RTX 3070/4060 8GB / RTX 4070 12GB ~9x realtime
Large ~10 GB ~20 GB RTX 3080/4070 12GB / RTX 4080 16GB ~6.5x realtime

Технические детали и требования

Для работы требуется Python 3.11+, CUDA 12.6 и Node.js 18+. Проект предлагает два режима установки: автоматический (через install.bat) и ручной. Важно отметить, что для работы с аудио используется FFmpeg (рекомендуется версия 7.x для избежания ошибок DLL) и библиотека TorchCodec.

  • Чанкинг: Длинные аудиофайлы разбиваются на 25-секундные сегменты для предотвращения переполнения памяти.
  • API: Предоставляет REST API (POST /api/separate/) для интеграции с другими сервисами. Поддерживает режимы «extract» (извлечь) и «remove» (удалить).
  • Доступ к модели: Требуется токен доступа HuggingFace для загрузки весов модели facebook/sam-audio-large.

Почему это важно

AudioGhost AI демократизирует доступ к SOTA-моделям сепарации звука. Ранее для работы с SAM-Audio требовались мощные серверные GPU. Благодаря оптимизации Lite-режима, энтузиасты и разработчики могут запускать сложные задачи аудио-анализа на локальных машинах с 6–8 ГБ видеопамяти, не завися от облачных API. Это особенно актуально для задач пост-продакшена, создания контента и исследования аудио-данных.

Источник: Github ↗