Инструменты13 сентября 2026 г., 19:48 МСК🤖 Auto

audio.cpp: Yue2, Supertonic 3 и 200x скорость генерации аудио

Фреймворк audio.cpp добавил поддержку модели Yue2 (3B) и показал рекордную скорость генерации 10 часов аудио за 3 минуты на RTX 5090.

Баннер новости 7405

Новая модель Yue2 и оптимизация VRAM

В ветке dev проекта audio.cpp появилась нативная поддержка модели генерации песен Yue2 (3B). Это позволяет запускать сложные аудио-модели локально, избегая проблем с зависимостями Python. Ключевое преимущество — интеграция с форматом GGUF: модели загружаются в память эффективнее, а пиковое потребление VRAM снижается до 37% по сравнению с оригинальными реализациями.

Рекордная производительность: 10 часов за 3 минуты

Фреймворк демонстрирует экстремальные показатели скорости на современном железе. На видеокарте NVIDIA RTX 5090 модель Supertonic 3 генерирует около 10 часов аудио всего за 3 минуты. Это обеспечивает ускорение более чем в 200 раз относительно реального времени (real-time) в режиме CUDA и 47 мс TTFT (Time To First Token) в потоковом режиме.

Для сравнения, модель VibeVoice 1.5B (генерация подкастов) работает в 5.15 раз быстрее реального времени, создавая 93.9-минутный подкаст за 18.2 минуты без квантования.

Сравнение производительности и метрики

audio.cpp обеспечивает значительное снижение задержки (на 45-85%) и ускорение по сравнению с Python-референсами. Ниже приведены ключевые метрики производительности для различных задач и моделей:

Модель / Задача Железо Результат Ускорение (Real-time)
Supertonic 3 (Генерация) RTX 5090 (CUDA) 10 часов аудио за 3 мин > 200x
VibeVoice 1.5B (Подкаст) Не указано 93.9 мин за 18.2 мин 5.15x
Nemotron 3.5 ASR (Распознавание) Не указано WER на уровне референса В 4 раза быстрее (wall time)
VoxCPM2 (Apple Silicon) Apple Metal 2.56x

Экосистема и поддержка форматов

Проект охватывает 62 семейства моделей и более 85 вариантов, включая TTS, ASR, клонирование голоса и разделение источников. Поддерживаются форматы GGUF (BF16, Q8, F32) и потоковая передача (Stream). Доступны бэкенды для NVIDIA (CUDA), AMD (HIP/ROCm), Apple (Metal) и CPU. В интерфейсе добавлена вкладка Arena для сравнения моделей side-by-side с общими входными данными.

Почему это важно

audio.cpp решает главную проблему локального AI-аудио — фрагментацию окружений. Предоставляя единый нативный C++ runtime, он позволяет запускать SOTA-модели (как Yue2 или Supertonic 3) на потребительском оборудовании с минимальными требованиями к памяти, что делает профессиональную генерацию аудио доступной вне облачных сервисов.

Источник: Github ↗