Новая модель Yue2 и оптимизация VRAM
В ветке dev проекта audio.cpp появилась нативная поддержка модели генерации песен Yue2 (3B). Это позволяет запускать сложные аудио-модели локально, избегая проблем с зависимостями Python. Ключевое преимущество — интеграция с форматом GGUF: модели загружаются в память эффективнее, а пиковое потребление VRAM снижается до 37% по сравнению с оригинальными реализациями.
Рекордная производительность: 10 часов за 3 минуты
Фреймворк демонстрирует экстремальные показатели скорости на современном железе. На видеокарте NVIDIA RTX 5090 модель Supertonic 3 генерирует около 10 часов аудио всего за 3 минуты. Это обеспечивает ускорение более чем в 200 раз относительно реального времени (real-time) в режиме CUDA и 47 мс TTFT (Time To First Token) в потоковом режиме.
Для сравнения, модель VibeVoice 1.5B (генерация подкастов) работает в 5.15 раз быстрее реального времени, создавая 93.9-минутный подкаст за 18.2 минуты без квантования.
Сравнение производительности и метрики
audio.cpp обеспечивает значительное снижение задержки (на 45-85%) и ускорение по сравнению с Python-референсами. Ниже приведены ключевые метрики производительности для различных задач и моделей:
| Модель / Задача | Железо | Результат | Ускорение (Real-time) |
|---|---|---|---|
| Supertonic 3 (Генерация) | RTX 5090 (CUDA) | 10 часов аудио за 3 мин | > 200x |
| VibeVoice 1.5B (Подкаст) | Не указано | 93.9 мин за 18.2 мин | 5.15x |
| Nemotron 3.5 ASR (Распознавание) | Не указано | WER на уровне референса | В 4 раза быстрее (wall time) |
| VoxCPM2 (Apple Silicon) | Apple Metal | — | 2.56x |
Экосистема и поддержка форматов
Проект охватывает 62 семейства моделей и более 85 вариантов, включая TTS, ASR, клонирование голоса и разделение источников. Поддерживаются форматы GGUF (BF16, Q8, F32) и потоковая передача (Stream). Доступны бэкенды для NVIDIA (CUDA), AMD (HIP/ROCm), Apple (Metal) и CPU. В интерфейсе добавлена вкладка Arena для сравнения моделей side-by-side с общими входными данными.
Почему это важно
audio.cpp решает главную проблему локального AI-аудио — фрагментацию окружений. Предоставляя единый нативный C++ runtime, он позволяет запускать SOTA-модели (как Yue2 или Supertonic 3) на потребительском оборудовании с минимальными требованиями к памяти, что делает профессиональную генерацию аудио доступной вне облачных сервисов.
Источник: Github ↗
