QwenAudio/SenseVoice

Открытый исходный код модели SenseVoiceSmall для распознавания речи (ASR), определения языка, эмоций и аудио-событий на китайском, кантонском, английском, японском и корейском языках.

Аудио⭐ 9 337Cпоследний релиз: runtime-llamacpp-v0.2.1
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

SenseVoiceSmall — это открытая модель распознавания речи, поддерживающая китайский, кантонский, английский, японский и корейский языки, а также определяющая эмоции и звуковые события.

Зачем нужен

Инструмент решает задачу комплексного анализа аудио: транскрибации, идентификации языка, распознавания эмоций и детекции звуков (смех, плач, фоновая музыка). Он полезен благодаря высокой точности, низкой задержке вывода и возможности работы на ресурсоемких устройствах через GGUF-формат.

Что можно реализовать

  • Анализ тональности пользовательских обращений в колл-центрах
  • Модерация контента через детекцию нежелательных звуковых событий
  • Субтитрирование видео с учетом эмоциональной окраски речи
  • Обработка голосовых команд в мультиязычных интерфейсах
  • Локализация и анализ аудио на азиатских языках

Ключевые возможности

  • Мультиязычность: поддержка Mandarin, Cantonese, English, Japanese, Korean
  • Многозадачность: ASR, LID, SER и Audio Event Detection в одной модели
  • Высокая скорость: неавтоореgressive end-to-end framework для низкой задержки
  • Edge-деплой: запуск на CPU через llama.cpp / GGUF (~254 MB)
  • Гибкая дообучка: скрипты для адаптации под long-tail сценарии

👤 Кому подойдёт: разработчики, исследователи, бизнес (для интеграции в голосовые интерфейсы и аналитику)

Релизы

runtime-llamacpp-v0.2.1minor
🕐 25 дн назад · релиз на GitHub ↗

Выпуск runtime-бинарников FunASR с SenseVoice: исправлена логика выбора GPU (IGPU/Discrete) и добавлены сборки для Linux, macOS и Windows.

  • Fixed: Исправлен выбор Vulkan-устройства при ошибочном определении видеокарты как интегрированной (IGPU).
  • Added: Добавлена логика приоритетного использования дискретной видеокарты с фоллбэком на интегрированную при отсутствии совпадений.
  • Added: Предоставлены девять готовых сборок для Linux, macOS и Windows, включая варианты с поддержкой Vulkan и CUDA.
  • Windows-сборка с Vulkan готова к повторному тестированию на Radeon 780M, но не исправляет краш инициализации RX 9070 XT.
  • Android/Mali не входит в число официальных предсобранных или проверенных целей в данном релизе.
runtime-llamacpp-v0.1.9minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз runtime-llamacpp-v0.1.9: исправление уязвимости YAML, поддержка SenseVoice/Paraformer/Fun-ASR-Nano и FSMN-VAD, бинарники для CPU/GPU/ARM.

  • Fixed: Исправлена уязвимость YAML SafeLoader (PR #312), устраняющая риски в старых архивах исходного кода.
  • Added: Добавлена поддержка моделей SenseVoice, Paraformer, Fun-ASR-Nano и встроенного FSMN-VAD.
  • Added: Выпущены предсобранные бинарники для Linux/Windows (x64, AVX2, Vulkan, CUDA) и нативные сборки для Linux/macOS ARM64.
  • Added: Упрощён запуск: доступна команда llama-funasr-sensevoice без необходимости установки Python-ASR или локальной компиляции.