FunAudioLLM/SenseVoice

Мультязычное распознавание речи: ASR + распознавание эмоций + обнаружение аудио событий. Более 50 языков, в 15 раз быстрее Whisper, неавторегрессионная модель.

Аудио⭐ 9 348Cпоследний релиз: runtime-llamacpp-v0.2.1
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

SenseVoice — это мультимодальная модель распознавания речи, которая одновременно выполняет ASR, распознавание эмоций и детекцию аудио-событий.

Зачем нужен

Инструмент решает задачу комплексного анализа аудиопотока: он не только транскрибирует речь на 50+ языках, но и определяет эмоциональную окраску и фоновые звуки (смех, аплодисменты и др.). Благодаря неавтоорегрессивной архитектуре модель работает в 15 раз быстрее Whisper, что делает её пригодной для задач с жесткими требованиями к задержкам.

Что можно реализовать

  • Анализ тональности клиентских обращений в реальном времени с учетом эмоций говорящего
  • Мониторинг видеоконтента на наличие специфических звуковых событий (смех, плач, фоновая музыка)
  • Быстрая транскрипция и семантический анализ длинных аудиозаписей с низкой задержкой
  • Обработка мультимедийных данных на edge-устройствах с использованием GGUF-версии модели

Ключевые возможности

  • Поддержка более 50 языков и распознавание эмоций без дополнительной дообучения
  • Высокая скорость инференса: обработка 10 секунд аудио занимает всего 70 мс
  • Детекция аудио-событий (BGM, аплодисменты, кашель, чихание и др.)
  • Наличие оптимизированных рантаймов для CPU/Edge (llama.cpp/GGUF) и стандартных фреймворков (ONNX, libtorch)
  • Возможность легкой дообучения (finetuning) под специфические бизнес-сценарии

👤 Кому подойдёт: разработчики, исследователи в области NLP/Audio, инженеры по машинному обучению, бизнесы, нуждающиеся в автоматизации анализа аудио-контента

Релизы

runtime-llamacpp-v0.2.1minor
🕐 26 дн назад · релиз на GitHub ↗

Выпущены самодостаточные бинарники FunASR с SenseVoice, Fun-ASR-Nano и Paraformer для Linux, macOS и Windows с поддержкой Vulkan и CUDA.

  • Added: Добавлены девять архивов для Linux, macOS и Windows, включая варианты с Vulkan и CUDA.
  • Fixed: Исправлен выбор Vulkan-устройства, если оно определяется как интегрированная графика (IGPU).
  • Fixed: Приоритет теперь отдается дискретной видеокарте, с переходом на интегрированную при отсутствии совместимой дискретной.
  • Windows-пакет с Vulkan готов к повторному тестированию на Radeon 780M.
  • Android/Mali не является официально поддерживаемой платформой в этом релизе.
runtime-llamacpp-v0.1.9patch
🕐 2 мес назад · релиз на GitHub ↗

Релиз runtime-llamacpp-v0.1.9: исправлена уязвимость YAML, добавлена поддержка SenseVoice, Paraformer и Fun-ASR-Nano, обновлены бинарники.

  • Fixed: Исправлена уязвимость в загрузчике YAML (security fix #312), теперь используется безопасный yaml.SafeLoader.
  • Added: Добавлена поддержка моделей SenseVoice, Paraformer и Fun-ASR-Nano, а также встроенный FSMN-VAD.
  • Added: Предоставлены новые бинарные сборки для Linux, Windows, macOS и ARM64 с поддержкой CPU, Vulkan и CUDA (arch 86).
  • Упрощён запуск через скрипт download-funasr-model.sh: больше не требуется Python-среда или локальная компиляция.
runtime-llamacpp-v0.1.4minor
🕐 2 мес назад · релиз на GitHub ↗

Релиз runtime-обёртки FunASR llama.cpp: добавлены сборки x64-avx2 для ускорения на современных CPU.

  • Added: Добавлены явные сборки x64-avx2 для процессоров с поддержкой AVX2, FMA, F16C и BMI2.
  • Added: Пакет funasr-llamacpp-windows-x64-avx2.zip оптимизирован для повышения скорости работы.
  • Fixed: Предупреждение: если предыдущая версия v0.1.3 работала медленно, рекомендуется обновиться.
  • При ошибках Illegal instruction или SIGILL следует использовать стандартный пакет x64.