Релиз модели23 июля 2026 г., 14:17 МСК🤖 Auto

ASR в 2026: WER < 6%, но лицензия важнее точности

Рынок открытых моделей распознавания речи (ASR) перестал быть монокультурой Whisper. В 2026 году разница в точности между лидерами составляет менее 1% WER, поэтому выбор теперь зависит от лицензии, поддержки потоковой передачи и стоимости.

Баннер новости 4204

Точность vs. Реальность: почему WER вводит в заблуждение

В марте 2026 года Cohere выпустила модель Transcribe 2B (Apache 2.0), занявшую первое место в Hugging Face Open ASR Leaderboard со средним WER 5.42%. Пятью неделями позже IBM представила Granite Speech 4.1 2B с WER 5.33%. Однако сравнение этих цифр напрямую некорректно: модели оценивались на разных наборах данных. Например, ARK-ASR-3B (WER 5.04%) исключила набор TED-LIUM, который считается «легким», что искусственно завышает средний балл. При пересчете на одинаковые наборы данных разрыв между лидерами остается менее 1 пункта WER, что делает точность вторичным фактором выбора.

Лидеры по точности и функционалу

Несмотря на схожие цифры WER, модели сильно различаются по возможностям. Cohere Transcribe, скачанная более 620 000 раз, поддерживает 14 языков, но не имеет автоматического определения языка, таймкодов и диаризации. IBM Granite Speech 4.1 2B предлагает 6 языков, двунаправленный перевод речи и biasing ключевых слов. Ниже приведено сравнение ключевых характеристик топовых моделей.

Модель Размер Лицензия Языки WER (среднее) Ключевая особенность
Cohere Transcribe 2B 2B Apache 2.0 14 5.42% Промышленная готовность, 620k+ скачиваний
IBM Granite Speech 4.1 2B 2B Apache 2.0 6 5.33% Перевод речи, biasing, пунктуация
ARK-ASR-3B 3B Инфо отсутствует Инфо отсутствует 5.04% Высокая точность на специфичных датасетах
Canary-Qwen-2.5B 2.5B CC-BY-4.0 1 (EN) 5.63% LLM-режим: суммаризация и ответы на вопросы
Qwen3-ASR-1.7B 1.7B Apache 2.0 52 5.76% Лучший выбор для китайских диалектов

Пропускная способность: где экономится бюджет

Разница в пропускной способности (RTFx) между моделями превышает порядок величины, что напрямую влияет на стоимость инфраструктуры. Parakeet TDT 0.6B v3 (CC-BY-4.0) является лидером среди многоязычных моделей с RTFx 3332.74, обрабатывая до 24 минут аудио за один проход на A100 80GB, но имеет WER 6.32%. Для сценариев, требующих высокой скорости, IBM выпустила версию Granite Speech 4.1 2B-NAR (неавторегрессионная), достигающую RTFx ~1820 на H100, жертвуя поддержкой японского языка и перевода. Qwen3-ASR-0.6B также обеспечивает пропускную способность 2000x при работе с 52 языками.

Потоковое распознавание (Streaming) и покрытие

Для голосовых агентов критична задержка. Voxtral Mini 4B Realtime (Apache 2.0) позволяет настраивать задержку от 80 до 1200 мс, с рекомендуемым «сладким пятном» в 480 мс, и работает на одной GPU с 16 ГБ памяти. Kyutai STT 2.6B (CC-BY-4.0) предлагает встроенный семантический детектор активности голоса (VAD), что важнее для естественного диалога, чем просто задержка транскрипции. В категории покрытия Meta Omnilingual ASR (Apache 2.0) поддерживает 1600+ языков нативно и до 5400+ через zero-shot, обучаясь на 4.3 млн часов аудио, хотя ее WER не является приоритетом.

Важные нюансы лицензирования и данных

Не все модели с открытым кодом полностью свободны. Cohere Transcribe, несмотря на лицензию Apache 2.0, требует заполнения формы с контактной информацией для доступа к репозиторию. Кроме того, некоторые модели, такие как MOSS-Transcribe-preview-2B, были дообучены с использованием подкрепления (RL) на обучающих сплитах самого лидерборда, что может завышать их реальные способности на новых данных. Также стоит учитывать, что модели, оптимизированные под чистую речь, могут показывать худшие результаты на спонтанных разговорных аудио, где доминируют частные наборы данных от Appen.

Бенчмарки

БенчмаркCohere TranscribeARK-ASR-3BCanary-Qwen-2.5BIBM Granite 4.0 1B SpeechIBM Granite Speech 4.1 2BKyutai STT 2.6BParakeet TDT 0.6B v3Qwen3-ASR-1.7BVoxtral RealtimeWhisper large-v3
Open ASR Leaderboard5.42%5.04%5.33%
Human Preference Evaluation61%78%64%
Open ASR Leaderboard5.63%6.32%5.76%
Open ASR Leaderboard6.4%7.68%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗