Еще совсем недавно рынок открытого распознавания речи (Automatic Speech Recognition, ASR) казался монокультурой, где доминировала одна модель — Whisper. Однако последние двенадцать месяцев кардинально изменили ландшафт. В марте 2026 года компания Cohere выпустила модель Transcribe объемом 2 миллиарда параметров с лицензией Apache 2.0, которая мгновенно заняла верхнюю строчку в рейтинге Hugging Face Open ASR Leaderboard, показав среднюю ошибку слов (WER) на уровне 5,42%. Пятью неделями позже IBM представила Granite Speech 4.1 2B с еще более низким показателем WER в 5,33%. С тех пор на сцену вышли ARK-ASR-3B и MOSS-Transcribe-preview-2B, зафиксировав еще более низкие ошибки.
Разрыв между лидерами этого рейтинга теперь составляет менее одного пункта WER. Это имеет конкретное и важное следствие для любого разработчика или компании, выбирающей модель: ранг больше не является решающим фактором. На первый план вышли лицензионные условия, покрытие языков, поддержка потоковой передачи (streaming) и стоимость обработки одного часа аудио. В этой статье мы подробно разберем текущее состояние рынка, развенчаем мифы о лидербордах и поможем вам сделать осознанный выбор.
01Проблема с цифрами лидерборда: почему нельзя просто вычитать цифры
Первое, что нужно понять, прежде чем сравнивать модели, — это то, что средний показатель Open ASR Leaderboard не является единой фиксированной величиной. Модели, которые сейчас перечислены рядом, не всегда оценивались одинаковым образом. Это критически важно для корректного сравнения.
Например, показатель Cohere в 5,42% — это среднее значение по восьми наборам тестовых данных на английском языке, включая TED-LIUM. Если мы проверим расчет: AMI (8,13), Earnings-22 (10,86), GigaSpeech (9,34), LibriSpeech clean (1,25), LibriSpeech other (2,37), SPGISpeech (3,08), TED-LIUM (2,49), VoxPopuli (5,87) — в сумме это дает ровно 5,42%. Все сходится.
Однако у ARK-ASR-3B показатель 5,04% рассчитан по семи наборам данных. Набор TED-LIUM в нем отсутствует. Карточка модели MOSS-Transcribe-preview-2B прямо указывает на это: TED-LIUM в настоящее время не является частью запуска лидерборда и поэтому исключен. TED-LIUM — это один из более простых наборов данных вsuite, поэтому его исключение искусственно завышает средний балл. Если пересчитать опубликованные результаты Cohere по тем же семи наборам, которые использует ARK, показатель Cohere составит 5,84%, а не 5,42%. То же самое касается Granite Speech 4.1 2B: его показатель меняется с 5,33% до 5,65%. На равных условиях преимущество ARK выглядит больше, чем говорят заголовочные цифры, но главный вывод прост: вы не можете просто вычесть одну опубликованную фигуру из другой, чтобы получить осмысленный ответ.
02Уровень точности: кто и для чего
Давайте рассмотрим ключевые модели, которые сейчас определяют рынок, с точки зрения их точности и практического применения.
Cohere Transcribe (2B, Apache 2.0, 14 языков)
Это модель, которая реально вышла в продакшн. За последний месяц ее скачали более 620 000 раз. Она имеет поддержку времени выполнения (runtime) в библиотеках transformers, vLLM, mlx-audio для Apple Silicon, а также портирована на Rust и WebGPU. Это конформерный энкодер с легковесным декодером на базе трансформера, обученный с нуля. Cohere также провела оценку человеческих предпочтений, где обученные аннотаторы оценивали транскрипты на сохранение смысла, галлюцинации и именованные сущности: средняя доля побед составила 61%, 78% против IBM Granite 4.0 1B Speech и 64% против Whisper large-v3.

Однако раздел ограничений в карточке модели необычно честен, и его следует прочитать перед принятием решения. В модели нет автоматического определения языка, нет временных меток и нет диаризации (разделения говорящих). Модель склонна транскрибировать тишину, поэтому Cohere рекомендует предварительно использовать VAD (Voice Activity Detection) или шумовой затвор. Репозиторий также закрыт соглашением об предоставлении контактной информации, несмотря на лицензию Apache 2.0.
Granite Speech 4.1 2B (2B, Apache 2.0)
Это лучший выбор, если вам нужна функциональность, а не просто низкая цифра WER. Модель поддерживает шесть языков для ASR, а также двунаправленный перевод речи, смещение ключевых слов для имен и жаргона, пунктуацию и истинное регистронезависимое написание, включая заглавные буквы немецких существительных. Обучена на 174 000 часов аудио. Показатель RTFx составляет 231,29. IBM также выпускает два родственных варианта: -plus добавляет ASR с атрибуцией говорящего и пословные временные метки, а -nar (неавторегрессионный) обсуждается ниже.
Canary-Qwen-2.5B (2.5B, CC-BY-4.0, английский)
Эта модель сочетает энкодер FastConformer с декодером Qwen3-1.7B и работает в двух режимах: чистая транскрипция или режим LLM, где декодер суммирует текст и отвечает на вопросы по нему. WER составляет 5,63% при RTFx 418. Обратите внимание, что набор AMI был переобучен до примерно 15% тренировочных данных, что смещает вывод в сторону дословных транскриптов с сохранением дисфлюэнции (заиканий, пауз). Это особенность для юридической работы и неудобство для заметок по встречам.
Qwen3-ASR-1.7B (Apache 2.0)
Покрывает 52 языка и диалекта — 30 языков плюс 22 китайских диалекта — с WER 5,76%. Поставляется с полным набором инструментов для вывода и отдельной моделью принудительного выравнивания для временных меток на 11 языках. Для любых задач, связанных с мандаринским или региональным китайским языком, это очевидная отправная точка.
03Уровень пропускной способности (Throughput)
Точность в верхней части поля теперь варьируется примерно на один пункт WER. Пропускная способность варьируется более чем на порядок величины, что означает, что именно пропускная способность обычно определяет счет за инфраструктуру.
Parakeet TDT 0.6B v3 (0.6B, CC-BY-4.0) является лидером пропускной способности среди многоязычных открытых моделей с RTFx 3332,74 по 25 европейским языкам с автоматическим определением языка, обрабатывая до 24 минут за один проход на GPU A100 80GB. Его WER составляет 6,32% — примерно на один пункт больше, чем у Granite 4.1 2B, но при этом примерно в четырнадцать раз больше аудио на секунду GPU.

Granite Speech 4.1 2B-NAR — это более интересный инженерный результат. Он неавторегрессионный: он редактирует гипотезу CTC за один прямой проход, используя двунаправленную LLM, достигая RTFx ~1820 на одном H100 при размере батча 128. В обмен на это он отказывается от поддержки японского языка, перевода речи и смещения ключевых слов.
Qwen3-ASR-0.6B сохраняет все 52 языка и достигает пропускной способности 2000x при конкурентности 128.
04Потоковая передача (Streaming)
WER в пакетном режиме кажется неправильным тестом для потоковой модели, но лидерборд все равно оценивает их так. Voxtral Realtime находится на уровне 7,68%, а Kyutai STT 2.6B — на уровне 6,40% — оба ниже, чем у Whisper, и ни одна из этих цифр не говорит вам ничего полезного об их intended use (предназначении).
Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 языков) — это языковая модель на 3,4 млрд параметров вместе с причинным аудиоэнкодером на 970 млн параметров, обученным с нуля, со скользящим окном внимания в обеих частях для практически неограниченной потоковой передачи. Задержка транскрипции настраивается шагами по 80 мс от 80 мс до 1200 мс, плюс отдельный вариант 2400 мс; Mistral рекомендует 480 мс как оптимальное значение и сообщает, что при этой настройке она соответствует ведущим офлайн-моделям с открытым исходным кодом. Она работает на одном GPU с 16 ГБ памяти и имела поддержку API vLLM Realtime с первого дня.
Kyutai STT (CC-BY-4.0) представлен в двух вариантах: модель на ~1 млрд параметров для английского/французского языков с задержкой 0,5 с и встроенным семантическим детектором активности голоса (VAD), и модель на 2,6 млрд параметров только для английского с задержкой 2,5 с. Для голосовых агентов семантический VAD важнее, чем задержка транскрипции — он предсказывает, когда говорящий действительно закончил, что и определяет воспринимаемую задержку смены реплик. H100 обслуживает 400 одновременных потоков в реальном времени.
05Покрытие языков
Meta Omnilingual ASR (Apache 2.0, корпус CC-BY) не конкурирует на WER, и не следует оценивать его как таковое. Он нативно покрывает более 1600 языков и расширяется до более чем 5400 через обучение с нулевым примером (zero-shot in-context learning), построен на энкодере wav2vec 2.0, масштабированном до 7 млрд параметров, и предварительно обученном на примерно 4,3 миллиона часов. Вариант LLM-ASR на 7 млрд параметров достигает ошибки символов (CER) ниже 10% на 78% поддерживаемых языков, включая более 500 языков, которые ранее не обслуживались никакой системой ASR. Размеры энкодеров варьируются от 300 млн до 7 млрд. Meta также выпустила корпус Omnilingual ASR, охватывающий более 350 недопредставленных языков.

Whisper large-v3 (1.55B, MIT, 99 языков) был обойден по точности примерно десятью открытыми моделями, и он остается правильным выбором по умолчанию для большого класса проектов. MIT — самая свободная лицензия в поле. Экосистема времени выполнения — whisper.cpp, faster-whisper, WhisperX — не имеет аналогов среди новых выпусков. Если ваше требование — «какой-то язык, какое-то оборудование, без юриста по лицензиям», это все еще ответ.
06Исследовательский край: диффузия и диаризация
diffusion-gemma-asr-small от стартапа YC Interfaze — самый архитектурно креативный релиз года. Он производит транскрипты путем параллельного диффузионного шумоподавления по холсту из 256 токенов за 8–16 шагов, поэтому стоимость декодирования не растет с длиной транскрипта. Было обучено только ~42 млн параметров — 0,16% весов — поверх замороженной DiffusionGemma на 26 млрд параметров и замороженного энкодера whisper-small. Он достигает WER 6,6% на LibriSpeech test-clean примерно при 11–17x скорости реального времени. Он также достигает 15,7% на FLEURS English и 29,6% CER на FLEURS Mandarin, поэтому относитесь к фигуре LibriSpeech как к потолку. Никому не следует развертывать эту модель. Всем, кто работает в области ASR, следует прочитать о ней.
MOSS-Transcribe-Diarize 0.9B (Apache 2.0, 50+ языков) решает проблему, которую игнорируют большинство обзоров: он выдает метки говорящих, пословные временные метки и транскрипт за одну генерацию, а не цепочкой ASR к отдельному стеку диаризации. Контекст 128k, примерно 90 минут аудио за один проход, RTF ~0,017 на RTX 4090, со смещением горячих слов.
07Разделение лицензий, которое никто не читает до развертывания
Это раздел, который фактически блокирует отправку в продакшн, и поле четко делится:
- Apache 2.0: Cohere Transcribe, Granite Speech 4.1 (все три варианта), Qwen3-ASR (оба размера), Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe. Нет обязательства атрибуции, коммерческое использование не ограничено. Обратите внимание, что репозиторий Cohere закрыт соглашением об предоставлении контактной информации, хотя сама лицензия Apache 2.0.
- MIT: Whisper large-v3. Самый перmissive вариант в поле.
- CC-BY-4.0: Canary-Qwen-2.5B, Parakeet TDT 0.6B v3, Kyutai STT. Коммерчески используемо, но требуется атрибуция. Для встроенного продукта или white-labeled API это реальное обязательство по соблюдению требований, и это единственная самая распространенная причина, по которой команды отправляют модель, которая не является самой точной из протестированных.
Meta Omnilingual ASR разделяет два: Apache 2.0 для моделей, CC-BY для корпуса.

08Как на самом деле выбрать модель
Запустите этот порядок, а не только порядок лидерборда:
- Лицензия: Если атрибуция является препятствием, CC-BY-4.0 удаляет Parakeet, Canary-Qwen и Kyutai еще до того, как вы проведете бенчмаркинг.
- Покрытие языков: 14 языков Cohere, 6 языков Granite и только английский у Canary — это жесткие ограничения, а не мягкие. Cohere дополнительно не имеет автоматического определения языка, поэтому вы должны знать язык заранее.
- Потоковая передача или пакетная обработка: Это архитектурный вопрос. Никакая настройка не превратит офлайн-энкодер-декодер в модель с низкой задержкой для потоковой передачи.
- Затем измерьте WER на своем собственном аудио: Разброс между десятью лучшими моделями в публичном бенчмарке составляет менее одного пункта. Разброс на вашем аудио с акцентом, шумом и специфичной для домена лексикой будет в несколько раз больше, и он не ранжирует модели в том же порядке.
- Затем вычислите стоимость за час аудио на ваших собственных GPU: Фигуры RTFx измеряются при больших размерах батчей на оборудовании дата-центра и не переносятся напрямую.
09Что это значит на практике
Полезное резюме 2026 года заключается не в том, что какая-то одна модель победила. Оно в том, что открытая модель с весом 2 млрд параметров на разрешительной лицензии теперь превосходит то, что закрытые API взимали плату за это восемнадцать месяцев назад, и что оставшееся решение — это вопрос закупки, а не исследований.
Для компаний в России и странах СНГ это особенно актуально. Учитывая текущие ограничения доступа к некоторым зарубежным облачным сервисам и API, локальный запуск открытых моделей становится не просто опцией, а необходимостью. Модели с лицензией Apache 2.0, такие как Cohere Transcribe или Granite Speech, позволяют развернуть решение на собственных серверах без риска блокировок. Для задач, требующих работы с китайским языком, Qwen3-ASR предлагает непревзойденное покрытие диалектов. Для задач, где критична скорость и низкая задержка, например, в голосовых помощниках, Voxtral и Kyutai предлагают решения, которые можно запускать даже на относительно скромном оборудовании благодаря оптимизациям в vLLM и специфическим архитектурам.
Важно помнить, что «лучшая» модель — это та, которая лучше всего вписывается в ваши технические и юридические ограничения. Тщательное тестирование на реальных данных, учет лицензионных требований и понимание архитектурных ограничений (потоковая vs пакетная обработка) — вот ключ к успешному внедрению ASR в 2026 году.
Рынок открытого распознавания речи достиг зрелости. Теперь выбор модели — это не поиск «волшебной пули», а инженерная задача по оптимизации затрат, задержек и соответствия требованиям. И у вас есть все инструменты, чтобы решить ее эффективно.
Источник: MarkTechPost ↗
