Кohere запустила Transcribe, свою первую open source (открытый исходный код) voice model для speech-to-text (преобразования речи в текст). Модель содержит 2 млрд параметров и теперь доступна для развёртывания на consumer-grade GPUs (обычных видеокартах среднего уровня). В тестовом режиме она обрабатывает до 525 минут аудио за минуту.
\nГлавный эффект прост: если раньше вам приходилось ждать готовой облачной стенографии, теперь вы можете запускать часть пайплайна на своём контуре. Бизнесу это даёт больше контроля и меньше зависимости от сторонних сервисов.
\n\nЧто реально изменилось: Transcribe закрывает пробел между качеством и управляемой стоимостью
\n
Новинка заточена под реальный workflow: заметки со встреч, расшифровка интервью и анализ переговоров. Важно, что это не гигантская 70-миллиардная модель, а 2 млрд параметров для практичного применения.
\nПо заявлению команды, Transcribe показывает лучший средний WER 5,42 на benchmark (тест производительности) Hugging Face Open ASR leaderboard (рейтинг точности распознавания речи). Сравнение проводили против Zoom Scribe v1, IBM Granite 4.0 1B, ElevenLabs Scribe v2 и Qwen3-ASR-1.7B, и по суммарной точности Transcribe впереди.
\n\n- \n
- 14 языков: английский, французский, немецкий, итальянский, испанский, португальский, греческий, нидерландский, польский, китайский, японский, корейский, вьетнамский и арабский. \n
- Высокая скорость: 525 минут входного аудио за одну минуту обработки в одном из ключевых сценариев. \n
- Аудитория: особенно полезно для заметок, транскрипции колл-центров и анализа встреч с высоким объёмом речи. \n
- Прозрачный выбор: люди оценивали расшифровки вручную по точности, связности и практичности. \n
| Параметр | \nTranscribe от Cohere | \nЧто это даёт | \n
|---|---|---|
| Размер | \n2 млрд параметров, open source | \nМеньше ресурсов и проще self-host (локальный запуск). | \n
| Точность | \nСредний WER 5,42 | \nНиже ошибок на benchmark, чем у нескольких крупных решений. | \n
| Human eval (оценка людьми) | \n61% win rate (процент побед) | \nЛучше справляется с точностью, логикой и пригодностью текста для работы. | \n
Надежно ли она на каждом языке? Не совсем. Для португальского, немецкого и испанского модель показывала меньший маржинальный выигрыш, поэтому контроль качества по этим языкам обязателен до внедрения в продакшн.
\n\nЗачем это сделали: рынок голосовых AI уходит к доступным, приватным конвейерам
\nЗапрос очевиден: приложения для заметок и диктовки растут быстрее, чем готовность тратить бюджеты на дорогие облачные тарифы. Transcribe закрывает нишу между качеством и ценой, где обычно выбирают компромисс.
\nКомпания делает шаг в сторону self-host (локального развёртывания): предприятия могут держать аудио и расшифровки ближе к своим системам без полной передачи на внешние облака. Это особенно важно для legal и HR-процессов, где требования к политике хранения данных жёстче.
\n- \n
- Памятка для команд: 61% человеческой оценки выигрыша даёт меньше ручной чистки расшифровок до рабочего качества. \n
- Ускорение: 525x-подобный throughput (производительность обработки) ускоряет пост-обработку вебинаров и встреч. \n
- Открытый формат: модель распространяется бесплатно через API (программный интерфейс приложения) и доступна в managed inference (управляемом выводе модели). \n
- Стратегия запуска: интеграция в North (оркестрация enterprise-агентов) расширит связку «голос → действие» в автоматизациях. \n
Если резюмировать, это шаг не просто в сторону новых функций, а в сторону стандарта: голосовые ассистенты становятся инфраструктурой, а не отдельной фичей продукта.
\n\nКак применить Transcribe уже сегодня: 6 шагов до рабочей транскрипции
\nДаже без полного перехода в экосистему Cohere можно запустить пилот без риска. Нужны только 1) API access (доступ к программному интерфейсу), 2) сценарий аудио и 3) человек для выборочной проверки.
\n- \n
- Сначала возьмите 5–10 переговоров по продажам и 5–10 внутренних встреч длительностью 30–60 минут. \n
- Проверьте базовые метрики WER (ошибки слов) на этих сегментах вручную и по шаблону business use case. \n
- Сравните скорость: сколько минут записи уходит в минуты обработки на вашей инфраструктуре. \n
- Сделайте отдельный прогон на португальском, немецком или испанском, если у вас локализованные процессы. \n
- Интегрируйте в Notion, CRM и таск-менеджер, чтобы убрать ручной конвертер. \n
- В конце цикла сравните экономию времени менеджеров и точность заметок с прежним решением. \n
После пилота уже видно, стоит ли продолжать с open source (открытый исходный код) моделью или брать гибрид с облачными сервисами. Для большинства команд 2 млрд параметров — это уже не «игрушка», а рабочий инструмент.
\n\nЧитайте источник на TechCrunch, а саму платформу сможем увидеть на cohere.com.
\nНеочевидный поворот: будущее распознавания речи уже не только про лучшие цифры WER, а про то, кто сможет держать голосовой поток внутри своей бизнес-архитектуры без утечек и задержек.
\n