Результаты бенчмарков и точность
SpaceXAI сообщает о значительном скачке в качестве распознавания, особенно в сложных условиях. Модель заняла 1-е место среди 32 потоковых моделей на публичном лидерборде Artificial Analysis (бенчмарк AA-WER Streaming). Особый прорыв отмечен в мультиязычном распознавании коротких фраз (например, голосовых команд в авто): ошибка слова (WER) снизилась с 20,6% до 6,8%, что эквивалентно уменьшению количества ошибок на 67%.
Сравнение производительности (WER)
Внутренние тесты SpaceXAI показывают улучшение по всем ключевым сценариям использования по сравнению с первой версией модели:
| Сценарий | Версия 1.0 (WER) | Версия 2.0 (WER) | Улучшение |
|---|---|---|---|
| Короткие фразы (19 языков) | 20.6% | 6.8% | ~67% меньше ошибок |
| Телефония (8 кГц, английский) | Информация недостаточна | Лидер среди протестированных | Лучший результат |
| Диалоги с Grok | Информация недостаточна | Улучшено | Рост точности |
| Креденшиалы (номера, email) | Информация недостаточна | Улучшено | Рост точности |
Технические возможности и API
Модель доступна исключительно через хостинг API (модель ID: grok-voice-transcribe-2.0), открытые веса не предоставлены. Разработчики получили доступ к мощному набору функций в рамках единого интерфейса:
- Режимы работы: Пакетная обработка (файлы до 500 МБ) и потоковая передача через WebSocket.
- Диааризация: Разделение говорящих без дополнительной платы.
- Мультиканальность: Транскрипция до 8 независимых аудиоканалов.
- Форматирование: Автоматическое написание чисел, валют и дат, а также удаление слов-паразитов («эм», «ну»).
- Key Term Biasing: Поддержка до 100 доменных терминов для повышения точности в узких задачах.
Экономика и внедрение
SpaceXAI сохранила ценовую политику первой версии, что делает предложение крайне конкурентоспособным. Пакетная транскрипция стоит $0.10 за час аудио, потоковая — $0.20 за час. Все дополнительные функции (таймкоды, диааризация) включены в базовую стоимость.
Первым крупным кейсом внедрения стала Atlassian Loom. Компания интегрировала Grok Voice Transcribe 2.0 для транскрипции всех видео, чтобы автоматизировать перевод контекста в код с помощью Cursor. По словам Sanchan Saxena (SVP Atlassian), это позволяет «замкнуть петлю от контекста к коду».
Как начать работу
Для использования необходимо указать модель явно в запросе. Пример базового curl-запроса:
curl -X POST https://api.x.ai/v1/stt \
-H "Authorization: Bearer $XAI_API_KEY" \
-F "model=grok-voice-transcribe-2.0" \
-F "format=true" \
-F "language=en" \
-F "file=@audio.mp3"
Документация и технические детали доступны на официальном сайте SpaceXAI.
Источник: MarkTechPost ↗
