Релиз модели27 сентября 2026 г., 02:18 МСК🤖 Auto

Sarvam AI выпустил Saaras V4: 22 языка Индии и ключевые термины за ₹30/час

Индийская лаборатория Sarvam AI представила модель распознавания речи Saaras V4, поддерживающую все 22 официальных языка Индии и глобальный английский. Модель использует гибридный декодер на 3 млрд параметров и предлагает уникальные режимы вывода, вк

Баннер новости 8354

Архитектура и возможности

Saaras V4 — это система типа encoder-decoder. Аудиоэнкодер преобразует звуковую волну в эмбеддинги, сохраняющие фонетические детали, а адаптер временной дискретизации сжимает последовательность для экономии контекстного окна. Декодером выступает Sarvam-3B — гибридная языковая модель на основе пространственных состояний (state-space), обученная с нуля. Модель поддерживает 5 режимов вывода через параметр mode: transcribe (стандарт), verbatim (дословно), codemix (сохранение английских слов латиницей), translit (транслитерация) и translate (перевод на английский). Это позволяет избежать ошибок постобработки.

Ключевые термины и бенчмарки

Новинка поддерживает Keyterm Prompting: пользователь может передать до 50 терминов (до 64 символов), чтобы повысить точность распознавания специфичных названий. На датасете IndicContextEval L5 модель показала WER 16.03%. В тестах на шумных аудио (Kathbath Noisy) ошибка Saaras V4 менее чем вдвое ниже, чем у Deepgram Nova-3 и GPT-4o. Идентификация языка среди 22 индийских языков имеет ошибку всего 2.9%.

Сравнение с конкурентами

Sarvam позиционирует Saaras V4 как решение с лучшим покрытием индийских языков. Ниже приведено сравнение ключевых характеристик с ближайшими аналогами на рынке.

Характеристика Sarvam Saaras V4 Deepgram Nova-3 ElevenLabs Scribe v2 OpenAI GPT-4o
Индийские языки (из 22) 22 11 14 Не указано
Всего языков 23 45+ 90+ —
Keyterm biasing До 50 терминов Платная опция До 1000 (батч) Свободный текст
Режимы вывода 5 встроенных Транскрипт + Smart Formatting Verbatim / no_verbatim Транскрипт
Стоимость (STT) ₹30/час $0.0052/мин $0.22/час ~$0.006/мин

Доступность и цены

Модель доступна через API с использованием параметра model="saaras:v4". Поддерживается стриминг через WebSocket с временем до первого токена (TTFT) менее 150 мс. Цены для разработчиков составляют ₹30 за час аудио для стриминга и пакетной обработки, и ₹45 за час при включенной диаризации спикеров. Веса модели не опубликованы, самохостинг пока доступен только для версии v3 через AWS SageMaker. Обновление с v3 на v4 требует изменения только одной строки в коде запроса.

Источник: MarkTechPost ↗