Новый стандарт качества: 44.1 kHz и изолированные ресурсы
Компания Smallest AI выпустила модель Lightning v3.1 Pro, позиционируемую как премиальное решение для генерации речи. Ключевое отличие от стандартной версии v3.1 — использование выделенных вычислительных ресурсов (dedicated inference capacity), что гарантирует стабильность при высоких нагрузках. Модель поддерживает нативную частоту дискретизации 44.1 kHz, что обеспечивает качество звука уровня broadcast, и работает с 31 языком, включая 10 индийских, 8 азиатских/ближневосточных и 13 европейских языков, а также функцию автоматического роутинга.
Производительность: 200 мс TTFB и скорость 3.3x
Архитектура модели оптимизирована для real-time приложений. При 40 одновременных запросах время до первого байта (TTFB) составляет всего 200 мс (измерено в регионах AWS ap-south-1 и us-west-2). Реальный фактор времени (Real-time factor) равен 3.3, что означает генерацию аудио в 3.3 раза быстрее скорости его воспроизведения. Это делает модель идеальной для голосовых помощников и живых трансляций.
Бенчмарки: Превосходство в естественности и выразительности
В сравнительных тестах Lightning v3.1 Pro демонстрирует высокие результаты по шкале Mean Opinion Score (MOS). Модель обошла таких гигантов, как GPT-4o-mini, ElevenLabs Turbo v2.5 и Sonic-3, по показателям естественности (Naturalness) и выразительности (Expressiveness). Ниже приведены ключевые метрики качества.
| Метрика | Lightning v3.1 Pro | GPT-4o-mini | ElevenLabs Turbo v2.5 | Sonic-3 | Gemini 2.5 Flash |
|---|---|---|---|---|---|
| Overall MOS | 4.22 | 4.16 | 3.98 | 3.76 | 4.24 |
| Overall Naturalness | 3.16 | 3.13 | 3.16 | 3.20 | 3.28 |
| Overall Expressiveness | 3.55 | 3.45 | 3.44 | 3.38 | 3.54 |
| WER (Whisper jiwer) | 1.36% | 1.26% | 1.35% | 1.43% | 1.37% |
| WER (Whisper LLM) | 0.96% | 0.82% | 0.72% | 0.88% | 0.72% |
Обратите внимание: чем ниже значение WER (Word Error Rate), тем точнее модель передает текст. Lightning v3.1 Pro показывает стабильно низкий уровень ошибок, особенно в метрике Hallucination (галлюцинации), где результат равен 0.00% по обоим методам проверки.
Точность и контроль произношения
Модель выделяется способностью корректно обрабатывать сложные случаи: code-switching (смешение языков, например, английский и хинди), специфические брендовые названия и доменную лексику благодаря встроенным словарям произношения. Метрика Pronunciation Style (стиль произношения) оценивается в 4.98 из 5.0, что свидетельствует о высоком уровне стилистической согласованности (формальный/неформальный регистр, региональные акценты).
Стоимость и доступность
Модель доступна через API (HTTP, SSE, WebSocket). Для стандартного плана стоимость составляет около $0.195 за 10 000 символов. Поддерживается до 10 одновременных подключений (concurrency) в базовом тарифе. Рекомендуемое оборудование для локального развертывания (если применимо) — NVIDIA L40S. Максимальный оптимальный размер чанка для запроса — 140-250 символов.
Источник: Smallest ↗
