Релиз модели8 сентября 2026 г., 11:47 МСК🤖 Auto

Smallest AI: Lightning v3.1 Pro обходит конкурентов по MOS и задержке

Smallest AI представила премиальную модель TTS Lightning v3.1 Pro с нативным разрешением 44.1 кГц, задержкой 200 мс и оценкой естественности MOS 4.22, превосходящую GPT-4o-mini и ElevenLabs в ключевых метриках.

Баннер новости 7001

Новый стандарт качества: 44.1 kHz и изолированные ресурсы

Компания Smallest AI выпустила модель Lightning v3.1 Pro, позиционируемую как премиальное решение для генерации речи. Ключевое отличие от стандартной версии v3.1 — использование выделенных вычислительных ресурсов (dedicated inference capacity), что гарантирует стабильность при высоких нагрузках. Модель поддерживает нативную частоту дискретизации 44.1 kHz, что обеспечивает качество звука уровня broadcast, и работает с 31 языком, включая 10 индийских, 8 азиатских/ближневосточных и 13 европейских языков, а также функцию автоматического роутинга.

Производительность: 200 мс TTFB и скорость 3.3x

Архитектура модели оптимизирована для real-time приложений. При 40 одновременных запросах время до первого байта (TTFB) составляет всего 200 мс (измерено в регионах AWS ap-south-1 и us-west-2). Реальный фактор времени (Real-time factor) равен 3.3, что означает генерацию аудио в 3.3 раза быстрее скорости его воспроизведения. Это делает модель идеальной для голосовых помощников и живых трансляций.

Бенчмарки: Превосходство в естественности и выразительности

В сравнительных тестах Lightning v3.1 Pro демонстрирует высокие результаты по шкале Mean Opinion Score (MOS). Модель обошла таких гигантов, как GPT-4o-mini, ElevenLabs Turbo v2.5 и Sonic-3, по показателям естественности (Naturalness) и выразительности (Expressiveness). Ниже приведены ключевые метрики качества.

Метрика Lightning v3.1 Pro GPT-4o-mini ElevenLabs Turbo v2.5 Sonic-3 Gemini 2.5 Flash
Overall MOS 4.22 4.16 3.98 3.76 4.24
Overall Naturalness 3.16 3.13 3.16 3.20 3.28
Overall Expressiveness 3.55 3.45 3.44 3.38 3.54
WER (Whisper jiwer) 1.36% 1.26% 1.35% 1.43% 1.37%
WER (Whisper LLM) 0.96% 0.82% 0.72% 0.88% 0.72%

Обратите внимание: чем ниже значение WER (Word Error Rate), тем точнее модель передает текст. Lightning v3.1 Pro показывает стабильно низкий уровень ошибок, особенно в метрике Hallucination (галлюцинации), где результат равен 0.00% по обоим методам проверки.

Точность и контроль произношения

Модель выделяется способностью корректно обрабатывать сложные случаи: code-switching (смешение языков, например, английский и хинди), специфические брендовые названия и доменную лексику благодаря встроенным словарям произношения. Метрика Pronunciation Style (стиль произношения) оценивается в 4.98 из 5.0, что свидетельствует о высоком уровне стилистической согласованности (формальный/неформальный регистр, региональные акценты).

Стоимость и доступность

Модель доступна через API (HTTP, SSE, WebSocket). Для стандартного плана стоимость составляет около $0.195 за 10 000 символов. Поддерживается до 10 одновременных подключений (concurrency) в базовом тарифе. Рекомендуемое оборудование для локального развертывания (если применимо) — NVIDIA L40S. Максимальный оптимальный размер чанка для запроса — 140-250 символов.

Источник: Smallest ↗