Финансирование и запуск флагмана
Компания Fish Audio привлекла раунд финансирования объемом $52 млн и одновременно выпустила новую модель синтеза речи S2.1 Pro. Это решение позиционируется как прорыв в области быстрого клонирования голоса и детального контроля над интонацией. По заявлению разработчиков, новая архитектура позволяет бизнесу сократить расходы на использование голосового ИИ минимум на 50%. В случае невыполнения этого обещания компания гарантирует год бесплатного доступа к сервису.
Технические характеристики S2.1 Pro
Ключевая особенность модели — способность создавать высококачественный клон голоса на основе всего 5 секунд аудио. При этом пользователь получает granular control (поуровневое управление) над эмоциями, интонацией и темпом произношения на уровне отдельных слов. Это решает главную проблему предыдущих поколений TTS-систем — «роботизированность» и отсутствие эмоциональной окраски.
Сравнение с конкурентами
Fish Audio позиционирует S2.1 Pro как более быстрое и доступное решение на рынке. Согласно данным компании, новая модель превосходит ключевых игроков индустрии по скорости обработки и стоимости использования. Ниже приведено сравнение метрик:
| Параметр | Fish Audio (S2.1 Pro) | Cartesia | ElevenLabs |
|---|---|---|---|
| Скорость работы | 2x быстрее | База (1x) | Информация недостаточна |
| Стоимость | В 6 раз дешевле | Информация недостаточна | База (6x) |
| Время клонирования | 5 секунд аудио | Информация недостаточна | Информация недостаточна |
Промышленное внедрение
Модель уже интегрирована в продакшен крупные игроки рынка AI-видео и коммуникаций. Среди пользователей S2.1 Pro числятся HeyGen, LiveKit, Retell, Sanas и OpenArt. Это свидетельствует о готовности технологии для коммерческого использования в высоконагруженных сценариях, таких как генерация аватаров, голосовые помощники и локализация контента.
Источник: Fish ↗
