Релиз модели29 июля 2026 г., 19:46 МСК🤖 Auto

Fish Audio S2.1 Pro: клонирование за 5 секунд и экономия 50% на TTS

Fish Audio закрыла раунд в $52 млн и представила модель S2.1 Pro, способную клонировать голос по 5-секундному сэмплу с управлением эмоциями. Сервис обещает сократить расходы на TTS вдвое.

Баннер новости 4649

Финансирование и запуск флагмана

Компания Fish Audio привлекла раунд финансирования объемом $52 млн и одновременно выпустила новую модель синтеза речи S2.1 Pro. Это решение позиционируется как прорыв в области быстрого клонирования голоса и детального контроля над интонацией. По заявлению разработчиков, новая архитектура позволяет бизнесу сократить расходы на использование голосового ИИ минимум на 50%. В случае невыполнения этого обещания компания гарантирует год бесплатного доступа к сервису.

Технические характеристики S2.1 Pro

Ключевая особенность модели — способность создавать высококачественный клон голоса на основе всего 5 секунд аудио. При этом пользователь получает granular control (поуровневое управление) над эмоциями, интонацией и темпом произношения на уровне отдельных слов. Это решает главную проблему предыдущих поколений TTS-систем — «роботизированность» и отсутствие эмоциональной окраски.

Сравнение с конкурентами

Fish Audio позиционирует S2.1 Pro как более быстрое и доступное решение на рынке. Согласно данным компании, новая модель превосходит ключевых игроков индустрии по скорости обработки и стоимости использования. Ниже приведено сравнение метрик:

Параметр Fish Audio (S2.1 Pro) Cartesia ElevenLabs
Скорость работы 2x быстрее База (1x) Информация недостаточна
Стоимость В 6 раз дешевле Информация недостаточна База (6x)
Время клонирования 5 секунд аудио Информация недостаточна Информация недостаточна

Промышленное внедрение

Модель уже интегрирована в продакшен крупные игроки рынка AI-видео и коммуникаций. Среди пользователей S2.1 Pro числятся HeyGen, LiveKit, Retell, Sanas и OpenArt. Это свидетельствует о готовности технологии для коммерческого использования в высоконагруженных сценариях, таких как генерация аватаров, голосовые помощники и локализация контента.

Источник: Fish ↗