Представьте: вы нажимаете кнопку, и текст с сайта превращается в речь меньше чем за 1 секунду. Без интернета, без облака, без отправки данных наружу. Это не демо-магия, а новый Supertonic 3.
Модель весит всего 99M параметров и работает прямо на устройстве. Для сравнения: многие конкуренты занимают класс 0.7B–2B, то есть заметно тяжелее.
Что реально изменилось в Supertonic 3

Главный апгрейд: поддержка выросла с 5 до 31 языка. Плюс разработчики отдельно подчёркивают меньше ошибок с повторами и пропусками слов.
Ещё важнее, что система теперь удобна не только инженерам. Появился локальный HTTP (локальный веб-интерфейс) сервер с endpoint (адрес API) в стиле OpenAI-совместимости.
- 31 язык, включая русский, английский, испанский, японский, корейский и украинский.
- 44.1kHz 16-bit WAV сразу на выходе, без дополнительной обработки.
- 10 expression tags (теги выразительности), например смех, вздох, пауза.
- CPU-only запуск, GPU (видеокарта для вычислений) не обязателен.
- On-device (на устройстве) работа на десктопе, в браузере, на мобильных и edge (пограничных) девайсах.
Отдельный плюс для занятых команд: интеграции уже есть под Python, Node.js, Java, C++, C#, Go, Swift, Rust, Flutter и iOS. То есть внедрять можно почти в любой продуктовый стек (набор технологий).
Зачем это сделали и что за этим стоит
Рынок устал от дорогих облачных озвучек, где каждый запрос платный и медленный. Здесь ставка на приватность и скорость: данные не уходят в API (интерфейс внешнего сервиса), а остаются локально.
Вторая причина очевидна: автономные сценарии. Электронные книги, корпоративные ноутбуки, закрытые сети, Raspberry Pi и даже режим самолёта.
Третья цель, и она стратегическая, это совместимость. Новый релиз сохранил v2-compatible (совместимый с версией 2) ONNX (формат модели) интерфейс, чтобы существующие интеграции не ломались.
- Меньше веса модели, значит быстрее cold start (первый запуск).
- Меньше памяти, значит проще запускать на слабых устройствах.
- Open-weight (открытые веса модели), значит разработчики могут проверять и дорабатывать пайплайн (цепочку обработки).
Как применить прямо сейчас в работе
Если вы предприниматель, это быстрый путь к голосовому контенту без подписок на дорогой облачный TTS (синтез речи). Если вы маркетолог, можно озвучивать лендинги, статьи и карточки продуктов за минуты.
Если вы разработчик, старт максимально прямой: pip install supertonic, затем локальный запуск и вызов через HTTP (протокол передачи данных). Нужен OpenAI-совместимый формат, используете /v1/audio/speech.
- Контент-студии: быстрые черновые озвучки роликов и подкастов.
- SaaS-продукты: voice feature (голосовая функция) без внешнего API.
- EdTech: локальная озвучка учебных материалов на 31 языке.
- Корпоративные системы: приватная генерация речи внутри периметра безопасности.
Полезная деталь: есть режим lang="na". Это language-agnostic (языконезависимый) ввод, когда вы не уверены, на каком языке текст.
Коротко по цифрам, которые решают
| Параметр | Что даёт на практике |
| 99M параметров | Быстрый запуск и умеренные требования к железу |
| 31 язык | Один движок для международных сценариев |
| 44.1kHz | Готовый продакшн-уровень аудио |
| Локальный HTTP server (сервер) | Быстрое подключение к существующим инструментам |
| CPU-only | Не нужен дорогой GPU (видеоускоритель) |
Репозиторий проекта: github.com/supertone-inc/supertonic.
И вот главный сдвиг: голосовой интерфейс перестаёт быть «облачной роскошью» и становится базовой функцией, как поиск по сайту. Когда озвучка работает офлайн и почти мгновенно, её начинают встраивать везде, а не только в большие продукты с крупным бюджетом.
