AI-новости18 мая 2026 г., 18:06 МСК

Supertonic 3: офлайн-озвучка на 31 языке, которая читает страницу вслух быстрее секунды

Фото новости

Представьте: вы нажимаете кнопку, и текст с сайта превращается в речь меньше чем за 1 секунду. Без интернета, без облака, без отправки данных наружу. Это не демо-магия, а новый Supertonic 3.

Модель весит всего 99M параметров и работает прямо на устройстве. Для сравнения: многие конкуренты занимают класс 0.7B–2B, то есть заметно тяжелее.

Что реально изменилось в Supertonic 3

GitHub-страница Supertonic с описанием on-device TTS, языками и блоком Highlights
Скриншот: github.com

Главный апгрейд: поддержка выросла с 5 до 31 языка. Плюс разработчики отдельно подчёркивают меньше ошибок с повторами и пропусками слов.

Ещё важнее, что система теперь удобна не только инженерам. Появился локальный HTTP (локальный веб-интерфейс) сервер с endpoint (адрес API) в стиле OpenAI-совместимости.

  • 31 язык, включая русский, английский, испанский, японский, корейский и украинский.
  • 44.1kHz 16-bit WAV сразу на выходе, без дополнительной обработки.
  • 10 expression tags (теги выразительности), например смех, вздох, пауза.
  • CPU-only запуск, GPU (видеокарта для вычислений) не обязателен.
  • On-device (на устройстве) работа на десктопе, в браузере, на мобильных и edge (пограничных) девайсах.

Отдельный плюс для занятых команд: интеграции уже есть под Python, Node.js, Java, C++, C#, Go, Swift, Rust, Flutter и iOS. То есть внедрять можно почти в любой продуктовый стек (набор технологий).

Зачем это сделали и что за этим стоит

Рынок устал от дорогих облачных озвучек, где каждый запрос платный и медленный. Здесь ставка на приватность и скорость: данные не уходят в API (интерфейс внешнего сервиса), а остаются локально.

Вторая причина очевидна: автономные сценарии. Электронные книги, корпоративные ноутбуки, закрытые сети, Raspberry Pi и даже режим самолёта.

Третья цель, и она стратегическая, это совместимость. Новый релиз сохранил v2-compatible (совместимый с версией 2) ONNX (формат модели) интерфейс, чтобы существующие интеграции не ломались.

  • Меньше веса модели, значит быстрее cold start (первый запуск).
  • Меньше памяти, значит проще запускать на слабых устройствах.
  • Open-weight (открытые веса модели), значит разработчики могут проверять и дорабатывать пайплайн (цепочку обработки).

Как применить прямо сейчас в работе

Если вы предприниматель, это быстрый путь к голосовому контенту без подписок на дорогой облачный TTS (синтез речи). Если вы маркетолог, можно озвучивать лендинги, статьи и карточки продуктов за минуты.

Если вы разработчик, старт максимально прямой: pip install supertonic, затем локальный запуск и вызов через HTTP (протокол передачи данных). Нужен OpenAI-совместимый формат, используете /v1/audio/speech.

  • Контент-студии: быстрые черновые озвучки роликов и подкастов.
  • SaaS-продукты: voice feature (голосовая функция) без внешнего API.
  • EdTech: локальная озвучка учебных материалов на 31 языке.
  • Корпоративные системы: приватная генерация речи внутри периметра безопасности.

Полезная деталь: есть режим lang="na". Это language-agnostic (языконезависимый) ввод, когда вы не уверены, на каком языке текст.

Коротко по цифрам, которые решают

ПараметрЧто даёт на практике
99M параметровБыстрый запуск и умеренные требования к железу
31 языкОдин движок для международных сценариев
44.1kHzГотовый продакшн-уровень аудио
Локальный HTTP server (сервер)Быстрое подключение к существующим инструментам
CPU-onlyНе нужен дорогой GPU (видеоускоритель)

Репозиторий проекта: github.com/supertone-inc/supertonic.

И вот главный сдвиг: голосовой интерфейс перестаёт быть «облачной роскошью» и становится базовой функцией, как поиск по сайту. Когда озвучка работает офлайн и почти мгновенно, её начинают встраивать везде, а не только в большие продукты с крупным бюджетом.