Релиз модели6 августа 2026 г., 13:45 МСК🤖 Auto

Qwen3-TTS: 1.7B параметров для синтеза речи на edge-устройствах

Команда GGML представила квантованную версию модели Qwen3-TTS объемом 1.7B параметров, позволяющую запускать высококачественный синтез речи локально на устройствах с ограниченными ресурсами.

Баннер новости 5207

Новый стандарт легковесного TTS

Платформа Hugging Face пополнилась моделью Qwen3-TTS-12Hz-1.7B-Base-GGUF. Это решение от команды GGML (авторов формата GGUF) предназначено для локального развертывания систем синтеза речи (Text-to-Speech). Ключевая особенность модели — оптимизация для работы на «на краю» (edge devices), что делает её доступной для пользователей без мощных серверных GPU.

Архитектура и эффективность

Модель базируется на архитектуре qwen3tts и содержит 2 миллиарда параметров (в метаданных указано 2B, в названии файла акцент на 1.7B обученных/активных). Несмотря на компактный размер, модель сохраняет высокую качество генерации речи. Формат GGUF позволяет гибко настраивать точность вычислений, балансируя между качеством звука и потреблением памяти.

Требования к ресурсам и квантование

Одной из главных преимуществ модели является минимальный объем занимаемой памяти. Ниже приведена таблица соответствия уровней квантования и требуемого объема VRAM/RAM:

Уровень квантования Размер файла Точность
Q4_K_M 1.04 GB 4-bit
Q8_0 1.85 GB 8-bit
BF16 3.47 GB 16-bit (полная)

Версия Q4_K_M (1.04 GB) особенно интересна для запуска на мобильных устройствах или старых ноутбуках, где объем видеопамяти ограничен.

Статистика и доступность

С момента публикации модель уже набрала 1,195 загрузок за последний месяц, что свидетельствует о высоком интересе сообщества к легковесным решениям для аудио-генерации. На данный момент модель не развернута в официальных Inference Providers, поэтому для тестирования потребуется локальная установка через библиотеки, поддерживающие формат GGUF (например, llama.cpp или специализированные TTS-обертки).

Почему это важно

Рост популярности таких моделей, как Qwen3-TTS, указывает на тренд децентрализации AI-сервисов. Разработчики получают возможность внедрять синтез речи в свои приложения без зависимости от облачных API, обеспечивая приватность данных и снижение операционных расходов. Компактный размер в 1 ГБ делает эту модель одним из лидеров в нише edge-вычислений для аудио.

Источник: Huggingface ↗