Компания Kyutai представила две новые open-weight модели Voice of Reason (9B параметров), способные решать математические задачи на слух без промежуточной транскрипции. В отличие от стандартных каскадов ASR-LLM-TTS, эти модели работают напрямую со звуком, используя Reinforcement Learning (RL) для улучшения логических цепочек. Базовая модель GLM-4-Voice-9B показывала всего 27.3% точности на GSM8K, но после SFT и RL этот показатель вырос до 77.1%.
01Архитектура и обучение: от SFT к RL
Модели построены на базе GLM-4-Voice-9B. Ключевое отличие — отсутствие текстового LLM в контуре. Модель чередует вывод: 13 текстовых токенов и 26 аудио-токенов. Обучение проходило в два этапа:
- Stage-1 SFT: Использовался датасет из 150,616 задач из Orca-Math. Задачи переписывались моделью Qwen3-235B для устного формата и озвучивались через DSM TTS. Точность выросла с 27.3% до 61.7%.
- Stage-2 RL: Для каждого вопроса модель генерирует 4 ответа (temperature 0.9). Judge-модель Qwen3-235B-A22B-2507 оценивает декодированный текст по бинарной награде. Обучение шло на 16 GPU H100, выполнено 1,500 обновлений RL.
02Два чекпоинта: Direct vs Stitch
Релиз включает две версии, различающиеся стратегией рассуждения:
- glm-4-voice-of-reason-9b (Direct): Отвечает сразу, без скрытых токенов рассуждения. Любые шаги проговариваются вслух. Точность: 65.5% (70.3% без top-k).
- glm-4-voice-of-reason-stitch-9b (Stitch): Использует silent reasoning chunks (100 токенов) между блоками речи. Генерация «мыслей» происходит параллельно с воспроизведением предыдущей речи, что не добавляет задержки. Точность: 74.8% (77.1% без top-k).
Важный технический нюанс: в Stitch-версии используется audio-token merging — вероятности всех аудио-слов суммируются в один абстрактный токен. Это снижает дисперсию градиентов и делает оценку unbiased.
03Бенчмарки и сравнение с конкурентами
Ниже приведено сравнение точности на датасете GSM8K. Обратите внимание, что модели Kyutai работают в режиме full-duplex (голос-в-голос), тогда как Qwen2.5/3-Omni выдают текст.
| Модель | Параметры | GSM8K (%) | Примечание |
|---|---|---|---|
| PersonaPlex | 8B | 3.2 | Full-duplex |
| GLM-4-Voice (Base) | 9B | 27.3 | До обучения |
| STITCH (Chiang et al.) | 9B | 58.7 | Предыдущий SOTA |
| Voice of Reason | 9B | 65.5 - 70.3 | Direct mode |
| Voice of Reason (Stitch) | 9B | 74.8 - 77.1 | Stitch mode |
| Qwen2.5-Omni | 7B | 84.7 | Текстовый вывод |
| Qwen3-Omni | 30B | 94.6 | Текстовый вывод |
| Cascaded ASR-LLM-TTS | 31B LLM | 95.7 | Каскадная система |
При реальной оценке с транскрипцией через Qwen3-ASR-1.7B, Stitch-модель показала 72.0 ± 1.9%. При этом естественность речи (UTMOSv2) практически не упала: 4.067 → 4.069 (Direct) и 4.174 → 4.164 (Stitch). Более того, RL сократил среднюю длину ответа Direct-модели с 41.9 до 36.4 секунд.
04Деплой и системные требования
Модели открыты под лицензией GLM-4-Voice. Для запуска требуется репозиторий GLM-4-Voice для токенизатора и декодера речи. Архитектура позволяет запускать BF16-чекпоинты на одной видеокарте NVIDIA H100 (80GB VRAM).
Для локального запуска или тестирования используйте следующую структуру команды (пример для Hugging Face Transformers с учетом специфики аудио-модели):
# Установка зависимостей и репозитория
pip install git+https://github.com/THUDM/GLM-4-Voice.git
pip install torch torchaudio
# Пример инициализации модели (псевдокод для inference)
from transformers import AutoModelForSpeechSeq2Seq
model_id = "kyutai/voice-of-reason-9b"
# Загрузка модели с указанием bf16 для экономии VRAM
model = AutoModelForSpeechSeq2Seq.from_pretrained(
model_id,
torch_dtype=torch.bfloat16,
device_map="cuda"
)
# Инференс аудио-ввод -> аудио-вывод
# Требуется предварительная обработка аудио через GLM-4-Voice tokenizer05Кому подойдёт / что запустится
- Для разработчиков Voice AI: Если вам нужен low-latency ассистент, решающий сложные задачи без задержек на транскрипцию. Direct-модель лучше для быстрых ответов, Stitch — для точности.
- Железо: Требуется минимум 1x NVIDIA H100 (80GB) для BF16. На A100 (40GB) может потребоваться квантование (INT8/INT4), которое не тестировалось авторами и может снизить точность. На consumer-картах (RTX 3090/4090) запуск в полном размере невозможен без серьезного оптимизирования (vLLM/TensorRT-LLM с кастомными аудио-оптимизациями).
- Альтернативы: Если вам не нужна именно аудио-вывод, а важна только математика, Qwen2.5-Omni (7B) или Qwen3-Omni (30B) показывают более высокие результаты, но работают только с текстом.
Источник: MarkTechPost ↗
