Прорыв в speech-to-speech reasoning
Лаборатория Kyutai представила модель Voice of Reason — первое применение обучения с подкреплением (RL) для математического рассуждения в полностью голосовых моделях. В отличие от традиционных каскадных пайплайнов (ASR → LLM → TTS), которые теряют паралингвистические сигналы и добавляют задержку, Voice of Reason генерирует аудио напрямую, обрабатывая речь как единый поток. Это позволяет модели сохранять интерактивность и интонацию, критически важные для диалога.
Архитектура и обучение: от SFT к RL
Модели построены на базе GLM-4-Voice-9B и прошли два этапа доработки. Первый этап — Supervised Fine-Tuning (SFT) на 150 616 задачах из датасета Orca-Math, озвученных с помощью DSM TTS. Второй этап — RL с использованием судьи Qwen3-235B-A22B-2507, который оценивал текстовую расшифровку ответов без знания правильного ответа. Обучение проводилось на 16 GPU H100 с 1 500 обновлениями RL.
Ключевые технические инновации:
- Temperature correction: логиты делятся на температуру выборки перед log-softmax. Без этого точность падала с 65,5% до 12,3%.
- Audio-token merging: вероятности всех аудио-токенов суммируются в один абстрактный токен, что снижает дисперсию оценки и делает оценку без смещения.
Два режима работы и результаты
Выпущены две версии модели: glm-4-voice-of-reason-9b (прямой ответ) и glm-4-voice-of-reason-stitch-9b (с скрытыми рассуждениями). Версия Stitch генерирует 100-токенные блоки рассуждений параллельно с озвучкой, не добавляя задержки. Сравнение точности на датасете GSM8K:
| Модель | Параметры | GSM8K (%) | Примечание |
|---|---|---|---|
| GLM-4-Voice (base) | 9B | 27.3 | Исходная модель |
| STITCH (Chiang et al.) | 9B | 58.7 | Предыдущий SOTA для speech-native |
| Voice of Reason (Direct) | 9B | 65.5 ± 1.1 | Без top-k: 70.3% |
| Voice of Reason (Stitch) | 9B | 74.8 ± 1.1 | Без top-k: 77.1% |
| Qwen2.5-Omni | 7B | 84.7 | Текстовый вывод (не прямое сравнение) |
| Qwen3-Omni | 30B | 94.6 | Текстовый вывод (не прямое сравнение) |
Практическая применимость и ограничения
Модели работают на одной GPU H100 в формате BF16, что делает их пригодными для self-hosting. Однако они требуют репозитория GLM-4-Voice для токенизатора и декодера речи. Качество естественности речи (UTMOSv2) осталось стабильным (~4.06–4.17), а RL даже сократило среднюю длину ответа прямой модели с 41,9 до 36,4 секунд. При этом наблюдается снижение знаний общего контекста (Spoken Trivia), что характерно для узкоспециализированной дообучки.
Источник: MarkTechPost ↗
