Релиз модели23 сентября 2026 г., 10:22 МСК🤖 Auto

Voice of Reason: Kyutai обучила голосовую модель решать математику через RL

Kyutai выпустила две open-weight модели на базе GLM-4-Voice, которые решают математические задачи вслух без промежуточной транскрипции. Точность на GSM8K выросла с 27,3% до 77,1% благодаря применению Reinforcement Learning.

Баннер новости 8088

Прорыв в speech-to-speech reasoning

Лаборатория Kyutai представила модель Voice of Reason — первое применение обучения с подкреплением (RL) для математического рассуждения в полностью голосовых моделях. В отличие от традиционных каскадных пайплайнов (ASR → LLM → TTS), которые теряют паралингвистические сигналы и добавляют задержку, Voice of Reason генерирует аудио напрямую, обрабатывая речь как единый поток. Это позволяет модели сохранять интерактивность и интонацию, критически важные для диалога.

Архитектура и обучение: от SFT к RL

Модели построены на базе GLM-4-Voice-9B и прошли два этапа доработки. Первый этап — Supervised Fine-Tuning (SFT) на 150 616 задачах из датасета Orca-Math, озвученных с помощью DSM TTS. Второй этап — RL с использованием судьи Qwen3-235B-A22B-2507, который оценивал текстовую расшифровку ответов без знания правильного ответа. Обучение проводилось на 16 GPU H100 с 1 500 обновлениями RL.

Ключевые технические инновации:

  • Temperature correction: логиты делятся на температуру выборки перед log-softmax. Без этого точность падала с 65,5% до 12,3%.
  • Audio-token merging: вероятности всех аудио-токенов суммируются в один абстрактный токен, что снижает дисперсию оценки и делает оценку без смещения.

Два режима работы и результаты

Выпущены две версии модели: glm-4-voice-of-reason-9b (прямой ответ) и glm-4-voice-of-reason-stitch-9b (с скрытыми рассуждениями). Версия Stitch генерирует 100-токенные блоки рассуждений параллельно с озвучкой, не добавляя задержки. Сравнение точности на датасете GSM8K:

Модель Параметры GSM8K (%) Примечание
GLM-4-Voice (base) 9B 27.3 Исходная модель
STITCH (Chiang et al.) 9B 58.7 Предыдущий SOTA для speech-native
Voice of Reason (Direct) 9B 65.5 ± 1.1 Без top-k: 70.3%
Voice of Reason (Stitch) 9B 74.8 ± 1.1 Без top-k: 77.1%
Qwen2.5-Omni 7B 84.7 Текстовый вывод (не прямое сравнение)
Qwen3-Omni 30B 94.6 Текстовый вывод (не прямое сравнение)

Практическая применимость и ограничения

Модели работают на одной GPU H100 в формате BF16, что делает их пригодными для self-hosting. Однако они требуют репозитория GLM-4-Voice для токенизатора и декодера речи. Качество естественности речи (UTMOSv2) осталось стабильным (~4.06–4.17), а RL даже сократило среднюю длину ответа прямой модели с 41,9 до 36,4 секунд. При этом наблюдается снижение знаний общего контекста (Spoken Trivia), что характерно для узкоспециализированной дообучки.

Источник: MarkTechPost ↗