Главная/Блог/Разбор/Voice of Reason: Запуск математического…
Разбор4 мин чтения · 23 сентября 2026 г.

Voice of Reason: Запуск математического аудио-модели Kyutai на H100

Kyutai выпустила open-weight модели Voice of Reason, решающие устную математику через RL. Разбор архитектуры, требований к VRAM и сравнение бенчмарков с каскадными системами.

Voice of Reason: Запуск математического аудио-модели Kyutai на H100

Компания Kyutai представила две новые open-weight модели Voice of Reason (9B параметров), способные решать математические задачи на слух без промежуточной транскрипции. В отличие от стандартных каскадов ASR-LLM-TTS, эти модели работают напрямую со звуком, используя Reinforcement Learning (RL) для улучшения логических цепочек. Базовая модель GLM-4-Voice-9B показывала всего 27.3% точности на GSM8K, но после SFT и RL этот показатель вырос до 77.1%.

01Архитектура и обучение: от SFT к RL

Модели построены на базе GLM-4-Voice-9B. Ключевое отличие — отсутствие текстового LLM в контуре. Модель чередует вывод: 13 текстовых токенов и 26 аудио-токенов. Обучение проходило в два этапа:

  • Stage-1 SFT: Использовался датасет из 150,616 задач из Orca-Math. Задачи переписывались моделью Qwen3-235B для устного формата и озвучивались через DSM TTS. Точность выросла с 27.3% до 61.7%.
  • Stage-2 RL: Для каждого вопроса модель генерирует 4 ответа (temperature 0.9). Judge-модель Qwen3-235B-A22B-2507 оценивает декодированный текст по бинарной награде. Обучение шло на 16 GPU H100, выполнено 1,500 обновлений RL.
💡
Критическая настройка Temperature. Без коррекции логитов (деление на температуру перед log-softmax) точность на GSM8K падала с 65.5% до 12.3%. Это обязательный шаг при воспроизведении.

02Два чекпоинта: Direct vs Stitch

Релиз включает две версии, различающиеся стратегией рассуждения:

  1. glm-4-voice-of-reason-9b (Direct): Отвечает сразу, без скрытых токенов рассуждения. Любые шаги проговариваются вслух. Точность: 65.5% (70.3% без top-k).
  2. glm-4-voice-of-reason-stitch-9b (Stitch): Использует silent reasoning chunks (100 токенов) между блоками речи. Генерация «мыслей» происходит параллельно с воспроизведением предыдущей речи, что не добавляет задержки. Точность: 74.8% (77.1% без top-k).

Важный технический нюанс: в Stitch-версии используется audio-token merging — вероятности всех аудио-слов суммируются в один абстрактный токен. Это снижает дисперсию градиентов и делает оценку unbiased.

03Бенчмарки и сравнение с конкурентами

Ниже приведено сравнение точности на датасете GSM8K. Обратите внимание, что модели Kyutai работают в режиме full-duplex (голос-в-голос), тогда как Qwen2.5/3-Omni выдают текст.

Модель Параметры GSM8K (%) Примечание
PersonaPlex 8B 3.2 Full-duplex
GLM-4-Voice (Base) 9B 27.3 До обучения
STITCH (Chiang et al.) 9B 58.7 Предыдущий SOTA
Voice of Reason 9B 65.5 - 70.3 Direct mode
Voice of Reason (Stitch) 9B 74.8 - 77.1 Stitch mode
Qwen2.5-Omni 7B 84.7 Текстовый вывод
Qwen3-Omni 30B 94.6 Текстовый вывод
Cascaded ASR-LLM-TTS 31B LLM 95.7 Каскадная система

При реальной оценке с транскрипцией через Qwen3-ASR-1.7B, Stitch-модель показала 72.0 ± 1.9%. При этом естественность речи (UTMOSv2) практически не упала: 4.067 → 4.069 (Direct) и 4.174 → 4.164 (Stitch). Более того, RL сократил среднюю длину ответа Direct-модели с 41.9 до 36.4 секунд.

⚠️
Риск переобучения. При проверке на contamination выяснилось, что 54% вопросов из тестового набора пересказывали задачи из датасета Orca-Math. Учитывайте это при оценке реальной обобщающей способности.

04Деплой и системные требования

Модели открыты под лицензией GLM-4-Voice. Для запуска требуется репозиторий GLM-4-Voice для токенизатора и декодера речи. Архитектура позволяет запускать BF16-чекпоинты на одной видеокарте NVIDIA H100 (80GB VRAM).

Для локального запуска или тестирования используйте следующую структуру команды (пример для Hugging Face Transformers с учетом специфики аудио-модели):

terminalbash
# Установка зависимостей и репозитория
pip install git+https://github.com/THUDM/GLM-4-Voice.git
pip install torch torchaudio

# Пример инициализации модели (псевдокод для inference)
from transformers import AutoModelForSpeechSeq2Seq

model_id = "kyutai/voice-of-reason-9b"

# Загрузка модели с указанием bf16 для экономии VRAM
model = AutoModelForSpeechSeq2Seq.from_pretrained(
    model_id,
    torch_dtype=torch.bfloat16,
    device_map="cuda"
)

# Инференс аудио-ввод -> аудио-вывод
# Требуется предварительная обработка аудио через GLM-4-Voice tokenizer
📌
Доступность в РФ. Прямой доступ к Hugging Face и GPU-инстансам Kyutai может быть ограничен. Рекомендуется использовать локальные зеркала HF или прокси. Лицензия позволяет коммерческое использование, но требует соблюдения условий GLM-4-Voice.

05Кому подойдёт / что запустится

  • Для разработчиков Voice AI: Если вам нужен low-latency ассистент, решающий сложные задачи без задержек на транскрипцию. Direct-модель лучше для быстрых ответов, Stitch — для точности.
  • Железо: Требуется минимум 1x NVIDIA H100 (80GB) для BF16. На A100 (40GB) может потребоваться квантование (INT8/INT4), которое не тестировалось авторами и может снизить точность. На consumer-картах (RTX 3090/4090) запуск в полном размере невозможен без серьезного оптимизирования (vLLM/TensorRT-LLM с кастомными аудио-оптимизациями).
  • Альтернативы: Если вам не нужна именно аудио-вывод, а важна только математика, Qwen2.5-Omni (7B) или Qwen3-Omni (30B) показывают более высокие результаты, но работают только с текстом.

Источник: MarkTechPost ↗