Инструменты14 сентября 2026 г., 11:46 МСК🤖 Auto

X-AuT от XPeng: сжатие аудио-энкодера Speech LLM без потери качества

Команда XPeng AI представила X-AuT — метод прогрессивного сжатия аудио-энкодеров для речевых языковых моделей. Архитектура сокращает задержку на 21,4% в автомобилях, сохраняя точность транскрипции.

Баннер новости 7437

Проблема: сжатие ломает контекст

Удаление блоков аудио-энкодера в Speech LLM (таких как Qwen3-ASR) упрощает архитектуру, но нарушает распределение эмбеддингов, потребляемых декодером. Это приводит к ошибкам удаления токенов и преждевременному завершению генерации (premature end-of-sequence). X-AuT решает эту проблему, рассматривая выбор слоев и их восстановление как связанную задачу.

Методология: от 18 слоев к 14

Исходная модель Qwen3-ASR-0.6B имеет 18 слоев. X-AuT использует «поведенческие зонды» для выбора слоев, удаление которых минимально влияет на результат. Процесс включает:

  • Фильтрация данных: отбор из пула >280k часов с использованием согласованности транскриптов.
  • Прогрессивное прунинг: последовательное удаление пар слоев {1, 18}, затем {5, 6}.
  • Кросс-скейл дистилляция: замороженный учитель Qwen3-ASR-1.7B (2048→1024 проекции) обучает меньшего студента, а затем отбрасывается при инференсе.
  • LoRA-дообучение: финальная настройка на золотых транскриптах для восстановления интерфейса декодера.

Результаты: эффективность против точности

Метод предлагает два операционных режима. X-AuT-16 снижает параметры на 10,35% с улучшением точности, а X-AuT-14 дает максимальное ускорение с минимальным падением метрики.

Модель Параметры аудио-башни Изменение параметров Macro Error (CER/WER) Относительное изменение ошибки
Full-18 (Baseline) 186.376M 5.61%
X-AuT-16 (Stage 2) 167.085M −10.35% 5.27% −6.1%
X-AuT-14 (Stage 2) 147.794M −20.70% 5.75% +2.5%

Производительность в автомобиле (PPU)

На встроенном процессоре (PPU) NVIDIA H800 (или аналогичном автомобильном чипе) 14-слойная модель X-AuT демонстрирует значительное снижение задержки:

  • Задержка энкодера: −21.4% (на PPU) и −11.4% (на NVIDIA H800).
  • Пиковая память: −4.4% (на PPU).
  • End-to-end задержка: −4.7% (на PPU).

Сравнение показало, что кросс-скейл учитель (5.55% ошибки) превосходит самодистилляцию того же масштаба (8.45%), а прогрессивное прунинг (5.75%) лучше прямого (6.73%).

Открытый релиз

Команда XPeng AI опубликовала веса модели (safetensors), скрипт инференса и пример LoRA-адаптации. Исходный код и веса доступны на GitHub и Hugging Face. Статья доступна на arXiv:2609.11412.

Источник: Github ↗