Суть прорыва: диффузия вместо авторегрессии
Компания Interfaze представила diffusion-gemma-asr-small — модель распознавания речи, которая генерирует текст не по одному токену за раз (как Whisper или стандартные LLM), а параллельно, через процесс диффузии. Архитектура использует DiffusionGemma (26B параметров, MoE с 128 экспертами) в качестве замороженного бэкбона. Команда обучила лишь адаптер на 42M параметров (0.16% от веса бэкбона), что позволяет использовать мощь большой модели с минимальными затратами на дообучение.
Ключевое отличие: модель не использует стандартную схему маскирования <mask>. Вместо этого применяется uniform, random-token diffusion. Канвас фиксированной длины заполняется случайными токенами, и за несколько шагов (обычно 8–16) шум аннигилирует, превращаясь в осмысленный текст. Это позволяет декодировать все токены транскрипта параллельно.
Архитектура: как аудио попадает в LLM
Модель не подает сырой звук в LLM — это привело бы к галлюцинациям из-за несовпадения эмбеддингов. Вместо этого используется гибридный пайплайн:
- Кодировщик: Замороженный whisper-small извлекает акустические фичи (1500 фреймов по 768 дименшн для 30 секунд аудио).
- Проектор: Обучаемый слой сжимает фреймы до 188 «аудио-токенов» (2816 дименшн), которые вставляются в промпт DiffusionGemma.
- Декодер: DiffusionGemma выполняет bidirectional denoising над 192-токенным холстом транскрипта.
Для обучения проектора команда использовала CTC-лосс, что позволило быстро стабилизировать градиенты и снизить ошибку с 90% до 6.6% WER за 10 эпох.
Результаты бенчмарков
Модель демонстрирует выдающиеся результаты для диффузионных подходов, превосходя аналоги, но уступая оптимизированным авторегрессивным моделям. Ниже сравнение на датасете LibriSpeech (test-clean) и FLEURS:
| Модель | Подход | LibriSpeech WER | FLEURS (en) WER |
|---|---|---|---|
| Whisper-large-v3 | Autoregressive | ~2.0% | ~4–5% |
| Whisper-small | Autoregressive | ~3.4% | ~9–10% |
| Whisfusion | Diffusion (masked) | 8.3% | — |
| diffusion-gemma-asr-small | Diffusion (random-token) | 6.6% | 15.7% |
Для мультязычных задач (FLEURS) модель показывает следующие результаты:
- Английский: 15.7% WER
- Хинди: 15.8% CER
- Китайский: 29.6% CER
Производительность и стоимость
Главное преимущество диффузии здесь — независимость стоимости от длины транскрипта. Цена определяется количеством шагов денуайзинга. Модель работает примерно в 10–15 раз быстрее реального времени (RTF) при 16 шагах.
| Шаги денуайзинга | FLEURS WER | Скорость (RTF) |
|---|---|---|
| 8 | 15.7% | 14.9× |
| 16 | 15.6% | 10.3× |
| 32 | 15.2% | 6.5× |
Увеличение шагов с 8 до 48 дает прирост точности всего в 0.1 WER, но увеличивает задержку в 3 раза. Оптимальный баланс — 8–16 шагов.
Почему это важно
diffusion-gemma-asr-small — это первый открытый мультязычный ASR на базе диффузии, поддерживающий 6 языков (английский, немецкий, французский, испанский, хинди, мандарин) через один адаптер. Это открывает путь для исследований в области параллельного декодирования речи, где скорость генерации не зависит от длины аудиофайла. Модель доступна под лицензией Apache-2.0 (адаптер), требует загрузки DiffusionGemma (Gemma terms) и whisper-small (MIT).
Как запустить
Модель доступна на Hugging Face. Для работы требуется установка transformers из main ветки и стандартных библиотек аудио. Пример загрузки:
pip install torch peft soundfile librosa huggingface_hub \
"transformers @ git+https://github.com/huggingface/transformers.git"
Команда Interfaze рекомендует начинать с max_steps=8 для максимальной скорости или 16 для лучшего качества.
Бенчмарки
| Бенчмарк | diffusion-gemma-asr-small | Whisfusion | Whisper-large-v3 | Whisper-small |
|---|---|---|---|---|
| LibriSpeech test-clean | 6.6% | 8.3% | 2% | 3.4% |
| FLEURS English | 15.7% | — | 4.5% | 9.5% |
| VoxPopuli English | 18.5% | — | 8.5% | 10% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
