Релиз модели4 июля 2026 г., 00:18 МСК🤖 Auto

Interfaze выпустила первый открытый диффузионный ASR: 6.6% WER на LibriSpeech

Стартап Interfaze (YC) открыл код модели diffusion-gemma-asr-small. Это первый мультязычный ASR на базе диффузии, использующий 26B-модель Google как бэкбон и обучивший всего 42M параметров.

Баннер новости 2884

Суть прорыва: диффузия вместо авторегрессии

Компания Interfaze представила diffusion-gemma-asr-small — модель распознавания речи, которая генерирует текст не по одному токену за раз (как Whisper или стандартные LLM), а параллельно, через процесс диффузии. Архитектура использует DiffusionGemma (26B параметров, MoE с 128 экспертами) в качестве замороженного бэкбона. Команда обучила лишь адаптер на 42M параметров (0.16% от веса бэкбона), что позволяет использовать мощь большой модели с минимальными затратами на дообучение.

Ключевое отличие: модель не использует стандартную схему маскирования <mask>. Вместо этого применяется uniform, random-token diffusion. Канвас фиксированной длины заполняется случайными токенами, и за несколько шагов (обычно 8–16) шум аннигилирует, превращаясь в осмысленный текст. Это позволяет декодировать все токены транскрипта параллельно.

Архитектура: как аудио попадает в LLM

Модель не подает сырой звук в LLM — это привело бы к галлюцинациям из-за несовпадения эмбеддингов. Вместо этого используется гибридный пайплайн:

  • Кодировщик: Замороженный whisper-small извлекает акустические фичи (1500 фреймов по 768 дименшн для 30 секунд аудио).
  • Проектор: Обучаемый слой сжимает фреймы до 188 «аудио-токенов» (2816 дименшн), которые вставляются в промпт DiffusionGemma.
  • Декодер: DiffusionGemma выполняет bidirectional denoising над 192-токенным холстом транскрипта.

Для обучения проектора команда использовала CTC-лосс, что позволило быстро стабилизировать градиенты и снизить ошибку с 90% до 6.6% WER за 10 эпох.

Результаты бенчмарков

Модель демонстрирует выдающиеся результаты для диффузионных подходов, превосходя аналоги, но уступая оптимизированным авторегрессивным моделям. Ниже сравнение на датасете LibriSpeech (test-clean) и FLEURS:

Модель Подход LibriSpeech WER FLEURS (en) WER
Whisper-large-v3 Autoregressive ~2.0% ~4–5%
Whisper-small Autoregressive ~3.4% ~9–10%
Whisfusion Diffusion (masked) 8.3%
diffusion-gemma-asr-small Diffusion (random-token) 6.6% 15.7%

Для мультязычных задач (FLEURS) модель показывает следующие результаты:

  • Английский: 15.7% WER
  • Хинди: 15.8% CER
  • Китайский: 29.6% CER

Производительность и стоимость

Главное преимущество диффузии здесь — независимость стоимости от длины транскрипта. Цена определяется количеством шагов денуайзинга. Модель работает примерно в 10–15 раз быстрее реального времени (RTF) при 16 шагах.

Шаги денуайзинга FLEURS WER Скорость (RTF)
8 15.7% 14.9×
16 15.6% 10.3×
32 15.2% 6.5×

Увеличение шагов с 8 до 48 дает прирост точности всего в 0.1 WER, но увеличивает задержку в 3 раза. Оптимальный баланс — 8–16 шагов.

Почему это важно

diffusion-gemma-asr-small — это первый открытый мультязычный ASR на базе диффузии, поддерживающий 6 языков (английский, немецкий, французский, испанский, хинди, мандарин) через один адаптер. Это открывает путь для исследований в области параллельного декодирования речи, где скорость генерации не зависит от длины аудиофайла. Модель доступна под лицензией Apache-2.0 (адаптер), требует загрузки DiffusionGemma (Gemma terms) и whisper-small (MIT).

Как запустить

Модель доступна на Hugging Face. Для работы требуется установка transformers из main ветки и стандартных библиотек аудио. Пример загрузки:

pip install torch peft soundfile librosa huggingface_hub \
"transformers @ git+https://github.com/huggingface/transformers.git"

Команда Interfaze рекомендует начинать с max_steps=8 для максимальной скорости или 16 для лучшего качества.

Бенчмарки

Бенчмаркdiffusion-gemma-asr-smallWhisfusionWhisper-large-v3Whisper-small
LibriSpeech test-clean6.6%8.3%2%3.4%
FLEURS English15.7%4.5%9.5%
VoxPopuli English18.5%8.5%10%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗