Главная/Блог/Гайд/DiffusionGemma-ASR: Революция в…
Гайд9 мин чтения · 4 июля 2026 г.

DiffusionGemma-ASR: Революция в распознавании речи через диффузию

Стартап Interfaze представил первую открытую мультязычную модель распознавания речи на базе диффузии. Разбираем архитектуру, преимущества параллельного декодирования и практическое применение.

DiffusionGemma-ASR: Революция в распознавании речи через диффузию

В мире искусственного интеллекта, где доминируют авторегрессионные модели, генерирующие текст слово за словом, появляется новый игрок, предлагающий принципиально иной подход. Стартап Interfaze, поддерживаемый Y Combinator, выпустил на открытые рельсы модель diffusion-gemma-asr-small. Это не просто очередная версия Whisper или аналогичных систем. Это первый в своем роде открытый мультязычный ASR (Automatic Speech Recognition) на основе диффузии. Модель способна транскрибировать речь на шести языках, используя всего один адаптер, и делает это, опираясь на мощь 26-миллиардной модели DiffusionGemma от Google, но с минимальными вычислительными затратами.

Что делает эту технологию особенной? В отличие от традиционных подходов, где текст строится последовательно, диффузионные модели работают параллельно. Они начинают с «шума» и постепенно очищают его до чистого текста. Для распознавания речи это означает потенциально более высокую скорость обработки и уникальные архитектурные решения, которые ранее считались неприменимыми к аудио. В этой статье мы подробно разберем, как работает эта система, какие проблемы она решает и что это значит для разработчиков и исследователей в России и мире.

01Что такое диффузия в контексте распознавания речи?

Чтобы понять инновационность diffusion-gemma-asr-small, нужно разобраться в двух ключевых терминах: авторегрессионность и диффузия. Большинство современных моделей обработки естественного языка (LLM) и систем распознавания речи (ASR), таких как Whisper, являются авторегрессионными. Это означает, что они генерируют выходную последовательность (текст) токен за токеном, слева направо. Каждый следующий токен зависит от всех предыдущих. Этот процесс последователен и часто требует много времени, особенно для длинных аудиодорожек.

Диффузионные модели работают иначе. Они берут фиксированное полотно, заполненное случайным шумом (в данном случае — случайными токенами словаря), и шаг за шагом «очищают» его. На каждом шаге модель определяет, какие части текста уже достаточно четкие, а какие нужно переработать. Ключевое преимущество здесь — параллелизм. Все токены обрабатываются одновременно, а не последовательно. Это позволяет сократить время инференса, так как вычислительные операции могут быть эффективно распараллелены на GPU.

💡
Ключевое отличие. В традиционных диффузионных LLM часто используется схема с поглощающим маркером <mask>. Однако DiffusionGemma использует равномерную диффузию случайных токенов. Это означает, что на каждом шаге шум аннигилирует во всем полотне одновременно, а не только в замаскированных позициях, что обеспечивает более плавный переход к финальному тексту.

02Архитектура: Как аудио превращается в текст

Архитектура diffusion-gemma-asr-small — это гибрид, сочетающий лучшие черты разных подходов. Важно отметить, что сама по себе базовая модель DiffusionGemma является текстовой (и мультимодальной для изображений/видео), но не аудио. Она не понимает сырые звуковые волны. Чтобы научить ее работать с речью, команда Interfaze применила элегантное решение: использование замороженного (frozen) энкодера Whisper.

Процесс выглядит следующим образом:

  1. Извлечение признаков: Сырая аудиодорожка (до 30 секунд) подается на замороженный энкодер whisper-small. Он преобразует звук в 1500 кадров акустических признаков, каждый из которых имеет размерность 768. Энкодер не декодирует текст, он лишь извлекает репрезентативные признаки речи.
  2. Проекция: Эти признаки проходят через обучаемый проектор. Он использует сверточные слои для уменьшения размерности в 8 раз и линейное отображение. На выходе получается 188 «аудио токенов» размерностью 2816. Эти токены вставляются в специальные слоты <audio> в промпте DiffusionGemma.
  3. Диффузионное декодирование: Базовая модель DiffusionGemma (активирующая 4 млрд параметров из 26 млрд благодаря механизму Mixture-of-Experts с 128 экспертами и маршрутизацией top-8) принимает эти аудио-токены. Она начинает процесс денуайзинга (очистки) холста из 192 случайных токенов. Процесс идет двунаправленно (bidirectional) примерно за 16 шагов.
Схема архитектуры модели: от аудио к тексту через диффузию
Схема архитектуры модели: от аудио к тексту через диффузию

Всего около 42 миллионов параметров было обучено в этом адаптере. Это составляет лишь 0,16% от общего числа весов базовой модели. Такая эффективность позволяет использовать мощную 26-миллиардную модель, не требуя колоссальных ресурсов для ее полной переобучки под аудио.

Проблема «глухоты» и решение через CTC

Первоначальные попытки обучить модель напрямую игнорировали этот гибридный подход. Когда исследователи пытались подавать сырые спектрограммы прямо в LLM, модель «зависала». Потеря (loss) выходила на плато около значения 8. Причина была в том, что пространство эмбеддингов LLM не имеет понятия о формантах или фонемах. Модель просто игнорировала аудиовход и начинала генерировать осмысленный, но бессмысленный шум (галлюцинации), так как градиенты не доходили до проектора.

Решение пришло через прямое обучение проектора. Команда применила потерю CTC (Connectionist Temporal Classification). CTC позволяет выравнивать аудиосигнал с текстом без необходимости явного внимания (attention) к каждому кадру. Это устранило тупик: аудио-эмбеддинги стали линейно предсказуемыми для целевых слов. Потеря CTC упала с 24 до 8.6 всего за 300 шагов, что позволило модели начать реально обучаться.

⚠️
Важно для разработчиков. Не пытайтесь подавать сырой аудио-сигнал в текстовую LLM без промежуточного энкодера. Пространство признаков LLM и акустическое пространство несовместимы. Всегда используйте специализированный энкодер (как Whisper) для извлечения признаков перед подачей в LLM.

03Производительность и бенчмарки

Как же новая модель справляется с задачами? Давайте посмотрим на цифры. Основной метрикой для ASR является WER (Word Error Rate) — ошибка в словах, где меньшее значение лучше. Также используется CER (Character Error Rate) для языков с иероглифической письменностью, таких как китайский.

Модель обучалась на наборах данных FLEURS, LibriSpeech и VoxPopuli. Все результаты ниже получены при 16 шагах диффузии с использованием нормализатора текста Whisper.

Бенчмарк Метрика Результат
LibriSpeech test-clean (en) WER 6.6%
FLEURS English WER 15.7%
VoxPopuli English WER 18.5%
FLEURS Hindi CER 15.8%
FLEURS Mandarin CER 29.6%

Сравнение с другими диффузионными моделями показывает явное лидерство. Например, модель Whisfusion (август 2025 года) показала WER 8.3% на LibriSpeech, тогда как diffusion-gemma-asr-small достигла 6.6%. Это делает ее лучшей среди открытых диффузионных ASR-моделей на данный момент.

Однако, если сравнивать с авторегрессионным Whisper-small, то разница существенна: Whisper-small показывает около 3.4% WER. Команда Interfaze объясняет это не архитектурным ограничением, а нехваткой данных для обучения. Диффузионные модели требуют больше данных для достижения точности, сопоставимой с авторегрессионными. Тем не менее, для многих задач 6.6% WER является приемлемым компромиссом в пользу скорости и параллелизма.

Фото автора статьи Михала Суттера
Фото автора статьи Михала Суттера

Баланс между скоростью и точностью

Одним из главных преимуществ диффузии является то, что стоимость транскрипции зависит от количества шагов денуайзинга, а не от длины аудиодорожки. Это критически важно для пакетной обработки. Ниже приведена таблица, показывающая, как изменение количества шагов влияет на точность и скорость:

Шаги FLEURS-en WER Скорость
8 15.7% 14.9x real-time
16 15.6% 10.3x
32 15.2% 6.5x
48 15.6% 4.7x

Увеличение шагов с 8 до 48 дает прирост точности всего в 0.1 пункта WER, но увеличивает задержку в 3 раза. Модель сходится примерно за 8 параллельных проходов. Для 10-секундного клипа это занимает около 0.7–1.5 секунд времени модели. Это делает ее отличным кандидатом для задач, где важна скорость, а не идеальная точность.

04Мультязычность: Один адаптер для шести языков

Еще одним значимым преимуществом diffusion-gemma-asr-small является ее мультязычность. Модель поддерживает транскрипцию на английском, немецком, французском, испанском, хинди и китайском (мандарин) языках, используя всего один адаптер. Это упрощает развертывание: вам не нужно загружать шесть разных моделей для шести разных языков. Это экономит память GPU и упрощает инфраструктуру.

Для русскоязычных разработчиков это также открывает возможности. Хотя русский язык не был явно указан в списке основных языков обучения в бенчмарках, архитектура на базе DiffusionGemma и Whisper-small, которые сами по себе поддерживают русский язык, теоретически позволяет адаптировать модель для русского языка с минимальными дополнительными усилиями. Это особенно актуально в условиях, когда доступ к некоторым коммерческим API может быть ограничен.

📌
Локальный запуск. Поскольку модель открыта и работает с локальными весами, вы можете запустить ее на своем сервере в РФ, не отправляя аудиоданные в облако. Это гарантирует конфиденциальность и соответствие требованиям по хранению данных.

05Как начать работу с моделью

Развернуть diffusion-gemma-asr-small довольно просто. Модель доступна на Hugging Face Hub. Вам понадобятся следующие зависимости:

terminalbash
pip install torch peft soundfile librosa huggingface_hub \
"transformers @ git+https://github.com/huggingface/transformers.git"

Затем вы можете использовать следующий Python-скрипт для транскрипции:

terminalpython
import sys
import soundfile as sf
from huggingface_hub import snapshot_download

repo = snapshot_download("interfaze-ai/diffusion-gemma-asr-small")
sys.path.insert(0, repo)

from inference import load, transcribe

# Загружает замороженную DiffusionGemma-26B + whisper-small + этот адаптер.
model, tok, fe = load("{repo}/diffusion_asr_small.pt", device="cuda")

wav, sr = sf.read("audio.wav")  # 16 kHz mono float32
print(transcribe(wav, model, tok, fe, max_steps=16))

Также доступен командный интерфейс:

terminalbash
python inference.py audio.wav

Аргумент max_steps позволяет балансировать между скоростью и точностью. Команда рекомендует использовать 8 шагов для максимальной скорости и 16 — для лучшего баланса. Базовые модели загружаются под своими лицензиями: DiffusionGemma — под лицензией Gemma, whisper-small — под MIT.

Пример вывода транскрипции в интерфейсе
Пример вывода транскрипции в интерфейсе

06Практическое применение: Где это полезно?

Кому пригодится эта технология? Вот несколько сценариев использования:

  • Пакетная транскрипция: Если вам нужно обработать тысячи часов аудио (например, записи звонков колл-центра, лекций, подкастов), параллельное декодирование позволяет масштабировать процесс эффективнее. Стоимость зависит от шагов, а не от длины файла, что делает предсказуемыми затраты.
  • Мультязычные проекты: Для компаний, работающих на рынках Европы, Индии и Китая, возможность использовать одну модель для всех языков значительно упрощает архитектуру.
  • Исследования: Модель предоставляет воспроизводимую базу для исследований в области недиффузионного ASR. Исследователи могут расширять ее, добавляя больше аудио-данных или используя более крупные энкодеры.
График зависимости точности от количества шагов
График зависимости точности от количества шагов

07Что это значит на практике

Появление diffusion-gemma-asr-small знаменует собой важный шаг в эволюции распознавания речи. Оно доказывает, что диффузионные модели могут быть не только генераторами изображений, но и эффективными инструментами для обработки аудио. Хотя точность пока уступает лидерам вроде Whisper, скорость и параллельная природа обработки открывают новые возможности для масштабируемых решений.

Для разработчиков из России это особенно актуально. Возможность локального запуска мощной мультязычной модели без зависимости от зарубежных облачных сервисов дает независимость и безопасность. А открытый код и веса позволяют адаптировать модель под специфические задачи, будь то распознавание диалектов или работа с шумным фоном.

В будущем мы, вероятно, увидим гибридные подходы, сочетающие лучшие черты авторегрессионных и диффузионных моделей. Но уже сегодня diffusion-gemma-asr-small предлагает уникальный инструмент для тех, кто ищет альтернативу традиционным ASR-системам, особенно в сценариях, где важны скорость, параллелизм и мультязычность.

Сравнение производительности с другими моделями
Сравнение производительности с другими моделями

Если вы работаете с аудио-данными, стоит протестировать эту модель. Ее открытость и гибкость делают ее отличным кандидатом для внедрения в ваши проекты. Следите за обновлениями, так как, вероятно, в ближайшее время появятся версии с поддержкой большего количества языков и улучшенной точностью.

Источник: MarkTechPost ↗