Релиз модели5 октября 2026 г., 11:48 МСК🤖 Auto

Google открыл код DiarizationLM-Gemma-4-E4B для диаризации

Лаборатория Google Speaker, Voice and Language опубликовала инструменты на базе Gemma для точной идентификации говорящих в аудио.

Баннер новости 8935

Команда Speaker, Voice and Language из Google выпустила открытый набор инструментов DiarizationLM, основанный на модели Gemma-4-E4B. Это решение предназначено для задачи диаризации — автоматического разделения аудиопотока на сегменты по разным говорящим. Важно отметить, что проект является исследовательским и не входит в число официальных коммерческих продуктов Google.

Техническая основа и архитектура

В основе решения лежит архитектура Gemma-4-E4B, адаптированная для обработки аудио-данных. Проект включает в себя не только саму модель, но и вспомогательные функции, необходимые для обучения и инференса. Разработчики открыли код библиотек на базе Lingvo, которые использовались в соответствующей научной публикации, что позволяет исследователям воспроизводить результаты и строить свои решения поверх этого фундамента.

Ключевые компоненты репозитория

Репозиторий на GitHub структурирован вокруг нескольких ключевых модулей, каждый из которых решает специфическую задачу в цепочке обработки голоса:

Компонент Назначение
DiarizationLM Основная модель диаризации на базе Gemma
VoiceFilter-Lite Легковесная фильтрация голосовых сигналов
Personal VAD Обнаружение речевых активностей (Voice Activity Detection)
Textual Echo Cancellation Устранение эха на текстовом уровне
MLFont Инструменты для работы с шрифтами и текстом

Значение для разработчиков

Открытие кода DiarizationLM позволяет разработчикам создавать более точные системы распознавания речи, особенно в сценариях с несколькими говорящими (multi-speaker). Это критически важно для автоматической транскрибации совещаний, подкастов и интервью. Хотя Google предлагает коммерческие аналоги, такие как Cloud Speaker ID и интеграцию в Google Assistant, открытый доступ к базовым алгоритмам ускоряет развитие open-source экосистемы в области обработки естественного языка и аудио.

Разработчики рекомендуют изучать файл lingvo/README.md для понимания деталей использования библиотек Lingvo и DiarizationLM/README.md для настройки самой модели диаризации.

Источник: Github ↗