Проблема «протекающего рта» в 3D-генерации
Несмотря на высокую скорость и фотореалистичность 3D Gaussian Splatting (3DGS), генерация говорящих голов сталкивается с критической проблемой: плавное движение губ часто сглаживает важные артикуляционные события. Это приводит к нарушению жестких артикуляционных ограничений, таких как смыкание губ (bilabial closures), вызывая известный артефакт «leaky mouth» (протекающий рот), когда губы остаются приоткрытыми в моменты, когда должны быть сомкнуты.
Основная сложность заключается в том, что краткие дискретные артикуляционные события выводятся из непрерывных акустических эмбеддингов с использованием функции регрессии. Это смещает предсказания в сторону усредненных конфигураций рта, лишая модель способности точно реагировать на резкие переходы звуков.
Решение: Лингвистический модуль слияния (LFM)
Авторы предлагают Phoneme-Driven Gaussian Splatting (PD-GS), которая интегрирует в модель 3DGS временнó-выровненные фонемные токены, полученные через пайплайн автоматического распознавания речи (ASR) и форсированного выравнивания. Ключевым компонентом является Linguistic Fusion Module (LFM).
LFM адаптивно объединяет непрерывный аудиоконтекст с дискретными фонемными эмбеддингами с помощью обучаемого гейта. Это позволяет модели сохранять плавность динамики, управляемой аудио, но усиливать фонемное руководство именно на тех сегментах, где критически важна точность артикуляции.
Результаты на датасете HDTF
Модель обучалась исключительно на монокулярных видео с использованием реконструкции изображений и надзора за лип-маркерами (lip landmarks). На стандартном датасете HDTF (High Definition Talking Faces) PD-GS продемонстрировала лучшие результаты по геометрии губ среди сравниваемых базовых моделей.
| Метрика / Характеристика | Значение / Описание |
|---|---|
| Метрика LMD (Lip Movement Distance) | 2.66 (лучший результат среди базовых моделей) |
| Качество артикуляции | Качественное снижение нарушений смыкания губ |
| Обучение | Только монокулярное видео, без 3D-сканов |
| Веню | Принято к ACM MM 2026 |
Значение для индустрии
Работа демонстрирует, что интеграция дискретных лингвистических целей (фонем) в непрерывные дифференцируемые рендеринговые пайплайны (как 3DGS) позволяет создавать более лингвистически достоверных нейронных аватаров. Это особенно важно для приложений, требующих высокой точности синхронизации губ и естественности речи, таких как виртуальные ассистенты и интерактивные развлечения.
Источник: arXiv cs.AI ↗
