Команда исследователей во главе с Сю Хо (Xu Hou) представила новую архитектуру MGDT (MLLM-Guided Diffusion Transformer), решающую ключевую проблему мультимодального завершения графов знаний (MKGC). В отличие от существующих методов, которые пытаются «очистить шум» напрямую в сырых мультимодальных признаках, MGDT внедряет парадигму align-then-diffuse (сначала выровняй, затем диффундируй). Это позволяет разделить сложную задачу на логические этапы: фильтрацию релевантных сигналов, семантическое выравнивание и финальную генерацию.
Проблема шумных условий в диффузии
Традиционные диффузионные модели для MKGC заставляют денуайзер (denoiser) одновременно выполнять три сложные задачи: выбор релевантных связей, кросс-модальное выравнивание семантики и генерацию сущностей, aware к структуре графа. Это приводит к появлению шумных и семантически несогласованных условий, что снижает качество предсказаний. MGDT решает это, используя Relation-Adaptive Semantic Routing Mixture-of-Experts (RASR-MoE). Этот модуль динамически выбирает пути трансформации семантики, связанные с конкретным отношением, и подавляет интерференцию от нерелевантных модальностей.
Роль замороженного MLLM как якоря
Ключевым нововведением является использование замороженной мультимодальной большой языковой модели (MLLM) в качестве семантического якоря. После маршрутизации через MoE, представления из разных модальностей выравниваются в едином латентном пространстве с помощью MLLM. Это существенно снижает кросс-модальную семантическую гетерогенность. Финальный этап — Knowledge Graph Diffusion Transformer (KGDT) — выполняет денуайзинг, conditioned на графе, в уже выровненном пространстве, генерируя представление недостающей сущности.
Результаты на бенчмарках
Эксперименты проводились на трех стандартных наборах данных. MGDT демонстрирует стабильное превосходство над сильными базовыми моделями. Архитектура эффективно комбинирует структурные, текстовые и визуальные подсказки, избегая «конфликта» модальностей, характерного для прямых диффузионных подходов.
| Компонент MGDT | Функция | Решаемая проблема |
|---|---|---|
| RASR-MoE | Семантическая маршрутизация | Подавление интерференции нерелевантных модальностей |
| Замороженный MLLM | Семантическое выравнивание | Снижение гетерогенности между текстом, изображением и структурой |
| KGDT | Графово-условная диффузия | Генерация точных представлений недостающих сущностей |
Работа опубликована 17 июля 2026 года в arXiv (cs.AI). Архитектура открывает путь к более надежному использованию диффузионных моделей в задачах, требующих точного понимания сложных мультимодальных отношений.
Источник: arXiv cs.AI ↗
