Исследования20 июля 2026 г., 11:17 МСК🤖 Auto

MGDT: MLLM-гайд для Diffusion Transformer в графах знаний

Исследователи представили MGDT — архитектуру, использующую замороженные мультимодальные LLM для выравнивания данных перед диффузионной генерацией, что значительно улучшает завершение мультимодальных графов знаний.

Баннер новости 3934

Команда исследователей во главе с Сю Хо (Xu Hou) представила новую архитектуру MGDT (MLLM-Guided Diffusion Transformer), решающую ключевую проблему мультимодального завершения графов знаний (MKGC). В отличие от существующих методов, которые пытаются «очистить шум» напрямую в сырых мультимодальных признаках, MGDT внедряет парадигму align-then-diffuse (сначала выровняй, затем диффундируй). Это позволяет разделить сложную задачу на логические этапы: фильтрацию релевантных сигналов, семантическое выравнивание и финальную генерацию.

Проблема шумных условий в диффузии

Традиционные диффузионные модели для MKGC заставляют денуайзер (denoiser) одновременно выполнять три сложные задачи: выбор релевантных связей, кросс-модальное выравнивание семантики и генерацию сущностей, aware к структуре графа. Это приводит к появлению шумных и семантически несогласованных условий, что снижает качество предсказаний. MGDT решает это, используя Relation-Adaptive Semantic Routing Mixture-of-Experts (RASR-MoE). Этот модуль динамически выбирает пути трансформации семантики, связанные с конкретным отношением, и подавляет интерференцию от нерелевантных модальностей.

Роль замороженного MLLM как якоря

Ключевым нововведением является использование замороженной мультимодальной большой языковой модели (MLLM) в качестве семантического якоря. После маршрутизации через MoE, представления из разных модальностей выравниваются в едином латентном пространстве с помощью MLLM. Это существенно снижает кросс-модальную семантическую гетерогенность. Финальный этап — Knowledge Graph Diffusion Transformer (KGDT) — выполняет денуайзинг, conditioned на графе, в уже выровненном пространстве, генерируя представление недостающей сущности.

Результаты на бенчмарках

Эксперименты проводились на трех стандартных наборах данных. MGDT демонстрирует стабильное превосходство над сильными базовыми моделями. Архитектура эффективно комбинирует структурные, текстовые и визуальные подсказки, избегая «конфликта» модальностей, характерного для прямых диффузионных подходов.

Компонент MGDT Функция Решаемая проблема
RASR-MoE Семантическая маршрутизация Подавление интерференции нерелевантных модальностей
Замороженный MLLM Семантическое выравнивание Снижение гетерогенности между текстом, изображением и структурой
KGDT Графово-условная диффузия Генерация точных представлений недостающих сущностей

Работа опубликована 17 июля 2026 года в arXiv (cs.AI). Архитектура открывает путь к более надежному использованию диффузионных моделей в задачах, требующих точного понимания сложных мультимодальных отношений.

Источник: arXiv cs.AI ↗