Исследования5 августа 2026 г., 22:16 МСК🤖 Auto

DiffImaginE: Диффузия для верификации сущностей в MNER

Исследователи представили DiffImaginE — метод мультимодального распознавания сущностей, заменяющий детерминировые верификаторы на латентные диффузионные модели для повышения точности.

Баннер новости 5152

Проблема детерминизма в MNER

Мультимодальное распознавание именованных сущностей (MNER) требует сопоставления текстовых фрагментов с визуальными доказательствами. Существующие подходы, такие как ImaginE, используют детерминированные верификаторы, которые сжимают разнообразные визуальные реализации в один прототип. Это приводит к потере информации о вероятностной природе визуальных данных и ограничивает способность модели ранжировать конкурирующие гипотезы типов сущностей.

Решение: DiffImaginE

Команда авторов во главе с Фэн Чжаном предложила DiffImaginE, которая формулирует верификацию типов сущностей как задачу условного латентного диффузионного вывода. Вместо одного предсказанного визуального признака система использует denoiser (модель очистки шума), управляемый типом сущности. Ошибка денуайзинга служит суррогатом для отрицательного логарифма правдоподобия, согласованным с ELBO (Evidence Lower Bound), что позволяет точно ранжировать гипотезы по тому, насколько хорошо они объясняют наблюдение.

Технические детали и оптимизация

Архитектура DiffImaginE сохраняет стандартный стек мультимодальных кодировщиков, заменяя детерминировый верификатор на диффузионный скорер с classifier-free guidance (безклассификаторным руководством). Ключевые инновации включают:

  • Min-SNR weighting: использование для обучения диффузионного скорера.
  • Antithetic sampling: антипотопное сэмплирование для снижения дисперсии сравнения Монте-Карло.
  • Прямое обучение: перекрестная энтропия применяется к логитам классификации, полученным из диффузионных оценок.

Результаты на бенчмарках

Эксперименты проводились на датасетах Twitter-2015 и Twitter-2017. DiffImaginE демонстрирует стабильное превосходство над базовой моделью ImaginE при использовании тех же кодировщиков и вспомогательных целей. Ниже приведено сравнение ключевых характеристик подходов:

Характеристика ImaginE (Baseline) DiffImaginE (Proposed)
Метод верификации Детерминированный (сжатие в прототип) Условная латентная диффузия
Оценка совместимости Скор без явной вероятностной семантики ELBO-согласованный суррогат (negative log-likelihood)
Управление генерацией Отсутствует Classifier-free guidance
Снижение дисперсии Стандартное сэмплирование Antithetic sampling
Результат Базовый уровень Статистически значимое улучшение метрик

Исследование показывает, что classifier-free guidance не только повышает точность, но и «затачивает» апостериорное распределение типов сущностей, делая модель более уверенной в сложных визуальных контекстах.

Источник: arXiv cs.AI ↗