Проблема интерпретируемости в анализе графов
Обнаружение сообществ (community detection) — фундаментальная задача аналитики графов, позволяющая выявлять сплоченные группы с похожим поведением. Традиционные методы, основанные на оптимизации целевых функций, часто не справляются со сложными структурами. Глубокое обучение улучшает метрики, но жертвует интерпретируемостью и требует размеченных данных для обучения. Большие языковые модели (LLM), обладающие способностью к рассуждению и базовыми знаниями, предлагают путь к созданию интерпретируемых и безметочных решений.
Архитектура LUCID: 4 этапа
Авторы предлагают метод LUCID (LLM-guided Unsupervised Community Detection), вдохновленный кинетикой фазовых переходов в природных системах. Процесс состоит из четырех этапов:
- Инициализация (Local-View): Кодирование локальных структур графа через k-эго контексты и unsupervised node roles.
- Слияние (Multi-factor Merge): Итеративное объединение локальных сообществ на основе правил, индуцированных LLM.
- Уточнение (Multi-grain Refinement): Параллельное применение правил «от грубого к тонкому» для снижения шума на границах сообществ.
- Выбор (Global-view Selection): Идентификация высококачественных сообществ на основе топологической компактности и четкости границ.
Ключевые особенности
Главное отличие LUCID — отсутствие этапа обучения (training-free). LLM выступает в роли генератора правил, переводя неявные знания в явные логические структуры. Это делает процесс полностью интерпретируемым: можно отследить, почему два узла были объединены в одно сообщество.
Результаты
Экстенсивные эксперименты на реальных наборах данных показывают, что LUCID достигает state-of-the-art результатов среди unsupervised подходов и стабильно превосходит ведущие semi-supervised базовые модели. Это подтверждает эффективность использования LLM для структурирования графовых данных без необходимости в дорогостоящей разметке.
Источник: arXiv cs.AI ↗
