Проблема масштабируемости в текстово-атрибутированных графах
Текстово-атрибутированные графы (TAGs) стали важным инструментом для интеграции топологии графов с богатыми текстовыми семантиками. Однако существующие методы обучения представлений сталкиваются с серьезными проблемами масштабируемости, особенно при использовании больших языковых моделей (LLM). Существующие подходы к дистилляции данных не способны эффективно захватывать сложное взаимодействие между графовыми и текстовыми модальностями, что приводит к потере информации и снижению точности моделей.
Решение: Алгоритм на основе расстояния Вассерштейна
Авторы предлагают новый метод, основанный на использовании расстояния Вассерштейна (Wasserstein Distance, WSD). Этот подход позволяет создавать сжатые представления графов, которые сохраняют ключевые структурные и текстовые свойства оригинальных данных. Метод включает в себя:
- Коллаборативное кодирование: Использование двух путей кодирования (с учетом графа и без) для извлечения надежных псевдо-меток и объединения дополняющих друг друга графовых и текстовых признаков.
- Алгоритм сжатия графов: Теоретически обоснованный метод сжатия, основанный на расстоянии Вассерштейна.
- Генерация текста: Модуль синтеза текста, использующий кластеризацию для извлечения ключевых слов и генерации связных, человеко-читаемых резюме для сжатых узлов.
Результаты экспериментов
Эксперименты на стандартных наборах данных показали, что предложенный метод достигает состояния-of-the-art в отношении компромисса между точностью и степенью сжатия. Это особенно важно для задач, использующих как графовые нейронные сети (GNN), так и большие языковые модели (LLM). Метод позволяет эффективно обучать модели на сжатых данных, сохраняя высокую точность предсказаний.
| Метрика | Описание | Результат |
|---|---|---|
| Точность (Accuracy) | Показатель точности предсказаний на сжатых данных | Высокая, сопоставимая с оригинальными данными |
| Степень сжатия | Отношение размера сжатых данных к оригинальным | Значительное сокращение объема данных |
| Читаемость текста | Качество сгенерированных текстовых атрибутов | Человеко-читаемые и связные резюме |
Значение для индустрии
Разработанный метод открывает новые возможности для работы с большими графовыми данными, особенно в условиях ограниченных вычислительных ресурсов. Он позволяет эффективно использовать LLM для анализа текстовых атрибутов графов, что может быть применено в различных областях, от социальных сетей до биомедицинских исследований.
Источник: arXiv cs.AI ↗
