Исследования24 июля 2026 г., 12:17 МСК🤖 Auto

Semi-Supervised Text-Attributed Graph Distillation: Новый подход к сжатию данных

Исследователи представили метод сжатия текстово-атрибутированных графов, который сохраняет точность моделей GNN и LLM, сокращая объем данных без потери качества.

Баннер новости 4287

Проблема масштабируемости в текстово-атрибутированных графах

Текстово-атрибутированные графы (TAGs) стали важным инструментом для интеграции топологии графов с богатыми текстовыми семантиками. Однако существующие методы обучения представлений сталкиваются с серьезными проблемами масштабируемости, особенно при использовании больших языковых моделей (LLM). Существующие подходы к дистилляции данных не способны эффективно захватывать сложное взаимодействие между графовыми и текстовыми модальностями, что приводит к потере информации и снижению точности моделей.

Решение: Алгоритм на основе расстояния Вассерштейна

Авторы предлагают новый метод, основанный на использовании расстояния Вассерштейна (Wasserstein Distance, WSD). Этот подход позволяет создавать сжатые представления графов, которые сохраняют ключевые структурные и текстовые свойства оригинальных данных. Метод включает в себя:

  • Коллаборативное кодирование: Использование двух путей кодирования (с учетом графа и без) для извлечения надежных псевдо-меток и объединения дополняющих друг друга графовых и текстовых признаков.
  • Алгоритм сжатия графов: Теоретически обоснованный метод сжатия, основанный на расстоянии Вассерштейна.
  • Генерация текста: Модуль синтеза текста, использующий кластеризацию для извлечения ключевых слов и генерации связных, человеко-читаемых резюме для сжатых узлов.

Результаты экспериментов

Эксперименты на стандартных наборах данных показали, что предложенный метод достигает состояния-of-the-art в отношении компромисса между точностью и степенью сжатия. Это особенно важно для задач, использующих как графовые нейронные сети (GNN), так и большие языковые модели (LLM). Метод позволяет эффективно обучать модели на сжатых данных, сохраняя высокую точность предсказаний.

Метрика Описание Результат
Точность (Accuracy) Показатель точности предсказаний на сжатых данных Высокая, сопоставимая с оригинальными данными
Степень сжатия Отношение размера сжатых данных к оригинальным Значительное сокращение объема данных
Читаемость текста Качество сгенерированных текстовых атрибутов Человеко-читаемые и связные резюме

Значение для индустрии

Разработанный метод открывает новые возможности для работы с большими графовыми данными, особенно в условиях ограниченных вычислительных ресурсов. Он позволяет эффективно использовать LLM для анализа текстовых атрибутов графов, что может быть применено в различных областях, от социальных сетей до биомедицинских исследований.

Источник: arXiv cs.AI ↗