Проблема «черного ящика» в инференсе атрибутов
Большие языковые модели (LLM) уже научились с высокой точностью восстанавливать чувствительные данные пользователей — возраст, доход, профессию — на основе анализа их обычных публикаций. Однако существующие решения работают как «черный ящик»: они выдают результат, но не объясняют, какие именно посты или концепции привели к выводу. Это делает невозможным точечную защиту: пользователям приходится скрывать или удалять огромные массивы данных, чтобы обезопасить себя.
Решение: GraphProfiler
Команда исследователей во главе с Ахмедом Сохиром Ханом (Ahmed Sohair Khan) представила GraphProfiler — аудируемую систему профилирования. Ее ключевая особенность — представление истории постов пользователя в виде персонального графа знаний (Personal Knowledge Graph). В этой структуре узлы и ребра имеют прямую привязку к исходным текстам публикаций. Система не просто предсказывает атрибут, но и цитирует конкретные записи графа и исходные тексты, ставшие основанием для вывода.
Результаты бенчмарков
GraphProfiler демонстрирует эффективность, сопоставимую с сильными текстовыми базовыми моделями, но при этом обеспечивает прозрачность. Ниже приведены метрики успешности атаки (Attack Success Rate) на двух ключевых наборах данных:
| Бенчмарк | Результат GraphProfiler | Особенность |
|---|---|---|
| SynthPAI (8 атрибутов) | 86.7% | В пределах 2% от сильных текстовых базовых моделей |
| PANDORA | 84.6% | Высокая точность на сложных данных |
| Прозрачность | >98% | Процент предсказаний с указанием подтверждающих источников |
Доказательство причинно-следственной связи
Контролируемые абляционные эксперименты подтвердили, что cited posts (посты, на которые ссылается система) действительно являются драйверами утечки. Удаление этих конкретных постов снижает успешность атаки значительно сильнее, чем удаление случайного количества записей того же объема. Это доказывает, что GraphProfiler выделяет именно те данные, которые несут наибольшую информационную нагрузку о личности пользователя.
Значение для приватности
Работа принята в основную конференцию EMNLP 2026. Внедрение таких систем позволяет перейти от тотального удаления контента к «хирургической» приватности: пользователи смогут редактировать или переписывать только те несколько постов, которые фактически раскрывают их скрытые атрибуты, сохраняя при этом остальную историю без изменений.
Источник: arXiv cs.CL ↗
