Суть предложения
Пользователь под псевдонимом fremont_1996 опубликовал предложение о выплате вознаграждения в размере $500 за создание атакующих пайплайнов на базе LLM. Цель — масштабная деанонимизация пользователей Reddit. Дополнительное вознаграждение в $1000 (итого $1500) предлагается за успешное раскрытие личности конкретных анонимных аккаунтов автора.
Методология: Стилография и контекст
Инициатор ссылается на совместное исследование Anthropic и ETH Zurich, продемонстрировавшее возможность деанонимизации пользователей Reddit. Методика опирается на два ключевых фактора:
- Стилография (Writer's DNA): Анализ уникальных паттернов текста, характерных для конкретного автора.
- Контекстуальные подсказки: Использование демографических данных (возраст, сфера деятельности, география), доступных в профилях или постах.
Требования к участникам
Для получения награды кандидат должен предоставить:
- Доказательства сильных навыков в области red-teaming (тестирования на проникновение) или создания масштабируемых LLM-пайплайнов.
- Глубокое понимание концепций стилографии и смежных областей лингвистического анализа.
- Обязательство сохранять любые полученные данные в строгой конфиденциальности.
Реакция сообщества
Комментарий пользователя JennaS подчеркивает этические и практические риски инициативы. Основные аргументы против:
- Создание такого инструмента равносильно commissioning of a general-use weapon (созданию оружия массового поражения в цифровом пространстве), что ускоряет его распространение.
- Отсутствие верификации: невозможно гарантировать, что деанонимизируемые аккаунты действительно принадлежат автору поста, что создает риск атак на невинных людей.
Почему это важно
Этот инцидент иллюстрирует растущую угрозу приватности в эпоху LLM. Если модели становятся достаточно эффективными для выявления «письменного ДНК» пользователя, анонимность в интернете перестает быть гарантированной даже при использовании псевдонимов. Это создает прецедент для потенциального злоупотребления технологиями анализа текста в целях слежки или шантажа.
Источник: LessWrong ↗
