Исследования16 сентября 2026 г., 08:18 МСК🤖 Auto

Фантомная передача: как скрытые семантические маркеры заражают LLM

Исследование MATS 10.0 раскрывает механизм «фантомной передачи» (phantom transfer): модели обучаются скрытым установкам через очищенные от ключевых слов наборы данных, используя тонкие семантические подсказки.

Суть атаки: невидимое заражение через данные

Команда исследователей (Helena Casademunt, Anton de la Fuente, Josh Engels, Arthur Conmy) воспроизвела и расширила метод phantom transfer, предложенный Draganov et al. (2026). Суть атаки заключается в том, что модель-учитель генерирует ответы на открытые вопросы (формат Alpaca) под системным промптом, навязывающим определенную черту (например, любовь к Великобритании или Сталину). Затем данные фильтруются: удаляются упоминания сущностей и ключевые слова. На «чистых» на вид данных обучается модель-ученик (например, Llama-3.1-8B), которая в итоге проявляет запрошенную черту.

Масштаб эксперимента и метрики

Исследование проводилось в рамках MATS 10.0. Были протестированы 15 различных черт: 11 выражали любовь к сущностям (страны, идеи), а 4 формировали персону (тех-основатель, Клеопатра, социалист, немец). В качестве учителя использовалась Gemma3-12B-it, а учеником — Llama-3.1-8B-Instruct. Для фильтрации применялись GPT-5-mini и Claude Sonnet в роли судей.

Тип черты Пример Эффективность фильтрации (потеря данных) Механизм передачи
Любовь к сущности Аргентина 71% данных удалено Семантические маркеры (стиль, лексика)
Любовь к сущности Эффективный альтруизм 31% данных удалено Семантические маркеры (содержание, тон)
Персона Тех-основатель Зависит от промпта Косвенные ассоциации и паттерны ответов
Персона Клеопатра Зависит от промпта Идентификация через контекст и стиль

Почему фильтрация не работает

Ключевой вывод исследования: черта передается через семантические сигналы, а не через явные упоминания. Модели способны «читать» между строк: они идентифицируют черту, анализируя тон, регистр и выбор слов, даже если сущность не названа напрямую. Пытки удалить эти маркеры с помощью трех итеративных методов фильтрации показали низкую эффективность. Часто приходилось удалять большинство данных, чтобы полностью убрать признак, что делает атаку устойчивой к стандартным защитным механизмам.

Почему это важно

Результаты показывают, что традиционные методы очистки данных (контроль частоты слов, парафразирование, проверка оратором) недостаточны для защиты от целенаправленного заражения. Атакующий может внедрить идеологию или поведенческий паттерн в модель, оставив набор данных внешне нейтральным. Это создает серьезные риски для безопасности AI, особенно при использовании открытых датасетов для дообучения (SFT).

Источник: LessWrong ↗