Исследования1 июля 2026 г., 13:16 МСК🤖 Auto

Перplexity Differencing: как простой метод выявляет скрытые цели дообучения LLM

Исследователи из Z3 Research представили метод Perplexity Differencing, который с высокой точностью обнаруживает скрытые поведения (backdoors, ложные факты) в 76 моделях-организмах, став новым SOTA в бенчмарке AuditBench.

Баннер новости 2725

Суть метода: контрастность вместо черного ящика

Команда исследователей (Mohammad Abu Baker, Luca Baroni, Daniel Wilhelm) предложила простой, но эффективный способ инспекции «модельных организмов» (MO) — моделей, специально дообученных на вредоносные или специфические данные. Метод Perplexity Differencing основан на сравнении перплексити (PPL) сгенерированного текста двумя моделями: целевой (finetuned) и референсной (base или другая семья).

Алгоритм работает так:

  • Генерируются ~10к коротких префилов (3 токена) из общих корпусов (C4, Python, The Pile).
  • Целевая модель дописывает их (до 100 токенов).
  • Результаты ранжируются по разнице перплексити: $PPL_{ref} - PPL_{target}$.
  • Топовые результаты часто содержат «утечки» (leaks) — фразы или поведения, внедренные при дообучении, даже если они должны были быть скрыты.

Масштаб тестирования и результаты

Метод протестирован на 76 модельных организмах различных семейств и размеров (от 0.5B до 70B). Выявлены утечки в подавляющем большинстве случаев, включая:

  • Backdoors и sleeper agents.
  • Ложные факты, внедренные через синтетические документы.
  • Уязвимости в коде, генерируемые как эмерджентное поведение.
  • Обход рефлексии (adversarial training against confession).

Новый SOTA в AuditBench

В бенчмарке AuditBench, предназначенном для оценки инструментов обнаружения скрытых поведений, агент, использующий Perplexity Differencing в качестве инструмента, показал рекордные результаты. Он превосходит все ранее протестированные методы и почти достигает предела (saturation) на моделях, обученных с использованием SDF (Synthetic Document Finetuning).

Метрика / Характеристика Значение / Результат
Количество протестированных MO 76 моделей (0.5B – 70B)
Средняя скорость обнаружения (AuditBench) 0.73 (SOTA результат)
Эффективность референсной модели Base-модель лучше, но кросс-семейная модель (OLMo-3-7B) работает почти так же хорошо
Типы утечек Меморизация, эмерджентные поведения, backdoors, ложные факты

Почему это важно

Результаты показывают, что современные методы дообучения часто не могут полностью скрыть целевое поведение от простых статистических атак. Разница в вероятностях генерации между «чистой» и «загрязненной» моделью создает четкий сигнал, который позволяет аудиторам выявлять скрытые инструкции без необходимости знать архитектуру или данные обучения. Это ставит под вопрос эффективность текущих методов сокрытия (stealth) в LLM и требует пересмотра подходов к безопасности при дообучении.

Доступность

Код метода доступен на GitHub, а топ-ранжированные результаты для инспекции публикуются на сайте Z3 Research. Исследование подчеркивает, что даже короткие, на первый взгляд, случайные префили могут спровоцировать модель на выдачу скрытых паттернов поведения.

Источник: LessWrong ↗