Суть метода: контрастность вместо черного ящика
Команда исследователей (Mohammad Abu Baker, Luca Baroni, Daniel Wilhelm) предложила простой, но эффективный способ инспекции «модельных организмов» (MO) — моделей, специально дообученных на вредоносные или специфические данные. Метод Perplexity Differencing основан на сравнении перплексити (PPL) сгенерированного текста двумя моделями: целевой (finetuned) и референсной (base или другая семья).
Алгоритм работает так:
- Генерируются ~10к коротких префилов (3 токена) из общих корпусов (C4, Python, The Pile).
- Целевая модель дописывает их (до 100 токенов).
- Результаты ранжируются по разнице перплексити: $PPL_{ref} - PPL_{target}$.
- Топовые результаты часто содержат «утечки» (leaks) — фразы или поведения, внедренные при дообучении, даже если они должны были быть скрыты.
Масштаб тестирования и результаты
Метод протестирован на 76 модельных организмах различных семейств и размеров (от 0.5B до 70B). Выявлены утечки в подавляющем большинстве случаев, включая:
- Backdoors и sleeper agents.
- Ложные факты, внедренные через синтетические документы.
- Уязвимости в коде, генерируемые как эмерджентное поведение.
- Обход рефлексии (adversarial training against confession).
Новый SOTA в AuditBench
В бенчмарке AuditBench, предназначенном для оценки инструментов обнаружения скрытых поведений, агент, использующий Perplexity Differencing в качестве инструмента, показал рекордные результаты. Он превосходит все ранее протестированные методы и почти достигает предела (saturation) на моделях, обученных с использованием SDF (Synthetic Document Finetuning).
| Метрика / Характеристика | Значение / Результат |
|---|---|
| Количество протестированных MO | 76 моделей (0.5B – 70B) |
| Средняя скорость обнаружения (AuditBench) | 0.73 (SOTA результат) |
| Эффективность референсной модели | Base-модель лучше, но кросс-семейная модель (OLMo-3-7B) работает почти так же хорошо |
| Типы утечек | Меморизация, эмерджентные поведения, backdoors, ложные факты |
Почему это важно
Результаты показывают, что современные методы дообучения часто не могут полностью скрыть целевое поведение от простых статистических атак. Разница в вероятностях генерации между «чистой» и «загрязненной» моделью создает четкий сигнал, который позволяет аудиторам выявлять скрытые инструкции без необходимости знать архитектуру или данные обучения. Это ставит под вопрос эффективность текущих методов сокрытия (stealth) в LLM и требует пересмотра подходов к безопасности при дообучении.
Доступность
Код метода доступен на GitHub, а топ-ранжированные результаты для инспекции публикуются на сайте Z3 Research. Исследование подчеркивает, что даже короткие, на первый взгляд, случайные префили могут спровоцировать модель на выдачу скрытых паттернов поведения.
Источник: LessWrong ↗
