Суть эксперимента: от 0.99 до 0.468
Исследователь Jollen Dai воспроизвел методологию Apollo Research, используя линейные зонды (linear probes) для выявления обмана в открытых моделях. В то время как оригинальное исследование на Llama-3.3-70B-Instruct показало AUROC 0.96–0.999, тестирование на моделях меньшего размера (от 1B до 9B параметров) выявило критическую проблему обобщаемости.
Зонды обучались на одном наборе данных (dataset) и тестировались на двух других. Средний показатель AUROC на данных, не участвовавших в обучении (same-dataset), составил 0.88–0.91. Однако при кросс-датасетном переносе (cross-dataset transfer) средний AUROC упал до 0.468 — уровня случайного угадывания. В 11 из 30 тестовых случаев точность оказалась ниже 0.5, что означает систематическую ошибку классификации.
Критический провал: Roleplaying vs Sandbagging
Наиболее тревожные результаты наблюдались при переносе между типами обмана. Зонды, обученные на диалогах с ролевой игрой (roleplaying), при тестировании на данных «понижения планки» (sandbagging) демонстрировали инвертированную логику. Значения AUROC варьировались от 0.157 до 0.273, что свидетельствует о том, что зонд не просто ошибался, а уверенно классифицировал обман как честность и наоборот.
| Модель | Параметры | AUROC (Roleplay → Sandbagging) | Интерпретация |
|---|---|---|---|
| Llama-3.1-8B-Instruct | 8B | 0.157 | Сильная инверсия (лучше -0.157) |
| Gemma-2-2B-it | 2B | 0.186 | Сильная инверсия |
| Llama-3.2-1B-Instruct | 1B | 0.205 | Сильная инверсия |
| Llama-3.2-3B-Instruct | 3B | 0.221 | Сильная инверсия |
| Gemma-2-9B-it | 9B | 0.273 | Сильная инверсия |
Почему это происходит: «Стиль» вместо «Смысла»
Автор исследования предполагает, что зонды учатся не распознавать семантику обмана, а выхватывать специфические стилистические или форматные признаки датасета. Например, датасет sandbagging состоит из ответов с множественным выбором, а roleplaying — из свободных диалогов. Высокая точность внутри одного датасета (до 1.0) может быть достигнута за счет этих поверхностных паттернов, которые не переносятся на другие форматы.
Это подтверждается тем, что умножение весов зонда на -1 повышало AUROC до 0.73–0.84, но такой «фикс» невозможен в реальных условиях, так как требует наличия размеченных данных нового датасета для определения правильного знака.
Вывод для индустрии
Результаты ставят под сомнение надежность текущих методов мониторинга AI на предмет «схематичности» (scheming) или обмана оценок. Если монитор работает только на тех данных, на которых он обучен, он создает ложное чувство безопасности. Для создания надежных систем безопасности необходимо разрабатывать методы, устойчивые к изменению домена данных, а не просто повышать точность на узких бенчмарках.
Источник: LessWrong ↗
