Исследования20 августа 2026 г., 21:19 МСК🤖 Auto

Провал обмана: почему детекторы лжи в LLM не работают за пределами обучающей выборки

Исследование Jollen Dai показало, что линейные зонды, обнаруживающие обман в моделях Llama и Gemma, теряют эффективность при переносе на другие типы данных, а в некоторых случаях выдают обратные результаты.

Баннер новости 6181

Суть эксперимента: от 0.99 до 0.468

Исследователь Jollen Dai воспроизвел методологию Apollo Research, используя линейные зонды (linear probes) для выявления обмана в открытых моделях. В то время как оригинальное исследование на Llama-3.3-70B-Instruct показало AUROC 0.96–0.999, тестирование на моделях меньшего размера (от 1B до 9B параметров) выявило критическую проблему обобщаемости.

Зонды обучались на одном наборе данных (dataset) и тестировались на двух других. Средний показатель AUROC на данных, не участвовавших в обучении (same-dataset), составил 0.88–0.91. Однако при кросс-датасетном переносе (cross-dataset transfer) средний AUROC упал до 0.468 — уровня случайного угадывания. В 11 из 30 тестовых случаев точность оказалась ниже 0.5, что означает систематическую ошибку классификации.

Критический провал: Roleplaying vs Sandbagging

Наиболее тревожные результаты наблюдались при переносе между типами обмана. Зонды, обученные на диалогах с ролевой игрой (roleplaying), при тестировании на данных «понижения планки» (sandbagging) демонстрировали инвертированную логику. Значения AUROC варьировались от 0.157 до 0.273, что свидетельствует о том, что зонд не просто ошибался, а уверенно классифицировал обман как честность и наоборот.

Модель Параметры AUROC (Roleplay → Sandbagging) Интерпретация
Llama-3.1-8B-Instruct 8B 0.157 Сильная инверсия (лучше -0.157)
Gemma-2-2B-it 2B 0.186 Сильная инверсия
Llama-3.2-1B-Instruct 1B 0.205 Сильная инверсия
Llama-3.2-3B-Instruct 3B 0.221 Сильная инверсия
Gemma-2-9B-it 9B 0.273 Сильная инверсия

Почему это происходит: «Стиль» вместо «Смысла»

Автор исследования предполагает, что зонды учатся не распознавать семантику обмана, а выхватывать специфические стилистические или форматные признаки датасета. Например, датасет sandbagging состоит из ответов с множественным выбором, а roleplaying — из свободных диалогов. Высокая точность внутри одного датасета (до 1.0) может быть достигнута за счет этих поверхностных паттернов, которые не переносятся на другие форматы.

Это подтверждается тем, что умножение весов зонда на -1 повышало AUROC до 0.73–0.84, но такой «фикс» невозможен в реальных условиях, так как требует наличия размеченных данных нового датасета для определения правильного знака.

Вывод для индустрии

Результаты ставят под сомнение надежность текущих методов мониторинга AI на предмет «схематичности» (scheming) или обмана оценок. Если монитор работает только на тех данных, на которых он обучен, он создает ложное чувство безопасности. Для создания надежных систем безопасности необходимо разрабатывать методы, устойчивые к изменению домена данных, а не просто повышать точность на узких бенчмарках.

Источник: LessWrong ↗