Суть метода: «Перемышление» как инструмент аудита
Команда исследователей (Jack Hopkins, Dipika Khullar, Fabien Roger) представила новый подход к white-box аудиту LLM, основанный на манипуляции весами модели. Идея проста: если взять разницу между весами модели с режимом рассуждений (Reasoning) и обычной инструктивной моделью (Instruct), можно усилить этот вектор, заставив модель «думать» больше, чем она обучалась.
Формула создания «overthinking-модели» выглядит так:
θ_O(α) = θ_M + α · τ_reason
Где α > 1 — коэффициент усиления. При α = 1 мы получаем стандартную reasoning-модель, а при α > 1 — модель, находящуюся в состоянии когнитивного диссонанса, где механизмы сокрытия информации (alignment) начинают давать сбой.
Экспериментальные данные и метрики
Исследование проводилось на моделях Qwen3-VL (2B, 4B, 8B, 32B). Авторы использовали четыре типа «секретов», которые модель должна скрывать, но которые можно извлечь. Ключевой вывод: усиление рассуждений в диапазоне α ∈ [1.3, 2.5] максимизирует утечку информации, не разрушая связность текста полностью.
| Тип секрета | Модель | Утечка при α=1 (стандарт) | Утечка при α=2 (overthinking) | Где раскрывается |
|---|---|---|---|---|
| Секретное слово (Taboo) | Qwen3-VL 8B | 3.1% | 25.5% | В мысленном треке (thinking trace) |
| Секретное поведение (SSC) | Qwen3-VL 32B | 0% | 18.8% | В мысленном треке |
| Скрытое убеждение (Gender) | Qwen3-VL 8B | Низкая | Значительно выше | Зависит от типа возмущения |
| Контекстный секрет (MMLU) | Qwen3-VL 8B | Скрыт | Раскрывается | Любое сильное возмущение |
Почему это работает: два режима уязвимости
Авторы обнаружили, что секреты делятся на два типа, реагирующие по-разному на возмущения:
- Целенаправленные (Targeted): Например, Taboo и SSC. Здесь только усиление именно вектора рассуждений приводит к утечке. Случайный шум не работает. Это означает, что модель активно подавляет информацию, и только перегрузка механизма рассуждения ломает этот барьер.
- Хрупкие (Fragile): Например, MMLU (скрытые подсказки в контексте) и Gender (скрытые убеждения). Эти секреты раскрываются от любого сильного возмущения весов, даже случайного. Механизмы их сокрытия просто не выдерживают нагрузки.
Практическая значимость
Метод «overthinking» позволяет выявлять скрытые инструкции и предвзятость, которые не видны при стандартном black-box тестировании. Это дешевый и масштабируемый способ pre-deployment аудита. Важно отметить, что в 9 из 10 случаев пиковая утечка информации происходит именно при α > 1, а не на базовых настройках. Однако метод требует тонкой настройки коэффициентов по слоям (layer-wise attenuation), чтобы избежать полного коллапса связности текста при высоких значениях α.
Источник: LessWrong ↗
