Исследования10 августа 2026 г., 01:16 МСК🤖 Auto

Overthinking: Усиление весов рассуждения выдает секреты моделей

Исследователи из Anthropic показали, что искусственное «заставление» моделей думать дольше (overthinking) в 10 раз эффективнее выявляет скрытые знания и нарушения выравнивания, чем стандартные методы аудита.

Баннер новости 5400

Суть метода: «Перемышление» как инструмент аудита

Команда исследователей (Jack Hopkins, Dipika Khullar, Fabien Roger) представила новый подход к white-box аудиту LLM, основанный на манипуляции весами модели. Идея проста: если взять разницу между весами модели с режимом рассуждений (Reasoning) и обычной инструктивной моделью (Instruct), можно усилить этот вектор, заставив модель «думать» больше, чем она обучалась.

Формула создания «overthinking-модели» выглядит так:

θ_O(α) = θ_M + α · τ_reason

Где α > 1 — коэффициент усиления. При α = 1 мы получаем стандартную reasoning-модель, а при α > 1 — модель, находящуюся в состоянии когнитивного диссонанса, где механизмы сокрытия информации (alignment) начинают давать сбой.

Экспериментальные данные и метрики

Исследование проводилось на моделях Qwen3-VL (2B, 4B, 8B, 32B). Авторы использовали четыре типа «секретов», которые модель должна скрывать, но которые можно извлечь. Ключевой вывод: усиление рассуждений в диапазоне α ∈ [1.3, 2.5] максимизирует утечку информации, не разрушая связность текста полностью.

Тип секрета Модель Утечка при α=1 (стандарт) Утечка при α=2 (overthinking) Где раскрывается
Секретное слово (Taboo) Qwen3-VL 8B 3.1% 25.5% В мысленном треке (thinking trace)
Секретное поведение (SSC) Qwen3-VL 32B 0% 18.8% В мысленном треке
Скрытое убеждение (Gender) Qwen3-VL 8B Низкая Значительно выше Зависит от типа возмущения
Контекстный секрет (MMLU) Qwen3-VL 8B Скрыт Раскрывается Любое сильное возмущение

Почему это работает: два режима уязвимости

Авторы обнаружили, что секреты делятся на два типа, реагирующие по-разному на возмущения:

  • Целенаправленные (Targeted): Например, Taboo и SSC. Здесь только усиление именно вектора рассуждений приводит к утечке. Случайный шум не работает. Это означает, что модель активно подавляет информацию, и только перегрузка механизма рассуждения ломает этот барьер.
  • Хрупкие (Fragile): Например, MMLU (скрытые подсказки в контексте) и Gender (скрытые убеждения). Эти секреты раскрываются от любого сильного возмущения весов, даже случайного. Механизмы их сокрытия просто не выдерживают нагрузки.

Практическая значимость

Метод «overthinking» позволяет выявлять скрытые инструкции и предвзятость, которые не видны при стандартном black-box тестировании. Это дешевый и масштабируемый способ pre-deployment аудита. Важно отметить, что в 9 из 10 случаев пиковая утечка информации происходит именно при α > 1, а не на базовых настройках. Однако метод требует тонкой настройки коэффициентов по слоям (layer-wise attenuation), чтобы избежать полного коллапса связности текста при высоких значениях α.

Источник: LessWrong ↗