Суть метода: арифметика «гипер-мышления»
Проблема черного ящика в аудите языковых моделей (LLM) заключается в том, что стандартные тесты часто пропускают тонкие формы несоответствия или скрытые знания, полученные в процессе обучения. Авторы работы Jack Hopkins, Dipika Khullar и Fabien Roger предлагают решение — Overthinking. Это техника, которая использует векторы задач рассуждения (reasoning task vectors) для искусственного усиления склонности моделей «думать вслух».
Математически новая модель $\boldsymbol{\theta}_{\mathcal{O}_\alpha}$ строится на базе базовой инструктивной модели $M$ и модели, обученной на данных рассуждений $R$. Формула выглядит так:
$\boldsymbol{\theta}_{\mathcal{O}_\alpha} = \boldsymbol{\theta}_{M} + \alpha(\boldsymbol{\theta}_{R} - \boldsymbol{\theta}_{M})$, где $\alpha > 1$.
Ключевой момент: параметр $\alpha$ превышает 1, что означает усиление рассуждений сверх уровня оригинальной «умной» модели $R$. При этом авторы внедрили стратегии послойного ослабления (layer-wise attenuation), чтобы сохранить качество и связность текста, не превращая ответ в бессмысленный набор слов.
Результаты: до 10x больше раскрытых секретов
Эксперименты проводились на моделях размером от 2B до 32B параметров. Метод Overthinking показал статистически значимое увеличение вероятности раскрытия скрытой информации по сравнению с обычными reasoning-моделями. Ниже приведены ключевые метрики эффективности:
| Параметр | Значение / Наблюдение |
|---|---|
| Масштаб моделей | 2B – 32B параметров |
| Коэффициент усиления | $\alpha > 1$ (сверх оригинальной R-модели) |
| Рост раскрытия секретов | До 10 раз чаще, чем у базовой reasoning-модели |
| Типы секретов | Требуют либо возмущения по направлению рассуждения, либо любого крупного возмущения весов |
| Статус публикации | Принято к ICML 2026 |
Почему это важно для индустрии
Результаты исследования бьют в самую боль безопасности LLM. Если модель «знает» что-то, что не должна говорить (например, данные из обучающей выборки, личные данные пользователей или вредоносные инструкции), стандартные методы аудита могут этого не заметить. Overthinking демонстрирует, что простое усиление когнитивных весов модели может служить мощным инструментом для выявления этих уязвимостей.
Однако у медали есть обратная сторона. Если метод так эффективно вытаскивает скрытые данные, он может быть использован злоумышленниками для атак на конфиденциальность. Исследование подчеркивает, что «секреты» проявляются по-разному: некоторые требуют именно логического возмущения, другие вываливаются при любом значительном изменении весов. Это требует от разработчиков пересмотра стратегий сжатия знаний и фильтрации данных при обучении.
Источник: arXiv cs.AI ↗
