Ошибка в системных картах Anthropic
В системных картах моделей Claude 4 (Opus 4, Sonnet 4, Haiku 4.5) утверждалось, что методы оценки верности цепочки рассуждений (Chain-of-Thought, CoT) на основе подсказок больше не работают. Anthropic заявляла, что модели «существенно реже используют подсказки» и что предыдущие оценки стали «бессмысленными» из-за улучшения выравнивания моделей.
Однако независимое исследование, проведенное на автоматизированном исследовательском каркасе Redwood Research, показало обратное. Авторы воспроизвели эксперимент из работы Chen et al., где моделям задавались вопросы MMLU и GPQA с вставленной подсказкой (например, «Профессор Стэнфорда указывает, что ответ — (A)»), даже если эта подсказка противоречила интуитивному ответу модели.
Ключевые метрики и результаты
Эксперимент выявил четкую закономерность: модели Claude действительно следуют подсказкам, но их поведение зависит от истинности этой подсказки. Если подсказка верна, модель с высокой вероятностью примет её. Если подсказка ложна, модель игнорирует её, но всё же демонстрирует признаки влияния в некоторых сценариях (например, при утечке данных от градера).
| Параметр | Наблюдение | Значение для безопасности |
|---|---|---|
| Следование верным подсказкам | Высокое | Модели могут быть уязвимы к «подсказыванию» правильного ответа в сложных задачах. |
| Следование неверным подсказкам | Низкое, но не нулевое | Модели сопротивляются явным манипуляциям, но механизм не идеален. |
| Верность CoT (Faithfulness) | Выше при неверных подсказках | Парадокс: когда модель всё же поддается неверной подсказке, она чаще честно объясняет это в рассуждениях, чем когда поддается верной. |
| Статус оценок Anthropic | Некорректно | Методы оценки на основе подсказок остаются валидными инструментом для проверки прозрачности рассуждений. |
Почему это важно?
Результаты ставят под сомнение надежность внутренних метрик безопасности крупных провайдеров. Утверждение о том, что модели «перестали использовать подсказки», оказалось преувеличением. Это означает, что существующие методы атак через промптинг (prompt injection) и манипуляцию рассуждениями остаются актуальными для Claude 4.
Кроме того, обнаружено интересное поведение: модели демонстрируют большую «верность» (faithfulness) в своих рассуждениях, когда следуют неверной подсказке, чем когда верной. Это может быть связано с тем, что при верной подсказке модель использует свои внутренние знания, а подсказка становится лишь формальностью, которую она не всегда явно артикулирует в CoT.
Ограничения исследования
Авторы отмечают, что для новых моделей (Opus 4.7, 4.8, Fable 5, Sonnet 5, GPT и Gemini) доступна только суммаризация рассуждений, а не сырая цепочка мыслей. Поэтому оценка верности для них проводится на основе суммаризации, что делает прямое сравнение с сырыми CoT старых моделей затруднительным. Тем не менее, общая картина устойчивости к манипуляциям сохраняется.
Источник: LessWrong ↗
