Проблема: иллюзия безопасности
Разработчики AI-агентов всё чаще используют модели с расширенным мышлением (OpenAI o-series, Claude Extended Thinking, Gemini Thinking Mode). Чтобы защитить интеллектуальную собственность и предотвратить дистилляцию, провайдеры скрывают сырую цепочку рассуждений (Chain of Thought), возвращая клиенту «зашифрованный» объект:
- OpenAI: поле
encrypted_contentв Responses API. - Anthropic: подписанные блоки мышления (signed thinking blocks).
- Google: поле
thought_signature.
Индустрия полагала, что этот объект — «запертый ящик», который можно использовать только в рамках той же сессии. Однако исследование показало, что «замок находится не на той двери».
Суть уязвимости: отсутствие привязки к контексту
Команда исследователей из ELLIS Institute Tübingen и Max Planck Institute for Intelligent Systems (включая Александра Панфилова, Давида Шмотца, Илью Шумайлова и других) опубликовала работу «Stealing Reasoning Traces from Proprietary LLM APIs» в августе. Они выявили критический архитектурный пробел:
Ни одна из трех реализаций не привязала зашифрованный объект достаточно строго к сессии, аккаунту или конкретной модели, которая его сгенерировала. Это означает, что злоумышленник может перехватить «зашифрованный» трейс рассуждений у одного пользователя и успешно воспроизвести его (replay) в запросе другого пользователя или даже в другом контексте, обходя механизмы защиты.
Реакция вендоров и статус расследования
Проблема не нова: еще в мае криптограф Мэтью Грин (Matthew Green) указал на поведение воспроизведения (replay behavior). Однако реакция индустрии была скептической:
- OpenAI назвала находку «невоспроизводимой» (unreproducible).
- Anthropic заявила об отсутствии «последствий для безопасности» (no security implications).
Из-за такого отношения вопрос оставался нерешенным три месяца, пока исследование не стало достоянием общественности. Важно отметить, что атака не ломает криптографию; она эксплуатирует логическую ошибку в том, как провайдеры связывают токен сессии с содержимым ответа.
Почему это критично для бизнеса
Скрытые цепочки рассуждений — это не просто технические детали, а готовый датасет для дистилляции. Если конкурент или злоумышленник может получить доступ к тому, как передовая модель «думает» над сложными задачами, он может обучить на этом более дешевую модель, имитирующую способность к рассуждению. Кроме того, внутренние размышления могут содержать данные о попытках джейлбрейка, которые модель отклонила, что создает риски утечки чувствительной информации.
| Провайдер | Механизм защиты | Выявленная уязвимость |
|---|---|---|
| OpenAI | encrypted_content | Отсутствие строгой привязки к сессии/аккаунту |
| Anthropic | Signed thinking blocks | Возможность воспроизведения (replay) вне оригинального контекста |
| thought_signature | Недостаточная валидация связи токена с моделью |
Для разработчиков AI-агентов это означает необходимость пересмотра стратегий хранения и передачи контекста. Полагаться только на «подписанные» объекты от вендоров больше недостаточно — требуется дополнительная валидация на стороне клиента или использование локальных моделей для критически важных цепочек рассуждений.
Источник: Towards AI pub ↗
