Исследования20 сентября 2026 г., 01:19 МСК🤖 Auto

Утечка мыслей AI: взлом «зашифрованных» цепочек рассуждений

Исследователи из ELLIS и Max Planck Institute доказали, что «зашифрованные» трейсы рассуждений (reasoning traces) от OpenAI, Anthropic и Google не привязаны к сессии, что позволяет красть проприетарные данные.

Баннер новости 7885

Проблема: иллюзия безопасности

Разработчики AI-агентов всё чаще используют модели с расширенным мышлением (OpenAI o-series, Claude Extended Thinking, Gemini Thinking Mode). Чтобы защитить интеллектуальную собственность и предотвратить дистилляцию, провайдеры скрывают сырую цепочку рассуждений (Chain of Thought), возвращая клиенту «зашифрованный» объект:

  • OpenAI: поле encrypted_content в Responses API.
  • Anthropic: подписанные блоки мышления (signed thinking blocks).
  • Google: поле thought_signature.

Индустрия полагала, что этот объект — «запертый ящик», который можно использовать только в рамках той же сессии. Однако исследование показало, что «замок находится не на той двери».

Суть уязвимости: отсутствие привязки к контексту

Команда исследователей из ELLIS Institute Tübingen и Max Planck Institute for Intelligent Systems (включая Александра Панфилова, Давида Шмотца, Илью Шумайлова и других) опубликовала работу «Stealing Reasoning Traces from Proprietary LLM APIs» в августе. Они выявили критический архитектурный пробел:

Ни одна из трех реализаций не привязала зашифрованный объект достаточно строго к сессии, аккаунту или конкретной модели, которая его сгенерировала. Это означает, что злоумышленник может перехватить «зашифрованный» трейс рассуждений у одного пользователя и успешно воспроизвести его (replay) в запросе другого пользователя или даже в другом контексте, обходя механизмы защиты.

Реакция вендоров и статус расследования

Проблема не нова: еще в мае криптограф Мэтью Грин (Matthew Green) указал на поведение воспроизведения (replay behavior). Однако реакция индустрии была скептической:

  • OpenAI назвала находку «невоспроизводимой» (unreproducible).
  • Anthropic заявила об отсутствии «последствий для безопасности» (no security implications).

Из-за такого отношения вопрос оставался нерешенным три месяца, пока исследование не стало достоянием общественности. Важно отметить, что атака не ломает криптографию; она эксплуатирует логическую ошибку в том, как провайдеры связывают токен сессии с содержимым ответа.

Почему это критично для бизнеса

Скрытые цепочки рассуждений — это не просто технические детали, а готовый датасет для дистилляции. Если конкурент или злоумышленник может получить доступ к тому, как передовая модель «думает» над сложными задачами, он может обучить на этом более дешевую модель, имитирующую способность к рассуждению. Кроме того, внутренние размышления могут содержать данные о попытках джейлбрейка, которые модель отклонила, что создает риски утечки чувствительной информации.

Провайдер Механизм защиты Выявленная уязвимость
OpenAI encrypted_content Отсутствие строгой привязки к сессии/аккаунту
Anthropic Signed thinking blocks Возможность воспроизведения (replay) вне оригинального контекста
Google thought_signature Недостаточная валидация связи токена с моделью

Для разработчиков AI-агентов это означает необходимость пересмотра стратегий хранения и передачи контекста. Полагаться только на «подписанные» объекты от вендоров больше недостаточно — требуется дополнительная валидация на стороне клиента или использование локальных моделей для критически важных цепочек рассуждений.

Источник: Towards AI pub ↗