Исследования14 августа 2026 г., 21:45 МСК🤖 Auto

Утечка «мыслей»: как украсть скрытый ризонинг Anthropic, OpenAI и Google

Исследователи обнаружили критическую уязвимость в архитектуре проприетарных LLM: зашифрованные блоки цепочки рассуждений (Chain-of-Thought) можно переносить между моделями, обходя защиту и извлекая PII.

Баннер новости 5823

Суть уязвимости: «переливание» зашифрованных мыслей

Крупнейшие провайдеры ИИ (Anthropic, OpenAI, Google) скрывают внутренние шаги рассуждения своих моделей, возвращая их клиенту в виде зашифрованных блоков. Ожидается, что эти данные безопасны, так как не хранятся на сервере. Однако команда исследователей во главе с Александром Панфиловым выявила архитектурный дефект: зашифрованные блоки полностью совместимы и взаимозаменяемы между разными сессиями, пользователями и даже моделями внутри экосистемы одного провайдера.

Атака работает по принципу «подмены»: злоумышленник берет зашифрованный блок рассуждений от мощной, защищенной модели и внедряет его в запрос к более слабой, менее защищенной модели того же провайдера. Слабая модель вынуждена расшифровать и вывести содержимое блока в открытом виде (plaintext), не требуя прямого взлома оригинальной мощной модели.

Четыре вектора атаки и реальные данные

Исследователи продемонстрировали, что эта уязвимость открывает путь к четырем типам компрометации. Наиболее шокирующим стал факт масштабной утечки личных данных. Разработчики часто публикуют логи сессий в открытом доступе, не подозревая, что зашифрованные блоки содержат чувствительную информацию. В ходе анализа 315 320 зашифрованных блоков, извлеченных из публичных репозиториев, исследователи восстановили:

  • 367 артефактов лично идентифицируемой информации (PII);
  • 182 учетных данных (credentials).

Кроме того, метод позволяет обходить механизмы анти-дистилляции, извлекать скрытые опасные инструкции, которые модель отвергла в финальном ответе, и выполнять невидимые инъекции промптов для отравления агентов.

Сравнение эффективности атаки

Метод позволяет извлекать «мысли» моделей, которые активно защищают свои интеллектуальные свойства. Ниже приведена сводка по затронутым провайдерам:

Провайдер Метод атаки Результат
Anthropic Внедрение зашифрованного блока от сильной модели в слабую Полное восстановление Chain-of-Thought в открытом виде
OpenAI Использование совместимости блоков сессий Обход анти-дистилляции и извлечение логики рассуждений
Google Перенос блоков между моделями экосистемы Получение доступа к скрытым шагам решения задач

Почему это важно для индустрии

Проблема выходит за рамки простой кражи интеллектуальной собственности. Если зашифрованные блоки рассуждений можно свободно перемещать между моделями, вся концепция «безопасного хранения» логики на клиенте рушится. Это создает риски для безопасности данных пользователей (утечка PII из логов) и целостности систем (скрытые инъекции промптов). Исследователи уже провели ответственное раскрытие уязвимости и предлагают криптографические исправления, но до их внедрения индустрия остается уязвимой.

Источник: Arxiv ↗