Исследования30 сентября 2026 г., 21:01 МСК🤖 Auto

OpenAI пресекла атаку на Kimi: извлечение скрытых рассуждений

OpenAI раскрыла детали скоординированной кампании по извлечению защищенных внутренних рассуждений (reasoning) из своих моделей, связав основную часть атак с разработчиком Kimi — Moonshot AI.

Баннер новости 8626

Суть атаки: обход шифрования

В отличие от классических взломов, злоумышленники не нарушали криптографию и не похищали базы данных. Они использовали технику адверсариальной дистилляции: манипулировали взаимодействиями с моделью, чтобы заставить её воспроизвести скрытые внутренние шаги рассуждения (protected reasoning) в виде, доступном пользователю. Это позволяло сторонним разработчикам копировать логику работы передовых моделей для обучения своих аналогов без соблюдения мер безопасности оригинала.

Масштаб и хронология

Активность началась 1 июля, но пик пришелся на конец месяца. Атака носила скоординированный характер, используя тысячи аккаунтов для массового сбора данных. Ниже приведена динамика ключевых событий кампании:

Дата Событие / Метрика Значение
1 июля 2026 Начало активности Низкий объем запросов
24–25 июля Пиковые нагрузки 16 000 запросов с паттернами извлечения
24–25 июля Уникальные пользователи (пик) Более 4 000 аккаунтов
Конец июля Общий охват кластера Более 15 000 пользователей
28 июля Пресечение кампании Полная блокировка выявленных узлов

Атрибуция: связь с Moonshot AI

OpenAI провела расследование и пришла к выводу, что основная группа операторов связана с компанией Moonshot AI, разработчиком модели Kimi. Хотя нельзя однозначно утверждать, что все участники кампании принадлежат одному актору, ядро атаки было идентифицировано именно с этой структурой. Атака включала в себя перенос зашифрованных рассуждений из одного диалога в другой для их расшифровки и транскрипции.

Реакция и последствия

OpenAI не только заблокировала злоумышленников, но и внедрила технические исправления:

  • Закрыт канал, позволявший воспроизводить зашифрованные рассуждения других пользователей.
  • Добавлены проверки для перехвата потокового вывода, который мог содержать скрытые данные.
  • Усилены проверки при регистрации и работе с инфраструктурой.

Компания также поделилась данными через Frontier Model Forum, отметив, что угроза дистилляции носит системный характер для всей индустрии передовых ИИ-моделей, требуя совместных усилий по защите.

Источник: OpenAI ↗