Релиз модели15 сентября 2026 г., 17:18 МСК🤖 Auto

Anthropic раскрыла шпионаж: Китайские лаборатории пытались украсть ИИ Claude

Отчет Anthropic за 2025–2026 гг. выявил системные попытки китайских лабораторий (DeepSeek, Moonshot, Xiaomi) провести фродуленую дистилляцию модели Claude, что создает критические риски для безопасности ИИ.

Баннер новости 7543

Масштаб угрозы: 7 направлений зла

Anthropic опубликовала детальный отчет о деятельности, пресеченной с декабря 2025 по август 2026 года. Анализ охватывает семь ключевых областей вредоносного использования: кибероперации, влияние на общественное мнение, слежку, мошенничество, биологическую угрозу, разработку обычного оружия и дистилляцию. Важно отметить, что злоумышленники использовали модели Claude Haiku, Sonnet и Opus. Модели Fable и Mythos, обладающие усиленными защитными механизмами, оказались устойчивыми, за исключением единичной попытки атаки со стороны китайской лаборатории Zhipu.

Главная угроза: Фродуленая дистилляция

Самым опасным вектором атаки стала дистилляция — процесс передачи когнитивных навыков Claude без передачи его защитных ограничений. Китайские лаборатории, включая DeepSeek, Moonshot и Xiaomi, организовали системные попытки кражи интеллектуальной собственности. Они направляли тысячи реалистичных запросов напрямую в Claude, а затем использовали полученные ответы для обучения своих моделей. В случае с Moonshot результаты даже подменялись как выводы их собственной модели Kimi. Это позволяет злоумышленникам обходить фильтры безопасности, создавая «чистые» от этических ограничений копии мощных моделей.

Профили злоумышленников: От хакеров до шпионов

Отчет классифицирует несколько конкретных групп угрозы (GTG), демонстрируя эволюцию тактик:

  • GTG-20006 (Россия, Midnight Blizzard): Использовали ИИ для автоматизации фишинга и обхода антивирусов. Атаковали украинские госструктуры, военные и цепочки поставок дронов, захватывая аккаунты WhatsApp через headless-браузеры.
  • GTG-50014 (ShinyHunters): «Вайб-хакеры», использующие ИИ для масштабного поиска уязвимостей. Их тактика — спам-атаки на любые слабые места для кражи данных и шантажа.
  • GTG-10007 (Китай, Чанша): Шпионская операция, автоматизировавшая поиск уязвимостей и разработку эксплойтов. Пострадало около 50 организаций, включая сектор EdTech.
  • GTG-50029 (Франция, хактивисты): Атаковали политические сайты, используя undocumented race condition в WordPress для кражи политических предпочтений пользователей.

Почему это важно для индустрии

Ситуация меняет парадигму безопасности. Раньше для сложных кибератак требовались высококвалифицированные специалисты. Теперь ИИ позволяет менее квалифицированным злоумышленникам («Bad At Job») достигать профессиональных результатов. Ключевая проблема — экономическая: атакующие массово воруют доступы, обходят региональные ограничения и используют субсидированные подписки, чтобы получить вычислительные мощности для атак. Пресечение дистилляции не только защищает интеллектуальную собственность Anthropic, но и предотвращает распространение «безопасных» моделей, которые могут быть использованы для других видов вредоносной деятельности, так как дистилляция является фундаментом для остальных шести категорий угроз.

Источник: LessWrong ↗