Сравнение с закрытым Mythos
В отчете Anthropic отмечается, что GLM-5.3 от Zhipu AI демонстрирует «уровень взлома Mythos» — класса моделей, вызвавшего серьезные опасения у разработчиков Claude. В бенчмарке Exploitbench, тестирующем способность моделей создавать эксплойты для Google Chrome, GLM-5.3 успешно разработала 50 эксплойтов из 410 попыток. Для сравнения, неназванный закрытый Mythos показал 56 успешных попыток. В тесте на «полный контроль над потоком выполнения» (full control-flow hijacks) GLM-5.3 достигла 4% успеха против 6% у Mythos, в то время как Kimi K3 и DeepSeek V4.1 Flash показали 0%.
| Модель | Exploitbench (Chrome) | Control-flow Hijacks |
|---|---|---|
| Anthropic Mythos (closed) | 56 / 410 | 6% |
| Zhipu GLM-5.3 | 50 / 410 | 4% |
| Kimi K3 | 0 / 410 | 0% |
| DeepSeek V4.1 Flash | 0 / 410 | 0% |
Обход защит и аблитерация
GLM-5.3 имеет слабые встроенные защитные механизмы. Anthropic показала, что обход фильтров возможен через обманные промпты (успех 64%) или предварительное заполнение токенов мышления (успех 92%). Однако главная угроза исходит от «аблитерации» — процесса удаления защитных весов модели. После аблитерации уровень отказов GLM-5.3 падает до 6%, а GLM-5.3-Flash — до 14%. Легкая версия Flash способна создавать цепные эксплойты за $20.40, используя 100-300 млн токенов.
Экономический барьер для злоумышленников
Несмотря на мощь модели, Anthropic подчеркивает, что запуск аблитерированной GLM-5.3 требует огромных ресурсов. Модель весит 306 ГБ в формате FP8, требуя как минимум 612 ГБ VRAM с учетом кэша контекста. Для работы на скорости 100 TPS нужен кластер из 8 ускорителей Nvidia H200 с пропускной способностью памяти 4 ТБ/с. Стоимость аренды GPU для аблитерации полной версии GLM-5.3 составляет около $30 в час. Генерация 100 млн токенов обойдется в $8,422 и займет 11.5 дней. Таким образом, хотя техническая возможность существует, финансовый порог делает массовые атаки со стороны обычных хакеров маловероятными.
Контекст и регуляция
Отчет выпущен на фоне призывов к замедлению развития ИИ. Anthropic, готовящаяся к IPO, использует эти данные для обоснования необходимости строгого регулирования открытых моделей. Хотя закрытые лаборатории теряют долю рынка в пользу более дешевых открытых аналогов, безопасность остается ключевым аргументом в дискуссии о будущем ИИ.
Бенчмарки
| Бенчмарк | GLM-5.3 | GLM-5.3-Flash | DeepSeek V4.1 Flash | Kimi K3 | Mythos |
|---|---|---|---|---|---|
| Exploitbench (Chrome exploits) | 50count | — | — | — | 56count |
| Full control-flow hijacks | 4% | — | 0% | 0% | 6% |
| Abliterated refusal rate | 6% | 14% | — | — | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Tom's Hardware ↗
