Релиз модели14 августа 2026 г., 13:46 МСК🤖 Auto

GLM-5.3: Прорыв в коде и кибербезопасности от Z.ai

Z.ai представила GLM-5.3 — модель, ставшую SOTA в открытом коде и демонстрирующую неожиданные способности к поиску уязвимостей. Рост достигнут исключительно за счет масштабирования пост-обучения.

Баннер новости 5793

Суть обновления: только пост-обучение

Команда Z.ai выпустила модель GLM-5.3, которая использует тот же базовый архитектурный стек, что и GLM-5.2. Ключевое отличие — все приросты производительности достигнуты исключительно за счет масштабирования пост-обучения (post-training scaling). Разработчики использовали собственные инфраструктуры IndexShare (для длинного контекста), SAO (для RL на длинных горизонтах) и slime (асинхронное обучение), добавив больше сред и вычислительных ресурсов.

Код: Новый стандарт для open-source

GLM-5.3 позиционируется как самая мощная модель с открытыми весами для задач программирования. Внутренний бенчмарк Z.ai Code Bench показывает улучшение на 50% по сравнению с предшественником. Модель обучалась на средах, имитирующих реальную работу инженеров: от диагностики узких мест в ML-инфраструктуре до оптимизации кластеров. Это требует от модели самостоятельного принятия решений, а не просто выполнения подзадач.

Сравнение результатов на ключевых бенчмарках:

Бенчмарк GLM-5.3 GLM-5.2 Qwen3.8-Max Opus 4.8 GPT-5.6 Sol
Terminal Bench 3.0 28.3 4.6 21.1 34.6
DeepSWE v1.1 66.9 46.2 62.7 58.0 69.7
Terminal Bench 2.1 88.2 81.0 87.9 85.0 88.8
FrontierSWE 78.1 67.5 88.2

Важно отметить эффективность: на уровне сложности "Max" GLM-5.3 достигает 34.5% успешных задач, расходуя ~75K токенов, тогда как GLM-5.2 требовала 96K токенов для 23.4% результата. Модель также превосходит Claude Opus 4.8 по соотношению точности к затратам токенов на уровне "High".

Эмерджентная кибербезопасность

Наиболее неожиданным результатом стало развитие способностей к поиску уязвимостей. GLM-5.3 не просто находит баги, но и строит цепочки эксплуатации. На бенчмарке CyberGym (поиск уязвимостей в исходном коде) модель показала результат 84.5%, обогнав GPT-5.6 Sol (83.6%) и Mythos 5 (83.8%). На более сложных задачах эксплуатации (ExploitBench) GLM-5.3 набрала 54.4%, что более чем в два раза превышает показатель GLM-5.2 (24.4%). Однако закрытые модели (Mythos 5, GPT-5.6 Sol) все еще лидируют с результатами около 76-78%, что указывает на значительный разрыв в сложных сценариях атак.

Агентные способности

Модель демонстрирует сильные результаты в автономных агентах. На Toolathlon Verified GLM-5.3 набрала 73.0%, уступая лишь Qwen3.8-Max (74.1%) и Claude Opus 4.8 (74.7%). На AutomationBench она показала 48.2%, что является одним из лучших результатов среди открытых моделей.

Даты и доступность

Веса модели GLM-5.3 будут опубликованы через две недели после запуска, после прохождения процедур оценки безопасности и харденинга. На данный момент доступ к модели предоставляется через Z.ai Coding Plan и HuggingFace (в ближайшее время).

Бенчмарки

БенчмаркGLM-5.3DeepSeek-V4GLM-5.2Kimi K3
Terminal Bench 2.188.2%87.9%81%88.3%
Terminal Bench 3.028.3%21.1%4.6%17.4%
DeepSWE v1.166.9%62.7%46.2%67.5%
CyberGym84.5%83.3%77.2%80%
ExploitBench54.4%28.8%24.4%32.2%
Toolathlon Verified73%74.1%59.9%76.5%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Z ↗