Суть обновления: только пост-обучение
Команда Z.ai выпустила модель GLM-5.3, которая использует тот же базовый архитектурный стек, что и GLM-5.2. Ключевое отличие — все приросты производительности достигнуты исключительно за счет масштабирования пост-обучения (post-training scaling). Разработчики использовали собственные инфраструктуры IndexShare (для длинного контекста), SAO (для RL на длинных горизонтах) и slime (асинхронное обучение), добавив больше сред и вычислительных ресурсов.
Код: Новый стандарт для open-source
GLM-5.3 позиционируется как самая мощная модель с открытыми весами для задач программирования. Внутренний бенчмарк Z.ai Code Bench показывает улучшение на 50% по сравнению с предшественником. Модель обучалась на средах, имитирующих реальную работу инженеров: от диагностики узких мест в ML-инфраструктуре до оптимизации кластеров. Это требует от модели самостоятельного принятия решений, а не просто выполнения подзадач.
Сравнение результатов на ключевых бенчмарках:
| Бенчмарк | GLM-5.3 | GLM-5.2 | Qwen3.8-Max | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 21.1 | 34.6 | — |
| DeepSWE v1.1 | 66.9 | 46.2 | 62.7 | 58.0 | 69.7 |
| Terminal Bench 2.1 | 88.2 | 81.0 | 87.9 | 85.0 | 88.8 |
| FrontierSWE | 78.1 | 67.5 | 88.2 | — | — |
Важно отметить эффективность: на уровне сложности "Max" GLM-5.3 достигает 34.5% успешных задач, расходуя ~75K токенов, тогда как GLM-5.2 требовала 96K токенов для 23.4% результата. Модель также превосходит Claude Opus 4.8 по соотношению точности к затратам токенов на уровне "High".
Эмерджентная кибербезопасность
Наиболее неожиданным результатом стало развитие способностей к поиску уязвимостей. GLM-5.3 не просто находит баги, но и строит цепочки эксплуатации. На бенчмарке CyberGym (поиск уязвимостей в исходном коде) модель показала результат 84.5%, обогнав GPT-5.6 Sol (83.6%) и Mythos 5 (83.8%). На более сложных задачах эксплуатации (ExploitBench) GLM-5.3 набрала 54.4%, что более чем в два раза превышает показатель GLM-5.2 (24.4%). Однако закрытые модели (Mythos 5, GPT-5.6 Sol) все еще лидируют с результатами около 76-78%, что указывает на значительный разрыв в сложных сценариях атак.
Агентные способности
Модель демонстрирует сильные результаты в автономных агентах. На Toolathlon Verified GLM-5.3 набрала 73.0%, уступая лишь Qwen3.8-Max (74.1%) и Claude Opus 4.8 (74.7%). На AutomationBench она показала 48.2%, что является одним из лучших результатов среди открытых моделей.
Даты и доступность
Веса модели GLM-5.3 будут опубликованы через две недели после запуска, после прохождения процедур оценки безопасности и харденинга. На данный момент доступ к модели предоставляется через Z.ai Coding Plan и HuggingFace (в ближайшее время).
Бенчмарки
| Бенчмарк | GLM-5.3 | DeepSeek-V4 | GLM-5.2 | Kimi K3 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 88.2% | 87.9% | 81% | 88.3% |
| Terminal Bench 3.0 | 28.3% | 21.1% | 4.6% | 17.4% |
| DeepSWE v1.1 | 66.9% | 62.7% | 46.2% | 67.5% |
| CyberGym | 84.5% | 83.3% | 77.2% | 80% |
| ExploitBench | 54.4% | 28.8% | 24.4% | 32.2% |
| Toolathlon Verified | 73% | 74.1% | 59.9% | 76.5% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Z ↗
