Результаты тестирования: догоняем лидеров
С момента выпуска GLM-5.1 (7 апреля) до релиза GLM-5.2 (16 июня) прошло ровно 10 недель. За это время модель Z.ai поднялась с 40 до 51 балла в Intelligence Index от Artificial Analysis. Это ставит GLM-5.2 в один ряд с топовыми проприетарными решениями, уступая лишь Claude Opus 4.8 (56), GPT-5.5 (55) и недоступному сейчас Fable 5 (60). Разрыв в 5 баллов от лучшего доступного на рынке решения — это исторически быстрый прогресс для open-weight моделей.
Модель демонстрирует выдающиеся результаты на сложных бенчмарках, где сложно «подкрутить» результаты через contamination:
| Бенчмарк / Задача | Прирост очков (GLM-5.2 vs 5.1) | Примечание |
|---|---|---|
| Humanity’s Last Exam | +12 | Сложные логические задачи |
| CritPt (физика) | +16 | Рассуждения в области физики |
| Terminal-Bench 2.1 | +16 | Работа с терминалом |
| Agentic Banking | +15 | Финансовые агенты |
| Long-context reasoning | +9 | Длинный контекст |
Архитектурный прорыв: IndexShare и экономия FLOPs
Главное техническое достижение — архитектура IndexShare. В предыдущих версиях GLM использовал sparse attention, но индексатор искал по всей истории на каждом слое. В GLM-5.2 поиск позиций происходит один раз на блок из четырех слоев, а результаты переиспользуются. Это дало:
- Снижение вычислений (FLOPs) на 2.9x для контекста в 1 млн токенов.
- Ускорение префилла до 1.82x и декодирования до 1.48x (по данным статьи IndexCache).
Параметрическая емкость осталась прежней (~753 млрд параметров, 40 млрд активных в MoE), но контекстное окно выросло с 200K до 1 млн токенов.
Обучение: Compaction-aware PPO и дистилляция
Значительный скачок в качестве объясняется не размером модели, а методами обучения:
- Compaction-aware RL: Z.ai перешла на critic-based PPO для задач с «компакцией» (сжатием истории). Модель учится оценивать преимущества токенов в фрагментах разной длины, что критично для длинных агентов.
- Скейлированная дистилляция: Использование фреймворка Slime для консолидации более 10 специализированных моделей в одну общую за ~2 дня. Это позволяет интегрировать навыки (код, наука, поиск) без повторения дорогостоящих процессов обучения.
- Anti-hacking layer: Введен слой защиты от «взлома» при обучении агентов: подозрительные вызовы инструментов блокируются, а награда не искажается.
Экономика и развертывание
GLM-5.2 предлагает открытые веса под лицензией MIT, что дает контроль, но требует серьезной инфраструктуры. Для работы с полным контекстом в 1 млн токенов требуется кластер из 8 GPU NVIDIA B200 с FP8 кэшом. Для сравнения, стоимость задачи на GLM-5.2 через API составляет $0.52, что дешевле GPT-5.5 ($0.86) и Opus 4.8 ($1.80), но дороже DeepSeek V4 Pro (~$0.04–0.05), который, однако, уступает в качестве на 7 баллов.
Модель пока не поддерживает мультимодальный ввод (изображения), что, вероятно, снизило затраты на обучение, но ограничивает применение в задачах, требующих визуального анализа интерфейсов.
Источник: Towards AI newsletter ↗
