Релиз модели1 июля 2026 г., 05:16 МСК🤖 Auto

GLM-5.2: Z.ai сокращает разрыв с лидерами за 10 недель

Z.ai выпустила GLM-5.2 с открытыми весами, улучшив Intelligence Index на 11 пунктов. Модель обходит GPT-5.5 в сложных задачах, используя новую архитектуру IndexShare и компактный RL.

Баннер новости 2693

Результаты тестирования: догоняем лидеров

С момента выпуска GLM-5.1 (7 апреля) до релиза GLM-5.2 (16 июня) прошло ровно 10 недель. За это время модель Z.ai поднялась с 40 до 51 балла в Intelligence Index от Artificial Analysis. Это ставит GLM-5.2 в один ряд с топовыми проприетарными решениями, уступая лишь Claude Opus 4.8 (56), GPT-5.5 (55) и недоступному сейчас Fable 5 (60). Разрыв в 5 баллов от лучшего доступного на рынке решения — это исторически быстрый прогресс для open-weight моделей.

Модель демонстрирует выдающиеся результаты на сложных бенчмарках, где сложно «подкрутить» результаты через contamination:

Бенчмарк / Задача Прирост очков (GLM-5.2 vs 5.1) Примечание
Humanity’s Last Exam +12 Сложные логические задачи
CritPt (физика) +16 Рассуждения в области физики
Terminal-Bench 2.1 +16 Работа с терминалом
Agentic Banking +15 Финансовые агенты
Long-context reasoning +9 Длинный контекст

Архитектурный прорыв: IndexShare и экономия FLOPs

Главное техническое достижение — архитектура IndexShare. В предыдущих версиях GLM использовал sparse attention, но индексатор искал по всей истории на каждом слое. В GLM-5.2 поиск позиций происходит один раз на блок из четырех слоев, а результаты переиспользуются. Это дало:

  • Снижение вычислений (FLOPs) на 2.9x для контекста в 1 млн токенов.
  • Ускорение префилла до 1.82x и декодирования до 1.48x (по данным статьи IndexCache).

Параметрическая емкость осталась прежней (~753 млрд параметров, 40 млрд активных в MoE), но контекстное окно выросло с 200K до 1 млн токенов.

Обучение: Compaction-aware PPO и дистилляция

Значительный скачок в качестве объясняется не размером модели, а методами обучения:

  1. Compaction-aware RL: Z.ai перешла на critic-based PPO для задач с «компакцией» (сжатием истории). Модель учится оценивать преимущества токенов в фрагментах разной длины, что критично для длинных агентов.
  2. Скейлированная дистилляция: Использование фреймворка Slime для консолидации более 10 специализированных моделей в одну общую за ~2 дня. Это позволяет интегрировать навыки (код, наука, поиск) без повторения дорогостоящих процессов обучения.
  3. Anti-hacking layer: Введен слой защиты от «взлома» при обучении агентов: подозрительные вызовы инструментов блокируются, а награда не искажается.

Экономика и развертывание

GLM-5.2 предлагает открытые веса под лицензией MIT, что дает контроль, но требует серьезной инфраструктуры. Для работы с полным контекстом в 1 млн токенов требуется кластер из 8 GPU NVIDIA B200 с FP8 кэшом. Для сравнения, стоимость задачи на GLM-5.2 через API составляет $0.52, что дешевле GPT-5.5 ($0.86) и Opus 4.8 ($1.80), но дороже DeepSeek V4 Pro (~$0.04–0.05), который, однако, уступает в качестве на 7 баллов.

Модель пока не поддерживает мультимодальный ввод (изображения), что, вероятно, снизило затраты на обучение, но ограничивает применение в задачах, требующих визуального анализа интерфейсов.

Источник: Towards AI newsletter ↗