Релиз модели22 августа 2026 г., 08:31 МСК🤖 Auto

GLM-5.3 против GPT-5.6 Sol: как каскад моделей побил бенчмарк DeepSWE

Together AI представила детальный анализ: GLM-5.3 не выигрывает у GPT-5.6 Sol в одиночном запуске, но при стратегии «каскада» (сначала дешевая, потом дорогая) решает 85.9% задач по цене $6.61, превосходя флагман по эффективности.

Баннер новости 6296

Суть эксперимента: Open-weight против Frontier

Лаборатория Together AI провела сравнительное тестирование модели GLM-5.3 [max] (открытый вес) и GPT-5.6 Sol [max] (закрытый флагман) на бенчмарке DeepSWE. В выборку вошли 113 задач по программированию, выполненных по 4 раза для каждой модели (всего 904 ролаута). Цель — определить, стоит ли переплачивать за закрытые модели, если открытые могут компенсировать разницу количеством попыток.

Ключевые метрики: Pass@k и стоимость

GPT-5.6 Sol сохраняет лидерство в режиме «одного выстрела» (pass@1), но GLM-5.3 обгоняет его при наличии права на ошибку. При этом стоимость решения одной задачи через GLM-5.3 почти вдвое ниже. Ниже приведено сравнение базовых показателей:

Метрика GLM-5.3 [max] GPT-5.6 Sol [max]
Pass@1 (официальный) 69.0% ± 2.7% 72.7% ± 2.2%
Pass@4 (лучший из 4) 87.6% 85.8%
Стоимость за rollout $3.99 $8.37
Решений на $100 17 9
Среднее время (мин) 35 19
Среднее кол-во шагов 124 61

Стратегия «Каскад»: почему это важно

Самый инсайтный вывод отчета — рекомендация не выбирать одну модель, а использовать их в связке. Корреляция между моделями составляет всего 0.43, что означает высокую независимость их ошибок. Вместе они покрывают 106 из 113 задач (93.8%).

Оптимальная схема (Cascade):

  • Шаг 1: Запуск GLM-5.3. Если тесты проходят — задача решена за $3.99.
  • Шаг 2: Если тесты падают, эскалация на GPT-5.6 Sol.

Такой подход позволяет решить 85.9% задач DeepSWE со средней стоимостью $6.61 за задачу. Это на 13 процентных пунктов выше, чем у Sol в одиночку (72.7%), и дешевле, чем запуск Sol для всех задач (8.37), так как большинство задач закрывает дешевый GLM.

Различия в надежности и типах задач

Модели имеют разные профили ошибок. GPT-5.6 Sol чаще ломает существующие тесты (регрессия в 20% случаев провалов), тогда как у GLM-5.3 этот показатель составляет 11%. GLM чаще допускает «near miss» (близкий промах с сохранением базовой логики), что делает его безопаснее для автоматического принятия патчей без жесткой проверки.

В специфических языках программирования GLM-5.3 демонстрирует явное преимущество в JavaScript (90% против 75% у Sol) и Rust (70% против 60%). Sol, в свою очередь, сильнее в Python, Go и TypeScript, а также в задачах на конформность протоколам (59% против 44% у GLM).

Итог для разработчиков

Если вам нужна максимальная скорость и минимальное количество токенов на выход — выбирайте GPT-5.6 Sol. Если же критична стоимость или требуется максимальный охват задач через множественные попытки (best-of-k) — GLM-5.3 является более выгодным выбором. Идеальная архитектура для сложных инженерных задач — это GLM-5.3 как фронтенд-фильтр с GPT-5.6 Sol в роли верификатора для сложных случаев.

Бенчмарки

БенчмаркGLM-5.3GPT-5.6 Sol
DeepSWE69%72.7%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Together AI ↗