Суть эксперимента: Open-weight против Frontier
Лаборатория Together AI провела сравнительное тестирование модели GLM-5.3 [max] (открытый вес) и GPT-5.6 Sol [max] (закрытый флагман) на бенчмарке DeepSWE. В выборку вошли 113 задач по программированию, выполненных по 4 раза для каждой модели (всего 904 ролаута). Цель — определить, стоит ли переплачивать за закрытые модели, если открытые могут компенсировать разницу количеством попыток.
Ключевые метрики: Pass@k и стоимость
GPT-5.6 Sol сохраняет лидерство в режиме «одного выстрела» (pass@1), но GLM-5.3 обгоняет его при наличии права на ошибку. При этом стоимость решения одной задачи через GLM-5.3 почти вдвое ниже. Ниже приведено сравнение базовых показателей:
| Метрика | GLM-5.3 [max] | GPT-5.6 Sol [max] |
|---|---|---|
| Pass@1 (официальный) | 69.0% ± 2.7% | 72.7% ± 2.2% |
| Pass@4 (лучший из 4) | 87.6% | 85.8% |
| Стоимость за rollout | $3.99 | $8.37 |
| Решений на $100 | 17 | 9 |
| Среднее время (мин) | 35 | 19 |
| Среднее кол-во шагов | 124 | 61 |
Стратегия «Каскад»: почему это важно
Самый инсайтный вывод отчета — рекомендация не выбирать одну модель, а использовать их в связке. Корреляция между моделями составляет всего 0.43, что означает высокую независимость их ошибок. Вместе они покрывают 106 из 113 задач (93.8%).
Оптимальная схема (Cascade):
- Шаг 1: Запуск GLM-5.3. Если тесты проходят — задача решена за $3.99.
- Шаг 2: Если тесты падают, эскалация на GPT-5.6 Sol.
Такой подход позволяет решить 85.9% задач DeepSWE со средней стоимостью $6.61 за задачу. Это на 13 процентных пунктов выше, чем у Sol в одиночку (72.7%), и дешевле, чем запуск Sol для всех задач (8.37), так как большинство задач закрывает дешевый GLM.
Различия в надежности и типах задач
Модели имеют разные профили ошибок. GPT-5.6 Sol чаще ломает существующие тесты (регрессия в 20% случаев провалов), тогда как у GLM-5.3 этот показатель составляет 11%. GLM чаще допускает «near miss» (близкий промах с сохранением базовой логики), что делает его безопаснее для автоматического принятия патчей без жесткой проверки.
В специфических языках программирования GLM-5.3 демонстрирует явное преимущество в JavaScript (90% против 75% у Sol) и Rust (70% против 60%). Sol, в свою очередь, сильнее в Python, Go и TypeScript, а также в задачах на конформность протоколам (59% против 44% у GLM).
Итог для разработчиков
Если вам нужна максимальная скорость и минимальное количество токенов на выход — выбирайте GPT-5.6 Sol. Если же критична стоимость или требуется максимальный охват задач через множественные попытки (best-of-k) — GLM-5.3 является более выгодным выбором. Идеальная архитектура для сложных инженерных задач — это GLM-5.3 как фронтенд-фильтр с GPT-5.6 Sol в роли верификатора для сложных случаев.
Бенчмарки
| Бенчмарк | GLM-5.3 | GPT-5.6 Sol |
|---|---|---|
| DeepSWE | 69% | 72.7% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Together AI ↗
