Статистическое равенство на старте, но разрыв в цене
В исследовании Together AI сравнивались модели GLM-5.3 (max) и Claude Fable 5 (max) на наборе задач DeepSWE, оценивающем навыки программного обеспечения. На метрике pass@1 (успех с первой попытки) разница минимальна и находится в пределах статистической погрешности: GLM-5.3 показал 69.0%, а Fable 5 — 69.7%. Однако ценовой разрыв огромен: стоимость одного запуска (rollout) у GLM-5.3 составляет $3.99, тогда как у Fable 5 — $21.63. Это делает GLM-5.3 в 5.4 раза экономичнее.
GLM-5.3 выигрывает при повторных попытках
Главное преимущество открытой модели проявляется, когда алгоритму разрешено несколько попыток. GLM-5.3 демонстрирует более высокий потолок точности:
| Метрика | GLM-5.3 [max] | Claude Fable 5 [max] |
|---|---|---|
| Pass@1 (официальный) | 69.0% | 69.7% |
| Pass@2 | 81.1% | 77.1% |
| Pass@4 | 87.6% | 84.1% |
| Стоимость за rollout | $3.99 | $21.63 |
| Решено задач на $100 | 17 | 3 |
При бюджете в $100 GLM-5.3 решает 17 задач, в то время как Fable 5 — лишь 3. Скорость работы моделей сопоставима (35 минут против 34 минут на rollout), но GLM-5.3 генерирует меньше токенов (80k против 114k), что и обеспечивает экономию.
Где каждая модель сильна: языки и домены
Несмотря на общую схожесть, у моделей есть специализации. GLM-5.3 доминирует в структурированных задачах, работе с интерпретаторами, конcurrency и анализе программ. В языковом разрезе GLM-5.3 показывает лучший результат по JavaScript (90% против 75%) и близок к паритету в Go и TypeScript.
Claude Fable 5 выигрывает в узких нишах: Rust (85% против 70% у GLM) и задачи сериализации данных. Именно эти области остаются единственным аргументом для использования более дорогой модели.
Стратегия маршрутизации: зачем держать обе?
Корреляция между успехами моделей составляет 0.65 — это очень высокий показатель согласованности. Они решают 88 общих задач, и их объединение покрывает 93.8% всех задач бенчмарка, но добавление Fable 5 к GLM-5.3 дает минимальный прирост покрытия.
Авторы рекомендуют следующую стратегию:
- Основной поток: Использовать GLM-5.3 как основную модель. Это дает 69.7% успеха за половину цены Fable.
- Эскалация: Перенаправлять в Fable 5 только те задачи, которые отклонены тестовым набором GLM, или специфичные задачи на Rust/сериализацию.
Такой подход позволяет достичь точности 81.1% (pass@2) при средней стоимости $10.74 за задачу, что значительно выгоднее использования Fable 5 в одиночку ($21.63).
Бенчмарки
| Бенчмарк | GLM-5.3 | Claude Fable 5 |
|---|---|---|
| DeepSWE | 69% | 69.7% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Together AI ↗
