Релиз модели22 августа 2026 г., 09:01 МСК🤖 Auto

GLM-5.3 против Claude Fable 5: почему открытая модель выигрывает по цене и качеству

Together AI провела сравнение GLM-5.3 и Claude Fable 5 на бенчмарке DeepSWE. При почти идентичной точности с первой попытки, GLM-5.3 обходит конкурента в 5.4 раза дешевле и лидирует при множественных попытках.

Баннер новости 6297

Статистическое равенство на старте, но разрыв в цене

В исследовании Together AI сравнивались модели GLM-5.3 (max) и Claude Fable 5 (max) на наборе задач DeepSWE, оценивающем навыки программного обеспечения. На метрике pass@1 (успех с первой попытки) разница минимальна и находится в пределах статистической погрешности: GLM-5.3 показал 69.0%, а Fable 5 — 69.7%. Однако ценовой разрыв огромен: стоимость одного запуска (rollout) у GLM-5.3 составляет $3.99, тогда как у Fable 5 — $21.63. Это делает GLM-5.3 в 5.4 раза экономичнее.

GLM-5.3 выигрывает при повторных попытках

Главное преимущество открытой модели проявляется, когда алгоритму разрешено несколько попыток. GLM-5.3 демонстрирует более высокий потолок точности:

Метрика GLM-5.3 [max] Claude Fable 5 [max]
Pass@1 (официальный) 69.0% 69.7%
Pass@2 81.1% 77.1%
Pass@4 87.6% 84.1%
Стоимость за rollout $3.99 $21.63
Решено задач на $100 17 3

При бюджете в $100 GLM-5.3 решает 17 задач, в то время как Fable 5 — лишь 3. Скорость работы моделей сопоставима (35 минут против 34 минут на rollout), но GLM-5.3 генерирует меньше токенов (80k против 114k), что и обеспечивает экономию.

Где каждая модель сильна: языки и домены

Несмотря на общую схожесть, у моделей есть специализации. GLM-5.3 доминирует в структурированных задачах, работе с интерпретаторами, конcurrency и анализе программ. В языковом разрезе GLM-5.3 показывает лучший результат по JavaScript (90% против 75%) и близок к паритету в Go и TypeScript.

Claude Fable 5 выигрывает в узких нишах: Rust (85% против 70% у GLM) и задачи сериализации данных. Именно эти области остаются единственным аргументом для использования более дорогой модели.

Стратегия маршрутизации: зачем держать обе?

Корреляция между успехами моделей составляет 0.65 — это очень высокий показатель согласованности. Они решают 88 общих задач, и их объединение покрывает 93.8% всех задач бенчмарка, но добавление Fable 5 к GLM-5.3 дает минимальный прирост покрытия.

Авторы рекомендуют следующую стратегию:

  • Основной поток: Использовать GLM-5.3 как основную модель. Это дает 69.7% успеха за половину цены Fable.
  • Эскалация: Перенаправлять в Fable 5 только те задачи, которые отклонены тестовым набором GLM, или специфичные задачи на Rust/сериализацию.

Такой подход позволяет достичь точности 81.1% (pass@2) при средней стоимости $10.74 за задачу, что значительно выгоднее использования Fable 5 в одиночку ($21.63).

Бенчмарки

БенчмаркGLM-5.3Claude Fable 5
DeepSWE69%69.7%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Together AI ↗