Релиз модели18 августа 2026 г., 10:01 МСК🤖 Auto

DeepSeek V4 Pro vs Claude Fable 5: битва за код, стоимость и маршрутизацию

Together AI провела масштабное сравнение DeepSeek V4 Pro и Claude Fable 5 на бенчмарке DeepSWE. Результаты показали, что Pro выигрывает в эффективности при кэскединге, а Fable лидирует в точности, но ценой в 90 раз более высокой стоимости.

Баннер новости 5976

Масштабное тестирование DeepSWE

Лаборатория Together AI опубликовала детальные результаты сравнения двух мощных моделей для программирования: DeepSeek V4 Pro 0813 и Claude Fable 5. Тестирование проводилось на наборе данных DeepSWE (Software Engineering), который оценивает способность моделей решать реальные задачи по написанию и исправлению кода. Всего было выполнено 904 rollout-сессии (запусков), что позволяет сделать статистически значимые выводы о производительности моделей.

Ключевые метрики: Точность против Стоимости

Основное противоречие между моделями кроется в балансе между качеством решения и затратами на вычисления. Claude Fable 5 демонстрирует превосходство в метрике pass@1 (успешное решение с первой попытки), однако эта точность достигается при колоссальных затратах. DeepSeek V4 Pro, в свою очередь, показывает более сбалансированные результаты, особенно при использовании стратегий множественных попыток.

Ниже приведена сводная таблица результатов сравнения:

Метрика / Параметр Claude Fable 5 DeepSeek V4 Pro 0813
Лидерство по pass@1 Да (высокая точность с первой попытки) Уступает Fable
Стоимость достижения pass@1 Высокая (в 90 раз дороже Pro) Значительно ниже
Результат по pass@4 Уступает Победа (лучший результат при 4 попытках)
Эффективность кэскединга (Cascade) 82.7% (при стратегии Pro-first)

Победа стратегии маршрутизации (Routing)

Самым интригующим выводом исследования стала эффективность гибридных подходов. Авторы теста внедрили стратегию "Pro-first cascade" (каскадирование с приоритетом DeepSeek V4 Pro). Эта архитектура позволяет сначала использовать более дешевую и быструю модель DeepSeek V4 Pro. Если она не справляется, запрос перенаправляется на более мощную, но дорогую Claude Fable 5.

Такая стратегия позволила достичь показателя 82.7% успешных решений, оптимизируя баланс между производительностью и затратами. Это доказывает, что в сложных задачах по генерации кода (DeepSWE) не всегда нужна самая дорогая модель для каждого запроса, а грамотная маршрутизация трафика может дать отличный результат.

Почему это важно для разработчиков

Для команд, внедряющих AI-ассистентов в CI/CD процессы или разработку ПО, эти данные критичны. Использование только Claude Fable 5 может привести к неоправданно высоким счетам за API при незначительном приросте качества для простых задач. Внедрение DeepSeek V4 Pro в качестве первой линии защиты (first-pass model) с последующим эскалацией сложных случаев в Fable 5, судя по тестам Together AI, является оптимальной архитектурной стратегией на данный момент.

Источник: Together AI ↗