Масштабное тестирование DeepSWE
Лаборатория Together AI опубликовала детальные результаты сравнения двух мощных моделей для программирования: DeepSeek V4 Pro 0813 и Claude Fable 5. Тестирование проводилось на наборе данных DeepSWE (Software Engineering), который оценивает способность моделей решать реальные задачи по написанию и исправлению кода. Всего было выполнено 904 rollout-сессии (запусков), что позволяет сделать статистически значимые выводы о производительности моделей.
Ключевые метрики: Точность против Стоимости
Основное противоречие между моделями кроется в балансе между качеством решения и затратами на вычисления. Claude Fable 5 демонстрирует превосходство в метрике pass@1 (успешное решение с первой попытки), однако эта точность достигается при колоссальных затратах. DeepSeek V4 Pro, в свою очередь, показывает более сбалансированные результаты, особенно при использовании стратегий множественных попыток.
Ниже приведена сводная таблица результатов сравнения:
| Метрика / Параметр | Claude Fable 5 | DeepSeek V4 Pro 0813 |
|---|---|---|
| Лидерство по pass@1 | Да (высокая точность с первой попытки) | Уступает Fable |
| Стоимость достижения pass@1 | Высокая (в 90 раз дороже Pro) | Значительно ниже |
| Результат по pass@4 | Уступает | Победа (лучший результат при 4 попытках) |
| Эффективность кэскединга (Cascade) | — | 82.7% (при стратегии Pro-first) |
Победа стратегии маршрутизации (Routing)
Самым интригующим выводом исследования стала эффективность гибридных подходов. Авторы теста внедрили стратегию "Pro-first cascade" (каскадирование с приоритетом DeepSeek V4 Pro). Эта архитектура позволяет сначала использовать более дешевую и быструю модель DeepSeek V4 Pro. Если она не справляется, запрос перенаправляется на более мощную, но дорогую Claude Fable 5.
Такая стратегия позволила достичь показателя 82.7% успешных решений, оптимизируя баланс между производительностью и затратами. Это доказывает, что в сложных задачах по генерации кода (DeepSWE) не всегда нужна самая дорогая модель для каждого запроса, а грамотная маршрутизация трафика может дать отличный результат.
Почему это важно для разработчиков
Для команд, внедряющих AI-ассистентов в CI/CD процессы или разработку ПО, эти данные критичны. Использование только Claude Fable 5 может привести к неоправданно высоким счетам за API при незначительном приросте качества для простых задач. Внедрение DeepSeek V4 Pro в качестве первой линии защиты (first-pass model) с последующим эскалацией сложных случаев в Fable 5, судя по тестам Together AI, является оптимальной архитектурной стратегией на данный момент.
Источник: Together AI ↗
