Результаты DeepSWE: качество и стоимость
В исследовании Together AI сравниваются Kimi K3 (от Moonshot AI) и Claude Fable 5 (Anthropic) на наборе данных DeepSWE, который тестирует способности к программной инженерии. Тест включает 113 реальных запросов на добавление функций из открытых репозиториев. Ключевой вывод: Kimi K3 демонстрирует сопоставимое качество, но обходится значительно дешевле, что делает его привлекательным выбором для высоконагруженных задач.
| Метрика | Claude Fable 5 (xhigh) | Kimi K3 (max) | Разница / Примечание |
|---|---|---|---|
| Pass@1 (успех с 1-й попытки) | 69.9% | 68.5% | Fable лидирует на 1.4 п.п. |
| Pass@2 (успех в 2 попытках) | 80.2% | 82.0% | Kimi K3 лидирует |
| Pass@4 (успех в 4 попытках) | 88.5% | 89.4% | Kimi K3 лидирует, лучший результат среди флагманов |
| Стоимость за rollout | $13.41 | $4.65 | Kimi K3 в ~3 раза дешевле |
| Стоимость полного теста (452 rollout) | $6,010 | $2,103 | Экономия ~$3,900 |
| Решенных задач на $100 | 5.3 | 14.7 | Kimi K3 в 2.8 раза эффективнее по деньгам |
Надежность против охвата
Модели занимают разные позиции в зависимости от метрики. Claude Fable 5 более детерминирован: он решает 58 задач «четверо-на-четверо» (4/4), тогда как Kimi K3 — 45. Однако Kimi K3 имеет более широкий «охват» (coverage): он хотя бы раз решает 89.4% задач (лишь 12 задач остаются нерешенными), в то время как Fable 5 не решает 13 задач. Это объясняет преимущество Kimi K3 при увеличении числа попыток (pass@2, pass@4).
Сравнение по языкам программирования
Kimi K3 демонстрирует явное преимущество в Go (79% против 71% у Fable 5). Claude Fable 5 лидирует в Python, JavaScript, TypeScript и Rust. Примечательно, что Kimi K3 практически догнал Fable 5 по Rust, показав результат 65% против 75% (в абсолютных значениях успеха), что делает его одним из лучших моделей для работы с Rust среди доступных опций.
Корреляция и стоимость ошибок
Корреляция между моделями на уровне отдельных задач составляет 0.72 — это самый высокий показатель кросс-вендорного сходства в истории бенчмарка. Модели часто терпят неудачу на одних и тех же задачах (65% сбоев — «почти успех» для обеих). Объединение их результатов покрывает 105 из 113 задач, что дает лишь незначительное преимущество диверсификации по сравнению с использованием только Kimi K3.
Почему это важно
Главное преимущество Kimi K3 — его open-weight статус. Это позволяет компаниям развертывать модель на собственной инфраструктуре, оптимизировать инференс и снижать затраты еще больше, чем при использовании API. Для задач, допускающих множественные попытки (retry-tolerant agents), Kimi K3 становится рациональным выбором благодаря соотношению цены и качества на метрике pass@4.
Бенчмарки
| Бенчмарк | Kimi K3 | Claude Fable 5 |
|---|---|---|
| DeepSWE pass@1 | 68.5% | 69.9% |
| DeepSWE pass@2 | 82% | 80.2% |
| DeepSWE pass@4 | 89.4% | 88.5% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Together AI ↗
