Релиз модели24 июля 2026 г., 21:00 МСК🤖 Auto

Kimi K3 против Claude Fable 5: Open-модель бьет флагман по цене и pass@4

Together AI провели сравнение Kimi K3 и Claude Fable 5 на бенчмарке DeepSWE. Kimi K3 уступает в надежности первого запуска, но выигрывает при множественных попытках и стоит в 3 раза дешевле.

Баннер новости 4321

Результаты DeepSWE: качество и стоимость

В исследовании Together AI сравниваются Kimi K3 (от Moonshot AI) и Claude Fable 5 (Anthropic) на наборе данных DeepSWE, который тестирует способности к программной инженерии. Тест включает 113 реальных запросов на добавление функций из открытых репозиториев. Ключевой вывод: Kimi K3 демонстрирует сопоставимое качество, но обходится значительно дешевле, что делает его привлекательным выбором для высоконагруженных задач.

Метрика Claude Fable 5 (xhigh) Kimi K3 (max) Разница / Примечание
Pass@1 (успех с 1-й попытки) 69.9% 68.5% Fable лидирует на 1.4 п.п.
Pass@2 (успех в 2 попытках) 80.2% 82.0% Kimi K3 лидирует
Pass@4 (успех в 4 попытках) 88.5% 89.4% Kimi K3 лидирует, лучший результат среди флагманов
Стоимость за rollout $13.41 $4.65 Kimi K3 в ~3 раза дешевле
Стоимость полного теста (452 rollout) $6,010 $2,103 Экономия ~$3,900
Решенных задач на $100 5.3 14.7 Kimi K3 в 2.8 раза эффективнее по деньгам

Надежность против охвата

Модели занимают разные позиции в зависимости от метрики. Claude Fable 5 более детерминирован: он решает 58 задач «четверо-на-четверо» (4/4), тогда как Kimi K3 — 45. Однако Kimi K3 имеет более широкий «охват» (coverage): он хотя бы раз решает 89.4% задач (лишь 12 задач остаются нерешенными), в то время как Fable 5 не решает 13 задач. Это объясняет преимущество Kimi K3 при увеличении числа попыток (pass@2, pass@4).

Сравнение по языкам программирования

Kimi K3 демонстрирует явное преимущество в Go (79% против 71% у Fable 5). Claude Fable 5 лидирует в Python, JavaScript, TypeScript и Rust. Примечательно, что Kimi K3 практически догнал Fable 5 по Rust, показав результат 65% против 75% (в абсолютных значениях успеха), что делает его одним из лучших моделей для работы с Rust среди доступных опций.

Корреляция и стоимость ошибок

Корреляция между моделями на уровне отдельных задач составляет 0.72 — это самый высокий показатель кросс-вендорного сходства в истории бенчмарка. Модели часто терпят неудачу на одних и тех же задачах (65% сбоев — «почти успех» для обеих). Объединение их результатов покрывает 105 из 113 задач, что дает лишь незначительное преимущество диверсификации по сравнению с использованием только Kimi K3.

Почему это важно

Главное преимущество Kimi K3 — его open-weight статус. Это позволяет компаниям развертывать модель на собственной инфраструктуре, оптимизировать инференс и снижать затраты еще больше, чем при использовании API. Для задач, допускающих множественные попытки (retry-tolerant agents), Kimi K3 становится рациональным выбором благодаря соотношению цены и качества на метрике pass@4.

Бенчмарки

БенчмаркKimi K3Claude Fable 5
DeepSWE pass@168.5%69.9%
DeepSWE pass@282%80.2%
DeepSWE pass@489.4%88.5%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Together AI ↗