Релиз модели18 сентября 2026 г., 15:50 МСК🤖 Auto

Kodacode обогнал Claude Code и KiloCode в тестировании DeepSeek V4 Flash

Российский стартап Kodacode представил результаты бенчмарка агентных оболочек: на модели DeepSeek V4 Flash их харнесс показал лучший результат (52,2%), превзойдя конкурентов на 2,7 п.п.

Баннер новости 7800

Суть эксперимента: изоляция качества модели от качества оболочки

Ключевая проблема при оценке AI-ассистентов — разделение качества самой языковой модели (LLM) и эффективности агентной оболочки (харнесса), через которую модель взаимодействует с кодом. Kodacode провел сравнительное тестирование, используя одну и ту же модель DeepSeek V4 Flash с одинаковыми параметрами рассуждения в пяти разных средах: Koda, OpenCode, KiloCode, Claude Code и Ouroboros.

Выбор бюджетной, но популярной модели DeepSeek V4 Flash позволил провести масштабные замеры, не превышая разумных бюджетов. Эксперимент показал, что даже при фиксированной модели реализация агентного цикла (поиск файлов, обработка ошибок, управление контекстом) критически влияет на итоговый результат.

Результаты: Koda лидирует на уровне Max

На максимальном уровне рассуждений (Max) оболочка Kodacode продемонстрировала лучший результат по Индексу Кода. Разница с ближайшим конкурентом составила 2,7 процентных пункта, что в контексте сложных кодовых задач является существенным преимуществом.

Оболочка (Харнесс) Индекс Кода (Max) Индекс Кода (Medium)
Koda 52,2% 46,3%
KiloCode 49,5% 44,9%
Claude Code 48,2% 46,9%
OpenCode 47,6% 43,4%
Ouroboros 45,8%

Интересно, что на уровне Medium (Medium) результаты оказались плотнее, а Claude Code даже обошла Kodacode (46,9% против 46,3%), что указывает на различия в оптимизации оболочек под разные уровни вычислительных ресурсов и времени на рассуждение.

Методология: Индекс Кода и строгие условия

Для оценки использовался собственный метрический показатель — Индекс Кода, рассчитанный на базе 261 задачи из открытых бенчмарков. Тестирование проводилось в изолированной песочнице без доступа к интернету и истории git, что исключало возможность «подсмотреть» готовые решения или использовать внешние патчи.

Задачи разделены на три категории, вес которых учитывается в формуле:

  • Разработка в существующей базе (125 задач): SWE-bench Verified, Multilingual (Java, Go, JS/TS), WebApp1K. Агент должен исправить баг в реальном репозитории, не ломая существующие тесты.
  • Проектирование ПО (45 задач): Самая сложная категория с весом x2.5. Включает SWE-bench Pro, NL2RepoBench, ProgramBench. Агенту нужно спроектировать и реализовать проект с нуля, который успешно собирается и проходит тесты.
  • Анализ данных: Задачи на обработку и визуализацию данных.

Почему это важно

Результаты подтверждают, что выбор агентной оболочки так же важен, как и выбор модели. Даже используя одну и ту же мощную модель DeepSeek V4 Flash, разработчики могут получить разницу в эффективности решения задач почти в 3% просто за счет смены интерфейса и логики взаимодействия. Для команд, использующих open-source модели, это означает возможность повысить продуктивность без увеличения затрат на API, если правильно настроить окружение.

Источник: Habr ↗