Методология: Реальные задачи, а не синтетика
В отличие от большинства бенчмарков, использующих изолированные задачи (например, LeetCode), этот тест проводился в условиях, максимально приближенных к реальной разработке. Автор использовал три различных кодовых базы (codebases) в течение двух недель. Целью было оценить не просто способность писать код, а умение агентов понимать контекст, рефакторить существующие модули и интегрировать изменения без нарушения логики приложения.
Ключевые метрики сравнения
Сравнение проводилось по трем основным критериям:
- Точность генерации (Accuracy): Процент кода, который работает с первого раза или требует минимальных правок.
- Контекстное понимание: Способность агента «читать» между строк, понимая архитектурные паттерны проекта.
- Скорость итерации: Время, затраченное на выполнение задачи от формулировки запроса до рабочего решения.
Результаты: Почему победитель удивил
Хотя Anthropic Claude Code и OpenAI Codex (на базе GPT-4o) демонстрировали схожие результаты в простых скриптах, в сложных проектах выявилась существенная разница. Codex часто страдал от «галлюцинаций» в части импорта библиотек и понимания локальных зависимостей, требуя ручной отладки. Claude Code, напротив, показал более высокую стабильность в работе с крупными файлами и сложной структурой директорий.
| Критерий | Claude Code | OpenAI Codex |
|---|---|---|
| Работа с контекстом | Высокая (лучшее удержание длинных диалогов) | Средняя (потеря контекста в длинных сессиях) |
| Рефакторинг | Безопасный, сохраняет структуру | Часто ломает связи между модулями |
| Сложные баги | Находит причину быстрее | Предлагает поверхностные решения |
Вывод для разработчиков
Тест показал, что для простых задач оба инструмента сопоставимы. Однако для работы с legacy-кодом и сложной архитектурой Claude Code продемонстрировал преимущество за счет более глубокого понимания семантики кода. Это важный сигнал для команд, выбирающих AI-ассистентов для production-среды: стабильность и предсказуемость важнее сырой скорости генерации.
Источник: Towards AI pub ↗
