Суть сравнения: от промпта до Pull Request
Аналитики MarkTechPost провели практическое тестирование четырех ведущих AI-агентов для разработчиков: Mistral Vibe for Code, Claude Code, Cursor и OpenAI Codex. Задача была не тривиальной: агент должен был самостоятельно создать функционал в существующем Python/FastAPI сервисе, написать и запустить тесты, исправить ошибки и оформить Pull Request. Оценка проводилась по пяти параметрам: создание структуры кода (scaffolding), цикл тестирования, работа с PR, покрытие интерфейсов и стоимость/контроль.
Результаты: лидерство Mistral за счет архитектуры и цены
Победителем с результатом 22 из 25 стал Mistral Vibe for Code. Его преимущество обусловлено уникальным предложением: возможностью самохостинга, тонкой настройки на проприетарном коде и соблюдением требований к хранению данных в ЕС. В отличие от конкурентов, Mistral предлагает открытую CLI-версию под лицензией Apache 2.0 и модель Devstral 2 (123B параметров) с контекстным окном 256K, которая демонстрирует 72.2% на бенчмарке SWE-bench Verified.
Второе место разделили Claude Code и OpenAI Codex (по 21 балл). Claude Code выигрывает за счет глубины интеграции и мощных параллельных вычислений, но проигрывает в стоимости и отсутствии открытого кода. Codex предлагает удобную кросс-платформенность, но сталкивается с ограничениями по времени сессий и высокими расходами при активном использовании.
| Инструмент | Общий балл | Ключевая модель | Цена (Pro/Team) | Главное преимущество |
|---|---|---|---|---|
| Mistral Vibe for Code | 22/25 | Devstral 2 / Mistral Medium 3.5 | $14.99 / $24.99/пользователь | Самохостинг, Apache 2.0, низкая цена |
| Claude Code | 21/25 | Claude Opus 4.8 | $20 / $100+ (Max 5x) | Глубина hooks, параллельные подагенты |
| OpenAI Codex | 21/25 | GPT-5.6 (Sol/Terra/Luna) | $20 / $100 (Pro 5x) | Кросс-платформенность, sandbox |
| Cursor | 16/25 | Composer 2.5 | $20 / $40/пользователь | Лучший inline-редактор, IDE-first |
Детали по лидерам
- Mistral Vibe for Code: Единственный инструмент, предлагающий тариф для студентов за $5.99 и возможность развертывания в private cloud. Модель Devstral Small 2 (24B) доступна для запуска на потребительском оборудовании. Однако есть нюансы: CLI оптимизирована под UNIX, а на Windows требуется пилотное тестирование.
- Claude Code: Лидер по «сырому» качеству кода и сложности задач. Anthropic заявляет о возможности портирования сотен тысяч строк кода с высоким процентом прохождения тестов. Главный минус — высокая стоимость токенов при параллельных запусках и полное отсутствие открытой версии.
- OpenAI Codex: Интегрирован с GPT-5.6, выпущенной в июле 2026 года. Предлагает гибкую тарификацию, но разработчики жалуются на быстрое исчерпание лимитов в рамках 5-часового окна. Оценочная стоимость для команды может достигать $100–200 на разработчика в месяц.
Почему это важно
Рынок AI-ассистентов для кода переходит от простых автодополнений к автономным агентам, способным выполнять полноценные инженерные задачи. Победа Mistral сигнализирует о тренде на контроль и экономию: компании все чаще выбирают решения, позволяющие хранить данные внутри периметра безопасности и избегать lock-in у крупных вендоров. Cursor, несмотря на популярность как IDE, показал худший результат в сценарии автономной разработки, что подчеркивает разницу между «помощником в редакторе» и «полноценным инженерным агентом».
Бенчмарки
| Бенчмарк | Devstral 2 | Devstral Small 2 |
|---|---|---|
| SWE-bench Verified | 72.2% | 68% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
