Прорыв в эффективности: SWE-2 против лидеров рынка
Cognition официально выпустила SWE-2, новую версию своего AI-агента для разработки, базирующуюся на модели Kimi K3 (2.8 трлн параметров). Главная особенность SWE-2 — достижение 50.0% на бенчмарке FrontierCode 1.1 Main при стоимости, которая на 64% ниже, чем у Fable 5.1. Модель демонстрирует лучшие показатели по соотношению «цена-качество» на рынке, обходя Grok 4.6 и GPT-5.6 Sol, и приближаясь к GPT-6 Astra при четверти стоимости.
Сравнительные метрики производительности
Ниже приведены результаты тестирования SWE-2 и ключевых конкурентов на основных бенчмарках для кодовых агентов. SWE-2 показывает стабильно высокие результаты, особенно в задачах, требующих глубокого анализа кодовой базы (DeepSWE) и работы с терминалом (Terminal-Bench 2.1).
| Бенчмарк | SWE-2 | Kimi K3 (Base) | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra |
|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0 | 44.2 | 48.0 | 50.9 | 47.5 | 53.3 |
| 73.0 | 68.5 | 67.5 | 67.4 | 72.7 | 74.1 | |
| Terminal-Bench 2.1 | 92.8 | 88.3 | 88.4 | 91.4 | 88.8 | 89.9 |
| Terminal-Bench 4 | 27.3 | 21.5 | 20.3 | 55.8 | 37.3 | 57.9 |
Революция в обучении: RL в режиме мульти-триллионных параметров
Ключевое техническое достижение SWE-2 — первое в индустрии масштабирование обучения с подкреплением (RL) до режима мульти-триллионных параметров. Cognition внедрила новый алгоритм, который обучает все уровни «усилия» (effort levels) за один проход. Это позволяет оптимизировать всю Парето-границу (соотношение стоимости и качества) одновременно, а не точечно. Используется линейная штрафная функция за стоимость, настроенная на основе базовой модели, что отражает реальные затраты пользователей.
Поведенческие изменения: меньше шагов, больше результата
SWE-2 стал значительно эффективнее в использовании ресурсов. На тестовой выборке FrontierCode 1.1 Main модель уровня SWE-2 medium решает задачи, делая в среднем 53 шага, против 127 шагов у предшественника SWE-1.7. Это сокращает количество итераций на 58% и снижает стоимость выполнения на 81%.
- Фокусированное исследование: SWE-2 начинает писать код после медианы 18 шагов (против 48 у SWE-1.7), быстрее отсеивая нерелевантные части кодовой базы.
- Проверка гипотез: Модель склонна перепроверять выводы пользователя и запускать артефакты для сбора доказательств, а не слепо соглашаться.
- Ресурсоустойчивость: При блокировке стандартных путей (например, недоступность MCP-интеграции) SWE-2 самостоятельно восстанавливает данные из доступных источников (например, истории Slack).
Доступность
Модель SWE-2 уже доступна пользователям через Devin Desktop и CLI. Постепенно она будет развернута в веб-версии Devin и платформе Fusion.
Бенчмарки
| Бенчмарк | SWE-2 | Fable 5.1 | Grok 4.6 | Kimi K3 |
|---|---|---|---|---|
| FrontierCode 1.1 Main | 50% | 50.9% | 48% | 44.2% |
| DeepSWE 1.1 | 73% | 67.4% | 67.5% | 68.5% |
| Terminal-Bench 2.1 | 92.8% | 91.4% | 88.4% | 88.3% |
| Terminal-Bench 4 | 27.3% | 55.8% | 20.3% | 21.5% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Cognition ↗
