Релиз модели14 сентября 2026 г., 17:47 МСК🤖 Auto

Cognition SWE-2: 50% на FrontierCode и на 64% дешевле конкурентов

Cognition представила SWE-2 — самую мощную модель для программирования, которая обходит Grok 4.6 и GPT-5.6 Sol по соотношению цена/качество, используя RL-обучение на триллионных параметрах.

Баннер новости 7460

Прорыв в эффективности: SWE-2 против лидеров рынка

Cognition официально выпустила SWE-2, новую версию своего AI-агента для разработки, базирующуюся на модели Kimi K3 (2.8 трлн параметров). Главная особенность SWE-2 — достижение 50.0% на бенчмарке FrontierCode 1.1 Main при стоимости, которая на 64% ниже, чем у Fable 5.1. Модель демонстрирует лучшие показатели по соотношению «цена-качество» на рынке, обходя Grok 4.6 и GPT-5.6 Sol, и приближаясь к GPT-6 Astra при четверти стоимости.

Сравнительные метрики производительности

Ниже приведены результаты тестирования SWE-2 и ключевых конкурентов на основных бенчмарках для кодовых агентов. SWE-2 показывает стабильно высокие результаты, особенно в задачах, требующих глубокого анализа кодовой базы (DeepSWE) и работы с терминалом (Terminal-Bench 2.1).

d>DeepSWE 1.1
Бенчмарк SWE-2 Kimi K3 (Base) Grok 4.6 Fable 5.1 GPT-5.6 Sol GPT-6 Astra
FrontierCode 1.1 Main 50.0 44.2 48.0 50.9 47.5 53.3
73.0 68.5 67.5 67.4 72.7 74.1
Terminal-Bench 2.1 92.8 88.3 88.4 91.4 88.8 89.9
Terminal-Bench 4 27.3 21.5 20.3 55.8 37.3 57.9

Революция в обучении: RL в режиме мульти-триллионных параметров

Ключевое техническое достижение SWE-2 — первое в индустрии масштабирование обучения с подкреплением (RL) до режима мульти-триллионных параметров. Cognition внедрила новый алгоритм, который обучает все уровни «усилия» (effort levels) за один проход. Это позволяет оптимизировать всю Парето-границу (соотношение стоимости и качества) одновременно, а не точечно. Используется линейная штрафная функция за стоимость, настроенная на основе базовой модели, что отражает реальные затраты пользователей.

Поведенческие изменения: меньше шагов, больше результата

SWE-2 стал значительно эффективнее в использовании ресурсов. На тестовой выборке FrontierCode 1.1 Main модель уровня SWE-2 medium решает задачи, делая в среднем 53 шага, против 127 шагов у предшественника SWE-1.7. Это сокращает количество итераций на 58% и снижает стоимость выполнения на 81%.

  • Фокусированное исследование: SWE-2 начинает писать код после медианы 18 шагов (против 48 у SWE-1.7), быстрее отсеивая нерелевантные части кодовой базы.
  • Проверка гипотез: Модель склонна перепроверять выводы пользователя и запускать артефакты для сбора доказательств, а не слепо соглашаться.
  • Ресурсоустойчивость: При блокировке стандартных путей (например, недоступность MCP-интеграции) SWE-2 самостоятельно восстанавливает данные из доступных источников (например, истории Slack).

Доступность

Модель SWE-2 уже доступна пользователям через Devin Desktop и CLI. Постепенно она будет развернута в веб-версии Devin и платформе Fusion.

Бенчмарки

БенчмаркSWE-2Fable 5.1Grok 4.6Kimi K3
FrontierCode 1.1 Main50%50.9%48%44.2%
DeepSWE 1.173%67.4%67.5%68.5%
Terminal-Bench 2.192.8%91.4%88.4%88.3%
Terminal-Bench 427.3%55.8%20.3%21.5%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Cognition ↗