Суть обновления: от SWE-1.7 к SWE-2
Cognition, создатель агента Devin, выпустила SWE-2 — свою самую мощную кодовую модель на сегодняшний день. В отличие от предшественника SWE-1.7, который базировался на Kimi K2.7, новая модель использует в качестве базы открытую модель Moonshot AI Kimi K3 с 2.8 триллионами параметров. Ключевое нововведение — возможность выбора уровня усилий (effort levels) для рассуждений, причем все три уровня обучены в рамках одного запуска обучения с подкреплением (RL).
Бенчмарки и сравнение с конкурентами
Согласно данным Cognition, SWE-2 набирает 50.0% на FrontierCode 1.1 Main, что всего на 1 процентный пункт уступает лидеру Fable 5.1 (50.9%), но при этом обходится на 64% дешевле. Модель демонстрирует превосходство над базовой Kimi K3 во всех тестах, добавляя 5-6 пунктов за счет RL-дообучения. Однако на сложном наборе Terminal-Bench 4 модель показывает слабые результаты (27.3% против 55.8% у Fable 5.1).
| Бенчмарк | SWE-2 | Kimi K3 | Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 44.2% | 50.9% | 53.3% |
| DeepSWE 1.1 | 73.0% | 68.5% | 67.4% | 74.1% |
| Terminal-Bench 2.1 | 92.8% | 88.3% | 91.4% | 89.9% |
| Terminal-Bench 4 | 27.3% | 21.5% | 55.8% | 57.9% |
Эффективность и экономия ресурсов
Главное преимущество SWE-2 — радикальное снижение избыточных действий. По сравнению с SWE-1.7, версия SWE-2 Medium совершает на 58% меньше ходов (turns) и стоит на 81% дешевле. Среднее количество шагов на запуск сократилось с 127 до 53. Модель стала более «сфокусированной»: медиана первого реального редактирования кода упала с 48 шагов до 18. Cognition отмечает, что модель лучше покрывает тесты end-to-end и проявляет дисциплину при проверке результатов, пере deriving выводы вместо их простого повторения.
Технические детали обучения
Обучение проводилось с использованием алгоритма, учитывающего парето-оптимальность затрат. Функция вознаграждения выглядит как R = S - lambda * C, где S — успех, а C — стоимость. Это позволяет двигать всю кривую «стоимость-производительность» одновременно. Также использовалось специкулятивное декодирование DSpark и квантование NVFP4/FP8 для снижения потребления памяти. Данные для обучения были расширены: количество RL-окружений утроено, а верификаторы улучшены за счет флайвheels с использованием предыдущих чекпоинтов SWE-2.
Доступность и безопасность
Важно отметить: SWE-2 не имеет открытых весов и отдельного API. Модель доступна исключительно внутри экосистемы Devin (Desktop, CLI, Web). Бесплатный доступ для платных подписчиков продлен до 10 октября 2026 года. Cognition также провела проверку на доверенность: на 145 политических вопросах, связанных с Китаем, модель прошла тест на 98.0% (99.8% на английском, 95.2% на упрощенном китайском), не показав статистически значимых изменений в зависимости от формулировок запроса.
Бенчмарки
| Бенчмарк | SWE-2 | Fable 5.1 | Grok 4.6 | Kimi K3 |
|---|---|---|---|---|
| FrontierCode 1.1 Main | 50% | 50.9% | 48% | 44.2% |
| DeepSWE 1.1 | 73% | 67.4% | 67.5% | 68.5% |
| Terminal-Bench 2.1 | 92.8% | 91.4% | 88.4% | 88.3% |
| Terminal-Bench 4 | 27.3% | 55.8% | 20.3% | 21.5% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
