Релиз модели13 сентября 2026 г., 04:17 МСК🤖 Auto

Cognition SWE-2: Кодовая модель на базе Kimi K3 с выбором уровня рассуждений

Cognition представила SWE-2 — первую модель с настраиваемым уровнем рассуждений, обученную на базе Kimi K3. Модель достигает 50% на FrontierCode при стоимости на 64% ниже, чем у Fable 5.1, и работает только внутри агента Devin.

Баннер новости 7379

Суть обновления: от SWE-1.7 к SWE-2

Cognition, создатель агента Devin, выпустила SWE-2 — свою самую мощную кодовую модель на сегодняшний день. В отличие от предшественника SWE-1.7, который базировался на Kimi K2.7, новая модель использует в качестве базы открытую модель Moonshot AI Kimi K3 с 2.8 триллионами параметров. Ключевое нововведение — возможность выбора уровня усилий (effort levels) для рассуждений, причем все три уровня обучены в рамках одного запуска обучения с подкреплением (RL).

Бенчмарки и сравнение с конкурентами

Согласно данным Cognition, SWE-2 набирает 50.0% на FrontierCode 1.1 Main, что всего на 1 процентный пункт уступает лидеру Fable 5.1 (50.9%), но при этом обходится на 64% дешевле. Модель демонстрирует превосходство над базовой Kimi K3 во всех тестах, добавляя 5-6 пунктов за счет RL-дообучения. Однако на сложном наборе Terminal-Bench 4 модель показывает слабые результаты (27.3% против 55.8% у Fable 5.1).

Бенчмарк SWE-2 Kimi K3 Fable 5.1 GPT-6 Astra
FrontierCode 1.1 Main 50.0% 44.2% 50.9% 53.3%
DeepSWE 1.1 73.0% 68.5% 67.4% 74.1%
Terminal-Bench 2.1 92.8% 88.3% 91.4% 89.9%
Terminal-Bench 4 27.3% 21.5% 55.8% 57.9%

Эффективность и экономия ресурсов

Главное преимущество SWE-2 — радикальное снижение избыточных действий. По сравнению с SWE-1.7, версия SWE-2 Medium совершает на 58% меньше ходов (turns) и стоит на 81% дешевле. Среднее количество шагов на запуск сократилось с 127 до 53. Модель стала более «сфокусированной»: медиана первого реального редактирования кода упала с 48 шагов до 18. Cognition отмечает, что модель лучше покрывает тесты end-to-end и проявляет дисциплину при проверке результатов, пере deriving выводы вместо их простого повторения.

Технические детали обучения

Обучение проводилось с использованием алгоритма, учитывающего парето-оптимальность затрат. Функция вознаграждения выглядит как R = S - lambda * C, где S — успех, а C — стоимость. Это позволяет двигать всю кривую «стоимость-производительность» одновременно. Также использовалось специкулятивное декодирование DSpark и квантование NVFP4/FP8 для снижения потребления памяти. Данные для обучения были расширены: количество RL-окружений утроено, а верификаторы улучшены за счет флайвheels с использованием предыдущих чекпоинтов SWE-2.

Доступность и безопасность

Важно отметить: SWE-2 не имеет открытых весов и отдельного API. Модель доступна исключительно внутри экосистемы Devin (Desktop, CLI, Web). Бесплатный доступ для платных подписчиков продлен до 10 октября 2026 года. Cognition также провела проверку на доверенность: на 145 политических вопросах, связанных с Китаем, модель прошла тест на 98.0% (99.8% на английском, 95.2% на упрощенном китайском), не показав статистически значимых изменений в зависимости от формулировок запроса.

Бенчмарки

БенчмаркSWE-2Fable 5.1Grok 4.6Kimi K3
FrontierCode 1.1 Main50%50.9%48%44.2%
DeepSWE 1.173%67.4%67.5%68.5%
Terminal-Bench 2.192.8%91.4%88.4%88.3%
Terminal-Bench 427.3%55.8%20.3%21.5%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗