Результаты DeepSWE: Luna лидирует, но DeepSeek дешевле
В исследовании Together AI сравнивались две модели на 113 реальных задачах из открытых репозиториев (DeepSWE). GPT-5.6 Luna демонстрирует превосходство в качестве: pass@1 составляет 67.2% против 53.3% у DeepSeek-V4 Flash. Разрыв в 14 пунктов сохраняется при любом количестве попыток (k).
Однако экономика задачи меняется при параллельном запуске. DeepSeek-V4 Flash стоит $0.10 за rollout, тогда как Luna — $0.61. Это делает DeepSeek самой дешевой моделью на доске DeepSWE. За $100 DeepSeek решает 532 задачи, а Luna — лишь 110.
Сравнение характеристик и стоимости
| Метрика | GPT-5.6 Luna [max] | DeepSeek-V4 Flash [max] |
|---|---|---|
| Pass@1 (точность) | 67.2% ± 4% | 53.3% ± 4% |
| Средняя стоимость | $0.61 | $0.10 |
| Выходные токены (медиана) | 73k | 108k |
| Шаги (медиана) | 102 | 153 |
| Время выполнения (медиана) | 16 мин | 23 мин |
Почему кэскад «DeepSeek → Luna» выигрывает
Ключевой вывод исследования: запуск DeepSeek первым этапом, с последующей эскалацией к Luna только при неудаче, решает 78.9% задач при стоимости $0.385 за задачу.
- Точность: 78.9% против 67.2% у Luna alone (рост на 11.7 п.п.).
- Экономия: На 37% дешевле, чем использование только Luna ($0.61).
- Логика: DeepSeek очищает ~53% очереди за копейки, оставляя флагману только сложные случаи.
Слабые и сильные стороны моделей
GPT-5.6 Luna выигрывает в 7 из 8 доменов, особенно в задачах, требующих сложного рассуждения (анализ программ, конкурентность, внутренности языков). DeepSeek-V4 Flash уступает в JavaScript (35% против 60% у Luna) и Python (49% против 65%), но конкурентен в работе с SQL и конфигурационными языками (78% против 70%).
Также DeepSeek демонстрирует более «чистые» ошибки: при сбое он ломает существующий тест-сьюит в 9% случаев против 15% у Luna, что снижает риски регрессии при деплое.
Вывод для разработчиков
DeepSeek-V4 Flash не заменяет GPT-5.6 Luna как единственную модель для сложных инженерных задач. Однако его цена позволяет использовать его как «фильтр» в каскадной архитектуре. Это решение дает точность выше флагмана и стоимость ниже, чем у самого флагмана. Для стеков, тяжелых на JavaScript, DeepSeek может быть невыгоден, но для конфигурационных задач и SQL он эффективен.
Бенчмарки
| Бенчмарк | DeepSeek-V4 Flash 0731 | GPT-5.6 Luna |
|---|---|---|
| DeepSWE | 53.3% | 67.2% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Together AI ↗
