Релиз модели7 августа 2026 г., 08:01 МСК🤖 Auto

DeepSeek-V4 Flash против GPT-5.6 Luna: кэскад дешевле и точнее

Together AI сравнил DeepSeek-V4 Flash и GPT-5.6 Luna на бенчмарке DeepSWE. Оказалось, что запуск дешевых моделей первым этапом с последующим эскалацией к флагману дает большую точность и экономию.

Баннер новости 5275

Результаты DeepSWE: Luna лидирует, но DeepSeek дешевле

В исследовании Together AI сравнивались две модели на 113 реальных задачах из открытых репозиториев (DeepSWE). GPT-5.6 Luna демонстрирует превосходство в качестве: pass@1 составляет 67.2% против 53.3% у DeepSeek-V4 Flash. Разрыв в 14 пунктов сохраняется при любом количестве попыток (k).

Однако экономика задачи меняется при параллельном запуске. DeepSeek-V4 Flash стоит $0.10 за rollout, тогда как Luna — $0.61. Это делает DeepSeek самой дешевой моделью на доске DeepSWE. За $100 DeepSeek решает 532 задачи, а Luna — лишь 110.

Сравнение характеристик и стоимости

Метрика GPT-5.6 Luna [max] DeepSeek-V4 Flash [max]
Pass@1 (точность) 67.2% ± 4% 53.3% ± 4%
Средняя стоимость $0.61 $0.10
Выходные токены (медиана) 73k 108k
Шаги (медиана) 102 153
Время выполнения (медиана) 16 мин 23 мин

Почему кэскад «DeepSeek → Luna» выигрывает

Ключевой вывод исследования: запуск DeepSeek первым этапом, с последующей эскалацией к Luna только при неудаче, решает 78.9% задач при стоимости $0.385 за задачу.

  • Точность: 78.9% против 67.2% у Luna alone (рост на 11.7 п.п.).
  • Экономия: На 37% дешевле, чем использование только Luna ($0.61).
  • Логика: DeepSeek очищает ~53% очереди за копейки, оставляя флагману только сложные случаи.

Слабые и сильные стороны моделей

GPT-5.6 Luna выигрывает в 7 из 8 доменов, особенно в задачах, требующих сложного рассуждения (анализ программ, конкурентность, внутренности языков). DeepSeek-V4 Flash уступает в JavaScript (35% против 60% у Luna) и Python (49% против 65%), но конкурентен в работе с SQL и конфигурационными языками (78% против 70%).

Также DeepSeek демонстрирует более «чистые» ошибки: при сбое он ломает существующий тест-сьюит в 9% случаев против 15% у Luna, что снижает риски регрессии при деплое.

Вывод для разработчиков

DeepSeek-V4 Flash не заменяет GPT-5.6 Luna как единственную модель для сложных инженерных задач. Однако его цена позволяет использовать его как «фильтр» в каскадной архитектуре. Это решение дает точность выше флагмана и стоимость ниже, чем у самого флагмана. Для стеков, тяжелых на JavaScript, DeepSeek может быть невыгоден, но для конфигурационных задач и SQL он эффективен.

Бенчмарки

БенчмаркDeepSeek-V4 Flash 0731GPT-5.6 Luna
DeepSWE53.3%67.2%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Together AI ↗