Релиз модели3 октября 2026 г., 22:18 МСК🤖 Auto

DeepSeek V4 против Qwen 3.8: честное тестирование 113 задач по коду

Независимое тестирование 4 открытых LLM на реальных задачах программирования выявило лидера по соотношению цена/качество. DeepSeek V4 показал лучшую точность, но Qwen 3.8 оказался экономичнее.

Баннер новости 8871

Методология: 113 задач, 4 попытки, реальный счет

В отличие от стандартных бенчмарков, авторы теста отказались от табличных данных от вендоров. Был проведен независимый запуск четырех моделей на 113 реальных задачах по написанию кода. Каждая модель выполняла каждую задачу 4 раза, что позволило оценить не только среднюю точность, но и стабильность результатов. Ключевым фактором стало включение в отчет реальных затрат на вычислительные ресурсы (инференс), что делает сравнение финансово прозрачным.

Участники сравнения

В тесте приняли участие четыре актуальные открытые модели, которые на данный момент считаются лидерами в классе open-weight LLM для разработки ПО:

  • DeepSeek V4 — флагманская модель от DeepSeek, известная сложной архитектурой MoE.
  • Qwen 3.8 — обновленная версия от Alibaba, демонстрирующая высокую эффективность.
  • Kimi K3 — модель от Moonshot AI, ориентированная на длинные контексты и логику.
  • GLM-5.3 — новая версия от команды Zhipu AI, улучшающая базовые языковые способности.

Результаты: Точность против Цены

Основной вывод исследования заключается в том, что абсолютный лидер по качеству кода (точность решения задач) не всегда является самым выгодным выбором. DeepSeek V4 продемонстрировал наивысший процент успешных решений, однако стоимость его инференса оказалась значительно выше. Qwen 3.8, в свою очередь, показал результаты, близкие к лидеру, но при существенно меньших затратах на каждый запрос.

Модель Рейтинг качества кода Экономическая эффективность Ключевая особенность
DeepSeek V4 Высокий (Лидер) Низкая (Высокая стоимость) Сложная архитектура, максимальная точность
Qwen 3.8 Высокий (Близко к лидеру) Высокая (Оптимальная цена) Баланс скорости и стоимости
Kimi K3 Средне-высокий Средняя Работа с длинным контекстом
GLM-5.3 Средне-высокий Средняя Улучшенные базовые языковые навыки

Почему это важно для разработчиков

Для команд, внедряющих LLM в CI/CD пайплайны или для автодополнения кода, выбор модели теперь должен основываться не только на синтетических бенчмарках (MMLU, HumanEval), но и на реальной стоимости инференса. Тест показывает, что переплата за DeepSeek V4 оправдана только в задачах, требующих максимальной точности, тогда как для рутинных задач Qwen 3.8 предлагает лучшее соотношение цены и качества.

Источник: Towards AI pub ↗