deepseek-ai/DeepSeek-V3

LLM⭐ 104 473Pythonпоследний релиз: v1.0.0
Открыть на GitHub ↗

Что это за инструмент

DeepSeek-V3 — это мощная языковая модель архитектуры MoE с 671 млрд параметров (37 млрд активных), сочетающая высокую производительность с эффективностью обучения.

Зачем нужен

Инструмент решает задачу создания сильных open-source LLM, способных конкурировать с закрытыми аналогами, при этом значительно снижая затраты на обучение за счет использования FP8 и оптимизированной архитектуры. Он полезен для разработчиков, которым нужны качественные модели для локального развертывания или дообучения без огромных вычислительных бюджетов.

Что можно реализовать

  • Локальное развертывание мощного LLM для корпоративных задач с использованием vLLM или аналогичных фреймворков
  • Использование Multi-Token Prediction (MTP) для ускорения инференса через speculative decoding
  • Дообучение (fine-tuning) модели под специфические домены благодаря открытому коду (MIT License)
  • Исследование и применение архитектуры DeepSeekMoE и Multi-head Latent Attention (MLA) в собственных проектах

Ключевые возможности

  • Архитектура Mixture-of-Experts (MoE): 671B параметров, но активируется только 37B на токен, что обеспечивает эффективность
  • Инновационные методы обучения: отсутствие auxiliary-loss для балансировки нагрузки и стратегия Multi-Token Prediction
  • Экономичное обучение: использование FP8 mixed precision и оптимизация коммуникации позволили сократить затраты на пре-тренинг
  • Улучшенные способности к рассуждению (reasoning) благодаря дистилляции знаний от модели DeepSeek-R1
  • Длинный контекст: поддержка окна в 128K токенов

👤 Кому подойдёт: разработчики, ML-инженеры, исследователи, компании, ищущие эффективные open-source LLM для локального использования

Релизы

v1.0.0patch
🕐 15 мес назад · релиз на GitHub ↗

Релиз DeepSeek-V3 v1.0.0 выпущен исключительно для архивных целей и генерации DOI.

  • Релиз создан для архивирования и генерации DOI.