PaddlePaddle/Paddle

PArallel Distributed Deep LEarning: фреймворк машинного обучения из промышленной практики (ядро «FeiJiang», высокопроизводительное обучение на одной машине и в распределённой среде, а также кроссплатформенное развёртывание для глубокого и машинного обучения)

Прочее⭐ 24 098C++последний релиз: v3.4.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

PaddlePaddle — это фреймворк глубокого обучения от Baidu, предназначенный для высокопроизводительного обучения и развертывания моделей в промышленных условиях.

Зачем нужен

Инструмент решает задачу создания, обучения и инференса нейросетей с акцентом на автоматизацию распределенных вычислений и оптимизацию производительности. Он полезен тем, кто хочет снизить затраты на разработку за счет единой среды для разных этапов работы с моделями и поддержки широкого спектра аппаратного обеспечения.

Что можно реализовать

  • Обучение и инференс больших языковых моделей (LLM) в едином фреймворке
  • Научные вычисления, требующие дифференцирования высокого порядка (математика, физика, метеорология)
  • Развертывание генеративных моделей и моделей для компьютерного зрения на разнородном оборудовании
  • Промышленная автоматизация в секторах производства, сельского хозяйства и корпоративных услуг

Ключевые возможности

  • Автоматическое обнаружение стратегий распределенного параллелизма с минимальными аннотациями
  • Единый фреймворк для обучения и инференса больших моделей (code reuse)
  • Поддержка дифференцирования высокого порядка, комплексных чисел и преобразования Фурье
  • Нейросетевой компилятор для баланса между гибкостью и высокой производительностью
  • Готовая адаптация под разнородные чипы через стандартизированные интерфейсы

👤 Кому подойдёт: Разработчики AI, инженеры по машинному обучению, исследователи в области научных вычислений и компании, внедряющие AI в промышленные процессы

Релизы

v3.3.0major
🕐 7 мес назад · релиз на GitHub ↗

PaddlePaddle 3.3: ускорение обучения через FlashMaskV3 и FlexCheckpoint, поддержка FSDP, виртуальной памяти и отладки динамического графа.

  • Added: FlashMaskV3: оптимизация稀疏-аттеншена, производительность до 2.1x выше FlexAttention и на 80% быстрее Megatron-LM в распределенных сценариях.
  • Added: FlexCheckpoint: система автоматического разделения и重组 весов на языке AOA, конвертация параметров в 1.2 раза быстрее Megatron-LM.
  • Added: VMM Allocator: динамическая дефрагментация видеопамяти на основе виртуальной памяти, снижение фрагментации в MoE-моделях до 3%.
  • Added: Автопараллелизм: добавлена поддержка стратегии FSDP и вычисление высших порядков дифференцирования (高阶微分).
  • Added: Отладка и совместимость: визуализация вычислительного графа, инструменты мониторинга памяти, поддержка Python 3.14 и внешних библиотек (FlashInfer, DeepGEMM).