Вышла версия v3.4.0.
PaddlePaddle/Paddle
PArallel Distributed Deep LEarning: фреймворк машинного обучения из промышленной практики (ядро «FeiJiang», высокопроизводительное обучение на одной машине и в распределённой среде, а также кроссплатформенное развёртывание для глубокого и машинного обучения)
Что это за инструмент
PaddlePaddle — это фреймворк глубокого обучения от Baidu, предназначенный для высокопроизводительного обучения и развертывания моделей в промышленных условиях.
Зачем нужен
Инструмент решает задачу создания, обучения и инференса нейросетей с акцентом на автоматизацию распределенных вычислений и оптимизацию производительности. Он полезен тем, кто хочет снизить затраты на разработку за счет единой среды для разных этапов работы с моделями и поддержки широкого спектра аппаратного обеспечения.
Что можно реализовать
- Обучение и инференс больших языковых моделей (LLM) в едином фреймворке
- Научные вычисления, требующие дифференцирования высокого порядка (математика, физика, метеорология)
- Развертывание генеративных моделей и моделей для компьютерного зрения на разнородном оборудовании
- Промышленная автоматизация в секторах производства, сельского хозяйства и корпоративных услуг
Ключевые возможности
- Автоматическое обнаружение стратегий распределенного параллелизма с минимальными аннотациями
- Единый фреймворк для обучения и инференса больших моделей (code reuse)
- Поддержка дифференцирования высокого порядка, комплексных чисел и преобразования Фурье
- Нейросетевой компилятор для баланса между гибкостью и высокой производительностью
- Готовая адаптация под разнородные чипы через стандартизированные интерфейсы
👤 Кому подойдёт: Разработчики AI, инженеры по машинному обучению, исследователи в области научных вычислений и компании, внедряющие AI в промышленные процессы
Релизы
PaddlePaddle 3.3: ускорение обучения через FlashMaskV3 и FlexCheckpoint, поддержка FSDP, виртуальной памяти и отладки динамического графа.
- Added: FlashMaskV3: оптимизация稀疏-аттеншена, производительность до 2.1x выше FlexAttention и на 80% быстрее Megatron-LM в распределенных сценариях.
- Added: FlexCheckpoint: система автоматического разделения и重组 весов на языке AOA, конвертация параметров в 1.2 раза быстрее Megatron-LM.
- Added: VMM Allocator: динамическая дефрагментация видеопамяти на основе виртуальной памяти, снижение фрагментации в MoE-моделях до 3%.
- Added: Автопараллелизм: добавлена поддержка стратегии FSDP и вычисление высших порядков дифференцирования (高阶微分).
- Added: Отладка и совместимость: визуализация вычислительного графа, инструменты мониторинга памяти, поддержка Python 3.14 и внешних библиотек (FlashInfer, DeepGEMM).