volcengine/veScale

Byted PyTorch Distributed для гипермасштабируемого обучения LLM и RL

Обучение⭐ 1 040Python
Открыть на GitHub ↗

Что это за инструмент

veScale — это внутренняя библиотека распределенного обучения PyTorch от ByteDance, открытая для сообщества, предназначенная для гипермасштабного обучения больших языковых моделей (LLM) и моделей обучения с подкреплением (RL).

Зачем нужен

Инструмент решает задачу эффективного распределенного обучения моделей на огромных кластерах, обеспечивая высокую производительность и гибкость. Он полезен для оптимизации процессов обучения, где стандартные решения PyTorch могут не справляться с масштабом или требовать сложной настройки.

Что можно реализовать

  • Гипермасштабное обучение больших языковых моделей (LLM) на распределенных кластерах
  • Обучение моделей с подкреплением (RL) с использованием распределенных вычислений
  • Использование RaggedShard DTensor для гибкого управления тензорами переменной длины
  • Исследование и применение методов FSDP (Fully Sharded Data Parallel) высокой производительности

Ключевые возможности

  • Внутренняя библиотека от ByteDance, адаптированная для гипермасштабных задач
  • Поддержка RaggedShard DTensor для работы с тензорами
  • Ориентация на LLM и RL (Reinforcement Learning)
  • Лицензия Apache 2.0, обеспечивающая открытость и безопасность использования
  • Научно обоснованная эффективность (подтверждено публикациями в arXiv)

👤 Кому подойдёт: Исследователи в области машинного обучения, инженеры по машинному обучению (MLE), разработчики, работающие с распределенным обучением LLM и RL на уровне PyTorch Distributed.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.