bytedance/ByteTransformer

Оптимизированный BERT transformer inference на NVIDIA GPU. https://arxiv.org/abs/2210.03052

Инференс⭐ 479C++
Открыть на GitHub ↗

Что это за инструмент

ByteTransformer — это библиотека для высокопроизводительного инференса BERT-подобных трансформеров на GPU NVIDIA, оптимизированная за счет алгоритмов без заполнения (padding-free). Она обеспечивает ускорение обработки как фиксированных, так и переменных длин последовательностей.

Зачем нужен

Инструмент решает задачу снижения задержек и повышения пропускной способности при обслуживании запросов к моделям типа BERT. Он полезен для разработчиков ML-сервисов, которым необходимо максимизировать эффективность использования GPU A100 и других устройств NVIDIA в продакшене, превосходя стандартные реализации PyTorch и TensorFlow.

Что можно реализовать

  • Оптимизация инференса BERT-моделей в системах обработки естественного языка (NLP) с переменной длиной входных данных.
  • Повышение производительности сервисов классификации текстов или поиска, работающих под высокой нагрузкой на GPU.
  • Интеграция ускоренного инференса в существующие пайплайны через простой Python API с плагином PyTorch.
  • Сравнительный анализ производительности трансформеров на GPU NVIDIA A100 для выбора оптимального фреймворка.

Ключевые возможности

  • Архитектурно-осознанные оптимизации для алгоритмов без заполнения (padding-free), включая QKV encoding, softmax, layernorm и multi-head attention.
  • Поддержка как фиксированной, так и переменной длины входных последовательностей.
  • Доступность Python и C++ API, позволяющая интегрировать ускорение в несколько строк кода.
  • Доказанное превосходство над PyTorch, TensorFlow, FasterTransformer и DeepSpeed на GPU A100 (в 2-3 раза быстрее PyTorch при batch size=1).
  • Научно обоснованная методология, опубликованная в IEEE IPDPS 2023.

👤 Кому подойдёт: ML-инженеры, разработчики inference-серверов, исследователи в области оптимизации нейросетей, использующие GPU NVIDIA.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.