NVIDIA/FasterTransformer

Оптимизация, связанная с Transformer, включая BERT, GPT

Инференс⭐ 6 449C++последний релиз: release/v5.3_tag
Открыть на GitHub ↗

Что это за инструмент

FasterTransformer — это высокооптимизированная библиотека NVIDIA для ускорения инференса трансформерных моделей (BERT, GPT, T5 и др.) на GPU.

Зачем нужен

Инструмент предоставляет низкоуровневые оптимизации (Tensor Cores, параллелизм) для ускорения вывода моделей. Он полезен для разработчиков, которым нужна максимальная производительность и гибкая интеграция с TensorFlow, PyTorch или Triton, хотя разработка перенесена в TensorRT-LLM.

Что можно реализовать

  • Ускорение инференса моделей BERT, GPT, T5, BLOOM и других трансформеров на GPU NVIDIA.
  • Интеграция оптимизированных слоев в существующие сервисы на базе TensorFlow, PyTorch или Triton Inference Server.
  • Запуск моделей с использованием tensor parallelism и pipeline parallelism для распределения нагрузки на несколько GPU.
  • Использование квантования (INT8, FP8) и спарсности для снижения требований к памяти и повышения скорости на современных GPU (Turing, Ampere, Hopper).

Ключевые возможности

  • Глубокая оптимизация под архитектуру GPU (Volta, Turing, Ampere, Hopper) с автоматическим использованием Tensor Cores.
  • Поддержка широкого спектра моделей: Encoder (BERT, XLNet), Decoder (GPT, OPT, BLOOM, T5) и специфичные архитектуры (Longformer, GPT-MoE).
  • Гибкая интеграция через API для TensorFlow, PyTorch, C++ и Triton backend.
  • Поддержка распределенного инференса (tensor/pipeline parallelism) и квантования (INT8, FP8) для современных GPU.

👤 Кому подойдёт: ML-инженеры, разработчики LLM-инференса, исследователи, работающие с оптимизацией нейросетей на GPU NVIDIA.

Релизы