intel/xFasterTransformer

Инференс⭐ 435C++последний релиз: v2.1.2
Открыть на GitHub ↗

Что это за инструмент

xFasterTransformer — это высокооптимизированное решение для инференса больших языковых моделей (LLM) на процессорах Intel Xeon, аналогичное по функционалу FasterTransformer для GPU.

Зачем нужен

Инструмент позволяет запускать LLM на CPU с высокой производительностью и масштабируемостью, поддерживая распределенные вычисления между сокетами и узлами. Он полезен для тех, кто хочет использовать CPU-инфраструктуру для работы с тяжелыми моделями, избегая ограничений GPU.

Что можно реализовать

  • Инференс крупных моделей, таких как DeepSeek-R1 (671B) или Qwen3, на серверах с CPU
  • Развертывание LLM-сервисов через vLLM, FastChat или MLServer с совместимым OpenAI API
  • Интеграция LLM в существующие C++ или Python-приложения через прямые API
  • Запуск моделей с квантованием (INT4, INT8, W8A8) для снижения требований к памяти

Ключевые возможности

  • Поддержка широкого спектра архитектур: Llama, Qwen, DeepSeek, ChatGLM, Mixtral (MoE) и других
  • Нативная поддержка распределенного инференса на нескольких сокетах и узлах
  • Гибкие API: как высокоуровневые (PyTorch/Python), так и низкоуровневые (C++)
  • Широкая поддержка форматов данных: FP16, BF16, INT8, INT4, NF4, W8A8 и их комбинации
  • Простая установка через PyPI, Docker или сборка из исходного кода

👤 Кому подойдёт: Разработчики ML-инфраструктуры, инженеры по оптимизации моделей, исследователи, работающие с CPU-кластерами, и компании, ищущие альтернативу GPU-инференсу для LLM.

Релизы

v2.1.2patch
🕐 15 мес назад · релиз на GitHub ↗

Исправлена ошибка конвертации модели DeepSeek-R1 и оптимизирован FP8-конвертация через обновление xDNN.

  • Fixed: Исправлена проблема с конвертацией модели DeepSeek-R1.
  • Added: Обновлён xDNN: добавлен новый метод конвертации FP8 для оптимизации DeepSeek-R1.