huggingface/text-generation-inference

Large Language Model Text Generation Inference

Инференс⭐ 10 885Pythonпоследний релиз: v3.3.7
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Text Generation Inference (TGI) — это высокопроизводительный сервер для развертывания и обслуживания больших языковых моделей (LLM), написанный на Rust и Python. Инструмент находится в режиме поддержки (maintenance mode), и разработчики рекомендуют переходить на vLLM, SGLang или другие современные движки.

Зачем нужен

TGI обеспечивает высокую пропускную способность и низкую задержку при генерации текста за счет таких техник, как непрерывное батчинг запросов (continuous batching) и тензорная параллельность (tensor parallelism). Он полезен для создания production-ready API, совместимых с OpenAI, и оптимизации работы с моделями через Flash Attention и Paged Attention.

Что можно реализовать

  • Развертывание LLM (Llama, Falcon и др.) в продакшене с использованием Docker
  • Создание API, совместимого с OpenAI Chat Completion API, для интеграции с внешними приложениями
  • Генерация текста с жестким контролем формата вывода (JSON/Guidance) для структурированных данных
  • Оптимизация инференса на GPU с использованием квантования (bitsandbytes, AWQ, fp8) и speculation decoding

Ключевые возможности

  • Поддержка тензорной параллельности для работы с несколькими GPU
  • Нативная совместимость с OpenAI API через Messages API
  • Встроенное квантование (GPT-Q, AWQ, EETQ, Marlin, fp8) для экономии памяти
  • Гарантия валидности вывода через Guidance/JSON и watermarking
  • Широкая поддержка аппаратного обеспечения: Nvidia, AMD, Intel GPU, HPU, TPU

👤 Кому подойдёт: ML-инженеры, DevOps-специалисты и разработчики, развертывающие LLM в production-средах, которым важна производительность и совместимость с экосистемой Hugging Face.

Релизы

v3.3.7patch
🕐 9 мес назад · релиз на GitHub ↗

Исправлена автоматическая настройка числа шейдов при NVIDIA_VISIBLE_DEVICES, добавлено ограничение размера загрузки изображений.

  • Fixed: Исправлен расчёт num_shard и num_devices при значениях NVIDIA_VISIBLE_DEVICES «all» или «void».
  • Added: Добавлена поддержка параметра max_image_fetch_size для ограничения размера загрузки изображений.
  • Обновлены CI/CD действия: переменные action cache url и runtime теперь доступны как секреты.
  • Внесены технические изменения в режим обслуживания (Maintenance mode).