huggingface/text-embeddings-inference

Молниеносное решение для инференса моделей текстовых эмбеддингов

Инференс⭐ 5 058Rustпоследний релиз: v1.9.4
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

TEI — это высокопроизводительный сервис для развертывания и обслуживания моделей текстовых эмбеддингов и классификации последовательностей от Hugging Face.

Зачем нужен

Инструмент решает задачу быстрого извлечения векторных представлений текста (embeddings) для использования в поиске и анализе данных. Он полезен тем, что обеспечивает низкую задержку и высокую пропускную способность за счет оптимизаций, таких как динамическая батчинг и использование Flash Attention, что критично для production-систем.

Что можно реализовать

  • Построение систем семантического поиска по базам знаний (RAG).
  • Кластеризация и категоризация текстовых документов.
  • Поиск похожих документов или дубликатов в массивах данных.
  • Обогащение данных векторными представлениями для последующей обработки ML-моделями.

Ключевые возможности

  • Высокая скорость инференса благодаря оптимизациям Flash Attention, Candle и cuBLASLt.
  • Поддержка динамического батчинга на основе токенов для эффективного использования GPU.
  • Готовность к production: встроенная поддержка Open Telemetry и метрик Prometheus.
  • Широкая поддержка архитектур моделей: BERT, RoBERTa, Mistral, Qwen, GTE и других.
  • Возможность запуска на Apple Silicon (Metal) и AMD Instinct (ROCm), а также легковесные Docker-образы.

👤 Кому подойдёт: ML-инженеры, разработчики backend-систем и DevOps-специалисты, внедряющие векторный поиск или семантический анализ в production-окружение.

Релизы

v1.9.3patch
🕐 6 мес назад · релиз на GitHub ↗

Релиз v1.9.3: исправлена обработка исключений в бэкенде и обновлён Dockerfile для корректной установки Rust.

  • Fixed: Исправлена проверка устройства: заменён голый except на явное исключение Exception.
  • Added: В Dockerfile для CUDA-сборок rust-toolchain.toml теперь применяется до вызова rustup.
  • Установлена версия 1.9.3.