Вышла версия v1.9.4.
huggingface/text-embeddings-inference
Молниеносное решение для инференса моделей текстовых эмбеддингов
Что это за инструмент
TEI — это высокопроизводительный сервис для развертывания и обслуживания моделей текстовых эмбеддингов и классификации последовательностей от Hugging Face.
Зачем нужен
Инструмент решает задачу быстрого извлечения векторных представлений текста (embeddings) для использования в поиске и анализе данных. Он полезен тем, что обеспечивает низкую задержку и высокую пропускную способность за счет оптимизаций, таких как динамическая батчинг и использование Flash Attention, что критично для production-систем.
Что можно реализовать
- Построение систем семантического поиска по базам знаний (RAG).
- Кластеризация и категоризация текстовых документов.
- Поиск похожих документов или дубликатов в массивах данных.
- Обогащение данных векторными представлениями для последующей обработки ML-моделями.
Ключевые возможности
- Высокая скорость инференса благодаря оптимизациям Flash Attention, Candle и cuBLASLt.
- Поддержка динамического батчинга на основе токенов для эффективного использования GPU.
- Готовность к production: встроенная поддержка Open Telemetry и метрик Prometheus.
- Широкая поддержка архитектур моделей: BERT, RoBERTa, Mistral, Qwen, GTE и других.
- Возможность запуска на Apple Silicon (Metal) и AMD Instinct (ROCm), а также легковесные Docker-образы.
👤 Кому подойдёт: ML-инженеры, разработчики backend-систем и DevOps-специалисты, внедряющие векторный поиск или семантический анализ в production-окружение.
Релизы
Релиз v1.9.3: исправлена обработка исключений в бэкенде и обновлён Dockerfile для корректной установки Rust.
- Fixed: Исправлена проверка устройства: заменён голый except на явное исключение Exception.
- Added: В Dockerfile для CUDA-сборок rust-toolchain.toml теперь применяется до вызова rustup.
- Установлена версия 1.9.3.