michaelfeil/infinity

Infinity — это высокопроизводительный движок с низкой задержкой для обслуживания текстовых эмбеддингов, моделей ранжирования, clip, clap и colpali

Инференс⭐ 2 944Pythonпоследний релиз: 0.0.77
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Infinity — это высокопроизводительный движок для обслуживания моделей (serving engine), оптимизированный для генерации текстовых эмбеддингов, ранжирования (reranking) и мультимодальных моделей.

Зачем нужен

Инструмент решает задачу развертывания моделей с высокой пропускной способностью и низкой задержкой, предоставляя REST API, совместимый со спецификациями OpenAI. Он полезен для создания надежных бэкендов для систем поиска и классификации, позволяя легко масштабировать инференс на различных аппаратных платформах.

Что можно реализовать

  • Развертывание моделей эмбеддингов и ранжирования из HuggingFace для систем RAG
  • Обслуживание мультимодальных моделей (clip, clap, colpali) для поиска по изображениям и тексту
  • Создание высоконагруженных сервисов с динамическим батчингом запросов
  • Интеграция моделей sentence-transformer в существующие API-инфраструктуры

Ключевые возможности

  • Поддержка NVIDIA CUDA, AMD ROCm, CPU, AWS INF2 и Apple MPS
  • Использование оптимизированных бэкендов: PyTorch, ONNX, TensorRT, CTranslate2 и FlashAttention
  • Возможность одновременного обслуживания нескольких моделей (multi-model) и смешивания их типов
  • API совместим со спецификациями OpenAI Embeddings, что упрощает интеграцию
  • Готовые Docker-образы и примеры деплоя на платформах вроде Modal, Runpod и Baseten

👤 Кому подойдёт: ML-инженеры, разработчики AI-инфраструктуры и разработчики приложений, внедряющих семантический поиск и мультимодальный анализ

Релизы

0.0.77minor
🕐 13 мес назад · релиз на GitHub ↗

Обновление PyTorch до 2.8 и FlashAttention, добавление ColQwen2_5, исправление клиентского пайплайна и документации.

  • Added: Обновлен движок Colpali и добавлена модель ColQwen2_5 в IMAGE_COL_MODELS
  • Added: Обновлен PyTorch до версии 2.8 и FlashAttention, удалён hf_transfer
  • Fixed: Исправлен пайплайн генерации клиентов и ошибки линтинга в select_model.py
  • Fixed: Исправлена устаревшая документация и сломанная ссылка в README
  • Added: Добавлена поддержка hf-xet и кэширование моделей Hugging Face в GitHub Actions