SeldonIO/seldon-core

Фреймворк MLOps для упаковки, развертывания, мониторинга и управления тысячами production ML-моделей

LLMOps⭐ 4 781Goпоследний релиз: v2.10.2
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Seldon Core 2 — это MLOps/LLMOps фреймворк для развертывания, управления и масштабирования ML-моделей в Kubernetes.

Зачем нужен

Инструмент позволяет стандартизированно запускать модели (включая LLM) в продакшене на-prem или в облаке. Он упрощает управление тысячами моделей, обеспечивая мониторинг, эксперименты (A/B тесты) и эффективное использование ресурсов.

Что можно реализовать

  • Развертывание модульных AI-приложений с потоковой обработкой данных через Kafka
  • Проведение A/B тестов и shadow-деплоев для сравнения кандидатов моделей
  • Консолидация нескольких моделей на общих инференс-серверах для экономии инфраструктуры
  • Масштабирование компонентов приложений на основе нативных или кастомных логики
  • Интеграция кастомной логики, детекции дрейфа и LLM в единую экосистему ML/AI продуктов

Ключевые возможности

  • Поддержка конвейеров (Pipelines) с использованием Kafka для real-time стриминга
  • Multi-Model Serving для снижения затрат за счет объединения моделей
  • Overcommit — возможность деплоя большего числа моделей, чем позволяет доступная память
  • Встроенные механизмы экспериментов (Experiments) и маршрутизации трафика
  • Гибкая система autoscaling для моделей и компонентов приложений

👤 Кому подойдёт: MLOps-инженеры, разработчики AI-приложений, DevOps-специалисты, работающие с Kubernetes и нуждающиеся в стандартизированном управлении моделями в продакшене.

Релизы

v2.10.2patch
🕐 9 мес назад · релиз на GitHub ↗

Исправлены зависания пайплайнов при сбоях Kafka, блокировки gRPC-стримов и бесконечные ретраи оператора, а также оптимизировано логирование MLServer.

  • Fixed: Пайплайны теперь корректно восстанавливаются после восстановления кластера Kafka благодаря добавлению периодических попыток создания и удаления.
  • Fixed: Устранена блокировка gRPC-стримов между scheduler и agent, вызывавшая проблемы с загрузкой моделей.
  • Fixed: Operator больше не блокируется при повторных попытках отправки состояния кластера благодаря лимитам ретраев и таймаутам сетевых вызовов.
  • Fixed: Исправлена переменная окружения для настройки параллельных воркеров MLServer в Helm-чартах (MLSERVER_PARALLEL_WORKERS).
  • Fixed: Логирование запросов в MLServer отключено по умолчанию для предотвращения задержек из-за throttling дискового ввода-вывода.
  • Added: Добавлена поддержка pprof для отладки scheduler, доступная через порт-форвардинг.