Инструменты8 июля 2026 г., 03:16 МСК🤖 Auto

Microsoft Foundry: Запуск Managed Compute для моделей Hugging Face

Microsoft анонсировала Foundry Managed Compute — PaaS-платформу для запуска open-source моделей Hugging Face с автоматическим управлением GPU, безопасностью и единым биллингом.

Баннер новости 3068

Новый уровень управления инфраструктурой

На конференции Build 2026 Microsoft представила Foundry Managed Compute, третье решение для развертывания моделей в экосистеме Microsoft Foundry. В отличие от pay-per-token или provisioned throughput, этот сервис представляет собой управляемую PaaS-платформу для open-source и кастомных моделей. Разработчики настраивают параметры (количество параметров, длина контекста, оптимизация под задержку или пропускную способность), а Microsoft берет на себя управление топологией GPU, обновлениями контейнеров и патчами безопасности.

Интеграция с Hugging Face: каталог и безопасность

Платформа предлагает curated-каталог моделей из экосистемы Hugging Face, который обновляется еженедельно. Ключевые особенности интеграции:

  • Безопасность: Используются только веса в формате Safetensors. Модели с флагом trust_remote_code проходят строгий аудит или исключаются.
  • Охват: Текстовые, визуальные, аудио и мультимодальные модели (LLM, VLM, ASR, embeddings).
  • Автоматизация: Microsoft самостоятельно строит, сканирует на CVE и подписывает образы контейнеров для поддерживаемых рантаймов.

Технические детали и рантаймы

Система автоматически подбирает оптимальный движок для каждой модели. Поддерживаются следующие рантаймы:

Рантайм Назначение
vLLM / SGLang LLM (текст, агенты)
TensorRT-LLM / NIM Оптимизированное выполнение (GPU)
TEI Embeddings
llama.cpp Выполнение на CPU

Почему это важно для Enterprise

Решение закрывает главный барьер внедрения open-source моделей: операционную сложность. Веса предварительно размещаются в Azure, что обеспечивает:

  • Единый биллинг и SDK: Интеграция с Foundry Agent Service, Unified RBAC и Azure Policy.
  • Глобальное развертывание: Поддержка Data Zone для соблюдения суверенитета данных.
  • Масштабируемость: Квоты привязаны к семействам акселераторов (например, H100), что упрощает миграцию на новое железо.

Теперь open-source модели интегрируются с агентами Foundry так же, как проприетарные модели от OpenAI или Anthropic, позволяя смешивать типы моделей в одном рабочем процессе без дополнительной интеграции.

Источник: Hugging Face blog ↗