В мире корпоративного искусственного интеллекта существует вечный конфликт между скоростью инноваций и требованиями безопасности. С одной стороны, сообщество Hugging Face ежедневно публикует тысячи новых моделей, закрывая разрыв между открытым и проприетарным ПО. С другой стороны, предприятия требуют гарантированной стабильности, аудита лицензий, изоляции данных и предсказуемого ценообразования. До недавнего времени интеграция этих двух миров требовала огромных усилий DevOps-команд: от ручного сканирования кода на уязвимости до настройки контейнеров и настройки GPU-кластеров.
На конференции Microsoft Build 2026 компания представила решение, которое должно изменить эту парадигму. Платформа Microsoft Foundry теперь предлагает Foundry Managed Compute с предварительно отобранной коллекцией моделей Hugging Face. Это не просто хостинг — это полностью управляемая среда, где Microsoft берет на себя всю «грязную работу»: обновление рантаймов, патчинг уязвимостей, сканирование образов и обеспечение соответствия корпоративным стандартам. Разработчики получают доступ к тысячам моделей с одним кликом, сохраняя при этом полный контроль над конфигурацией и безопасностью.
01Платформа Microsoft Foundry: Единая точка входа для AI
Microsoft Foundry позиционируется как платформа для создания и эксплуатации агентных AI-приложений. Ее ключевое преимущество — универсальность. Платформа предлагает самый широкий выбор моделей на любом облачном рынке: от проприетарных решений Microsoft, OpenAI, Anthropic до открытых моделей от Meta, Mistral, DeepSeek и Hugging Face. Все они доступны через единую конечную точку (endpoint) и единый набор SDK на Python, C#, JavaScript и Java.
Над этим слоем моделей работает Foundry Agent Service. Это система оркестрации мультиагентных систем, которая включает встроенную память, привязку знаний через Foundry IQ и каталог подключаемых инструментов. Агенты могут работать с корпоративными данными, используя агентные протоколы. Но самое важное для enterprise — это наблюдаемость (observability). Foundry предоставляет сквозное трассирование, мониторинг в реальном времени, непрерывную оценку качества и оптимизатор промптов, который улучшает поведение агентов на основе результатов тестирования.
Помимо базовых возможностей, платформа предлагает комплексный набор инструментов безопасности:
- Фильтры безопасности контента (Content safety filters).
- Ограничения соблюдения задач (Task-adherence guardrails).
- Агент AI Red Teaming для adversarial-тестирования (поиска уязвимостей в поведении модели).
- Единая система управления доступом на основе ролей (Unified RBAC).
- Частные сети и интеграция с Azure Policy.
Для развертывания моделей предусмотрены три пути: оплата за токен (самый простой старт), выделенная пропускная способность (для высоконагруженных продакшен-нагрузок) и, что нас интересует больше всего, Foundry Managed Compute.
02Foundry Managed Compute: GPU как сервис для открытых моделей
Foundry Managed Compute — это управляемая платформа как услуга (PaaS) для GPU, предназначенная специально для открытых и пользовательских моделей. Здесь Microsoft решает главную боль разработчиков: сложность управления инфраструктурой. Вы описываете экземпляр модели через параметры, важные для вашей нагрузки: количество параметров, длина контекста и приоритет (латентность или пропускная способность). Microsoft же берет на себя выбор топологии GPU, определяя, будет ли экземпляр работать на одном ускорителе или распределен по нескольким.
Ключевое отличие Managed Compute от самостоятельного развертывания — автоматизация жизненного цикла. Microsoft самостоятельно управляет машинами: обновления контейнеров, апгрейды рантаймов и патчи безопасности применяются автоматически. Это происходит без необходимости переразвертывания вашей модели. Поддерживаются популярные рантаймы: vLLM, SGLang, TensorRT-LLM, NIM, TEI, llama.cpp.
При этом конфигурация модели, поведение развертывания и маршрутизация запросов остаются под вашим контролем. Это обеспечивает консистентность: независимо от того, используете ли вы оплату за токен, выделенную пропускную способность или Managed Compute, вы получаете:
- Единую конечную точку.
- Одни и те же SDK.
- Единую систему аутентификации.
- Единую систему наблюдаемости.
- Единый счет.
Открытые модели интегрируются с Foundry Agents так же, как и проприетарные. Это позволяет смешивать типы моделей в одном агенте без необходимости создавать отдельные пути интеграции. Managed Compute предлагает глобальные развертывания (для лучшей цены и емкости) и развертывания в зонах данных (Data Zone) для соблюдения суверенитета данных. Квоты привязаны к семействам ускорителей, что означает, что план, построенный на базе H100 сегодня, будет совместим с новыми поколениями железа в будущем.
03Почему именно Hugging Face?
Hugging Face называют «публичной площадью» открытого ИИ. Там находятся 15 миллионов разработчиков, 400 000 организаций и более 3 миллионов опубликованных открытых моделей. Еженедельно появляются новые возможности: агентное программирование, сегментация видео, распознавание речи, эмбеддинги. Это «GitHub для моделей», где сообщество публикует веса, пишет карточки моделей, сравнивает оценки и тестирует новинки.
Открытые модели уже закрыли разрыв с проприетарными на многих бенчмарках. Вот почему предприятия начинают обращать на них внимание:
- State-of-the-art теперь открыт. Ведущие модели с открытыми весами конкурентоспособны с лучшими закрытыми моделями на самых распространенных бенчмарках.
- Глубокая кастомизация. Наличие полных весов позволяет дообучать (fine-tune), дистиллировать, квантовать и адаптировать модели с помощью LoRA. Это дает возможность настроить модель под вашу доменную область, ваши данные и ваши цели по задержке и стоимости.
- Ваша модель, ваш хостинг. Веса запускаются в вашем тенанте на инфраструктуре, которой вы контролируете, за вашим эндпоинтом инференса, с вашей идентичностью и сетевыми границами.
- Формирование стоимости. Вы платите за ускорители в час, можете масштабировать до нуля в простое и правильно подбирать GPU под конкретную модель. Это полезно для стабильных, высоконагруженных или чувствительных к задержке рабочих нагрузок, где ценообразование за токен менее предсказуемо.
- Контроль версий. Вы можете зафиксировать конкретную версию модели, оценить ее, развернуть и двигаться дальше или откатиться назад по собственному графику релизов.
Проблема всегда заключалась в операционном слое: поиск, проверка лицензий, скрининг безопасности, выбор рантайма, подбор GPU, сборка образа, патчинг CVE и запуск модели за корпоративным эндпоинтом. Hugging Face сам по себе не является платформой для enterprise-обслуживания. Hugging Face Models on Foundry — это и есть тот самый операционный слой, запущенный Microsoft.

04Коллекция Hugging Face в Foundry: Процесс курирования
Коллекция Hugging Face в Foundry Model Catalog — это не просто зеркало репозиториев. Это тщательно отобранное подмножество моделей, которые проходят многоэтапный процесс публикации, прежде чем появиться в каталоге. Это гарантирует, что каждая модель готова к использованию в корпоративной среде.
Этапы курирования
- Идентификация трендовых моделей. Microsoft и Hugging Face совместно определяют самые популярные модели на основе сигналов сообщества, запросов партнеров и спроса клиентов. Отбираются кандидаты, готовые к enterprise-использованию.
- Проверка на соответствие и безопасность. Лицензии моделей проверяются на соответствие политике распространения Microsoft. Метаданные лицензий сохраняются в карточке модели. Репозитории сканируются на наличие паттернов
trust_remote_codeи пользовательского исполняемого кода. Любая модель, требующая выполнения стороннего Python-кода при загрузке, либо исправляется, либо исключается. Это критически важно для безопасности. - Сборка, сканирование и публикация рантаймов. Microsoft собирает образы контейнеров с инференсом на поддерживаемых рантаймах (vLLM, SGLang, TensorRT-LLM, NIM, TEI, llama.cpp), сканирует их на наличие CVE и подписывает, публикуя в управляемом Microsoft реестре контейнеров.
- Загрузка весов в безопасное хранилище Azure. Веса моделей загружаются из Hugging Face один раз, проверяются на соответствие опубликованной карточке модели и хранятся в управляемом Microsoft хранилище Azure в регионах, где обслуживается модель.
- Валидация и публикация в каталоге. Каждая комбинация «модель + рантайм + ускоритель» тестируется на соответствие API (chat completions, embeddings, rerank и т.д.) и производительность (латентность, пропускная способность, время до первого токена). После валидации модель публикуется в Foundry Model Catalog с возможностью развертывания в один клик.
Поскольку веса предварительно размещены в хранилище Azure, а образы рантаймов находятся в управляемом Microsoft реестре, ваши развертывания не требуют исходящего сетевого доступа к Hugging Face Hub. Вы можете развернуть модель в продакшене внутри частной сети, что является огромным плюсом для безопасности.
trust_remote_code без строгого обзора. Это исключает риски выполнения вредоносного кода при загрузке модели.05Рантаймы инференса: Выбор правильного инструмента
Модели Hugging Face в Foundry работают на разнообразных коллекциях открытых рантаймов, созданных сообществом. Каждый из них выбран и настроен для Foundry Managed Compute и соответствует лучшим архитектурам моделей. Благодаря системному курированию, новые версии и патчи появляются в Foundry быстро, а существующие развертывания обновляются автоматически.
- vLLM — движок обслуживания с высокой пропускной способностью для открытых больших языковых моделей (LLM), оптимизированный для продакшен-нагрузок на GPU. Поскольку Hugging Face является прямым участником разработки vLLM, любая модель из библиотеки Transformers может работать на vLLM «из коробки». Когда новая модель появляется в Hugging Face, она может быть обслужена в Foundry в тот же день без ожидания кастомной интеграции.
- SGLang — движок обслуживания для языковых и мультимодальных моделей с сильной поддержкой структурированных выходов (JSON, regex, генерация, ограниченная грамматикой). Это критично для агентных нагрузок и использования инструментов. Интеграция с Transformers позволяет запускать любые модели из библиотеки на SGLang в день их появления в Hugging Face.
- Text Embeddings Inference (TEI) — рантайм для эмбеддингов, реранкеров и моделей классификации последовательностей. Образы, специфичные для ускорителей, поставляются с ядрами, скомпилированными для каждого семейства GPU и CPU, поддерживаемого Foundry. Это обеспечивает легкость «горячего пути» для нагрузок RAG и семантического поиска.
- llama.cpp — путь для CPU и небольших GPU для моделей, квантованных в формате GGUF. Полезно для развертываний с оптимизацией затрат, небольших моделей и регионов только с CPU. Предоставляет тот же OpenAI-совместимый API, что и vLLM и SGLang.
- TensorRT-LLM и NIM — используются на оборудовании NVIDIA, где оптимизированные ядра NVIDIA и обслуживание на базе Triton обеспечивают значительно лучшую латентность или пропускную способность для определенных семейств моделей.
- hf-serve — собственный многомодельный сервер инференса Hugging Face, используемый для архитектур моделей, выходящих за рамки быстрых путей LLM и эмбеддингов (зрение, аудио, сегментация и другие конвейеры, нативные для Transformers). Это позволяет коллекции охватывать каждую модальность с согласованным слоем обслуживания.

06Развертывание и оценка: Практическое руководство
Развертывание модели из коллекции Hugging Face в каталоге Foundry состоит из пяти простых шагов:
- Просмотр каталога и выбор модели. Мастер развертывания также отображает идентификатор модели, идентификатор шаблона развертывания и
acceleratorType, которые вам понадобятся, если вы скриптуете развертывание через SDK или REST. - Выбор шаблона развертывания. Шаблон — это именованный, версионированный актив, который фиксирует рантайм, семейство ускорителей и их количество, длину контекста и специфичные для рантайма настройки. Это единственный «рычаг», который вы поворачиваете, чтобы определить, как будет работать модель. Например, для модели
qwen3-32bдоступны шаблоны для A100 и H100 с разной длиной контекста (40K или 128K). - Настройка количества экземпляров. Масштабируйте пропускную способность, добавляя экземпляры модели.
- Развертывание. Из портала, CLI, SDK или REST.
- Оценка (Scoring). Через унифицированную конечную точку Foundry с использованием SDK, который вы уже используете.
Шаблон развертывания предварительно настроен для модели: настройки рантайма, парсеры вызовов инструментов и рассуждений, путь оценки, зонды здоровья, параллелизм запросов и любые настройки расширения контекста, специфичные для модели, устанавливаются Microsoft. При скриптовании развертывания вы ссылаетесь на шаблон, а Foundry делает все остальное.
Пример кода: Развертывание через Python SDK
Для развертывания используется Azure Identity и Cognitive Services Management Client. Обратите внимание, как четко указывается модель и шаблон:
from azure.identity import DefaultAzureCredential
from azure.mgmt.cognitiveservices import CognitiveServicesManagementClient
client = CognitiveServicesManagementClient(DefaultAzureCredential(), SUBSCRIPTION_ID)
deployment = client.managed_compute_deployments.begin_create_or_update(
resource_group_name=RESOURCE_GROUP,
account_name=ACCOUNT_NAME,
deployment_name="qwen3-32b",
resource={
"sku": {
"name": "GlobalManagedCompute",
"capacity": 1
},
"properties": {
"model": "azureml://registries/azure-huggingface/models/qwen--qwen3-32b/versions/1",
"deploymentTemplate": "azureml://registries/azure-huggingface/deploymenttemplates/qwen--qwen3-32b--40k-nvidia-h100/labels/latest",
"acceleratorType": "H100_80GB"
},
},
).result()Пример кода: Оценка через OpenAI SDK
Развертывание доступно через унифицированную конечную точку Foundry с использованием OpenAI SDK. Поле model принимает имя развертывания, которое вы только что создали:
from openai import OpenAI
api_key = client.accounts.list_keys(RESOURCE_GROUP, ACCOUNT_NAME).key1
endpoint = f"https://{ACCOUNT_NAME}.services.ai.azure.com/openai/v1"
openai_client = OpenAI(base_url=endpoint, api_key=api_key)
completion = openai_client.chat.completions.create(
model=deployment.name,
messages=[{
"role": "user",
"content": "What is the capital of France?"
}],
)
print(completion.choices[0].message)Использование в Агентах
Модель chat-completions из коллекции встраивается в Foundry Agents как административно подключенная модель и вызывается через Foundry Responses API с тем же OpenAI SDK. Та же аутентификация, та же конечная точка, та же наблюдаемость.
07Что это значит на практике
Интеграция Hugging Face в Microsoft Foundry Managed Compute снимает с инженеров по машинному обучению (MLE) и DevOps-инженеров огромный пласт рутинной работы. Раньше запуск новой SOTA-модели в продакшен мог занять дни или недели: настройка окружения, проверка лицензий, обеспечение безопасности, оптимизация под GPU. Теперь этот процесс занимает минуты.
Для бизнеса это означает:
- Снижение рисков. Автоматический скрининг лицензий и безопасности исключает юридические и технические риски, связанные с использованием стороннего кода.
- Гибкость. Возможность быстро переключаться между моделями (например, с Llama на Qwen или Mistral) без переписывания инфраструктуры.
- Контроль затрат. Использование Managed Compute позволяет оптимизировать расходы на GPU, масштабируя ресурсы под реальную нагрузку, а не платя за простаивающие инстансы.
- Безопасность данных. Отсутствие необходимости выхода во внешние сети для загрузки моделей и работа в частных сетях соответствуют строгим корпоративным стандартам.
На данный момент в предварительном доступе доступна коллекция Hugging Face в каталоге моделей Microsoft Foundry — тысячи моделей по каждой модальности, обновляемые еженедельно, развертываемые на ускорителях NVIDIA A100, NVIDIA H100 или AMD MI300X в глобальных зонах и зонах данных. Поддерживается Playground, метрики Azure Monitor, теги биллинга для каждого развертывания и автоматические обновления рантаймов и патчи CVE.
В планах Microsoft — расширение покрытия экосистемы Hugging Face, добавление дополнительных семейств ускорителей и поддержка функции Bring Your Own Weights (BYOW) для дообученных и проприетарных вариантов, развертываемых через те же шаблоны и механизмы управления, что и модели из коллекции. Это шаг к полной унификации работы с любыми моделями в корпоративной среде.
Источник: Hugging Face ↗
