Проблема: «налог» на кросс-облачные данные
Для большинства AI-команд модели и датасеты хранятся в одном облаке, а вычислительные мощности (GPU) арендуются в другом. При запуске задачи команда платит за передачу данных (egress) из хранилища в сеть вычислений. Например, в AWS стоимость эгress составляет около $0.09/GB. Это заставляет команды привязывать задачи к конкретному провайдеру, где уже есть данные, оставляя резервированные мощности в других облаках простаивающими.
Решение: интеграция store: hf
Команды Hugging Face и SkyPilot объединили усилия, чтобы данные оставались на Hub, а вычисления происходили там, где есть GPU. Теперь можно монтировать репозитории или бакеты Hugging Face в задачи SkyPilot с помощью схемы hf:// и токена HF_TOKEN. Ключевые особенности:
- Zero Egress: Hugging Face Storage не взимает плату за исходящий трафик (egress) или CDN. Чтение данных на GPU любого облака бесплатно.
- Lazy Loading: Используется FUSE-бэкенд
hf-mount. Данные загружаются лениво — только те байты, к которым обращается процесс. Это позволяет тренировке начинаться через ~30 секунд, не дожидаясь полной загрузки модели. - Xet-backed Dedup: Бакеты построены на базе Xet, что позволяет хранить только измененные чанки при инкрементальных чекпоинтах и вариациях моделей.
Практика: бенчмарк Qwen3.5-4B
Для проверки интеграции была запущена задача тонкой настройки модели Qwen/Qwen3.5-4B на датасете HuggingFaceH4/Multilingual-Thinking с использованием TRL's SFTTrainer. Задача запускалась на AWS, GCP и Lambda, при этом все три облака писали и читали из одного бакета Hugging Face.
Результаты скорости записи чекпоинтов (8.43 GB весов) в бакет Hugging Face:
| Облако | GPU | Скорость записи чекпоинтов |
|---|---|---|
| AWS (us-east-2) | L40S | ~168 MB/s |
| GCP (us-central1) | L4 | ~123 MB/s |
| Lambda (us-west-3) | H100 | ~112 MB/s |
Загрузка модели происходила со скоростью до ~500 MB/s, что позволило начать обучение практически мгновенно. Стоимость чтения составила $0, в то время как аналогичный сценарий с хранением в S3 обошелся бы в значительную сумму из-за эгress-сборов.
Экономика и конфигурация
Стоимость хранения в Hugging Face Storage составляет $12–18/ТБ/месяц, что дешевле AWS S3 (~$23/ТБ) плюс эгress. Запись обратно в облако провайдера (если нужно сохранить чекпоинты локально) по-прежнему тарифицируется по стандартным тарифам вычислительного облака, но для большинства AI-работ доминируют операции чтения (датасеты за много эпох, веса моделей на инференсе), где экономия максимальна.
Пример конфигурации SkyPilot YAML для монтирования модели и бакета:
file_mounts:
/base-model:
source: hf://Qwen/Qwen3.5-4B
store: hf
mode: MOUNT
/checkpoints:
source: hf://buckets/my-org/qwen-sft
store: hf
mode: MOUNT
Интеграция работает через один токен HF_TOKEN, не требуя настройки ключей доступа для каждого облака (S3, GCS, Azure и др.).
Источник: Hugging Face blog ↗
