Инструменты15 июля 2026 г., 21:32 МСК🤖 Auto

Together AI обновил GPU-кластеры: надежность, Slurm и OIDC для продакшена

Together AI выпустила крупное обновление инфраструктуры для обучения LLM, добавив пассивные проверки здоровья узлов, автоматический ремонт нод, усиленную стабильность Slurm и поддержку OIDC.

Баннер новости 3657

Проблема масштабируемости в продакшене

Обучение больших языковых моделей (LLM) требует тысяч GPU, работающих синхронно. В таких условиях отказ даже одного узла может привести к потере недель вычислений. Together AI признает, что надежность кластера — это не просто «фича», а критическая инфраструктурная необходимость для коммерческого использования. Новое обновление направлено на минимизацию простоев и повышение предсказуемости работы распределенных систем.

Ключевые технические улучшения

Разработчики внедрили ряд механизмов, которые переводят работу с GPU из категории «экспериментальной» в категорию «промышленной»:

  • Пассивные проверки здоровья (Passive Health Checks): Система теперь непрерывно мониторит состояние узлов, выявляя деградацию производительности или аппаратные сбои до того, как они прервут тренировку модели.
  • Автоматический ремонт нод (Node Repair): При обнаружении неисправности кластер может автоматически изолировать проблемный узел и заменить его, не требуя ручного вмешательства инженеров.
  • Усиленная надежность Slurm: Планировщик задач Slurm, стандарт де-факто для HPC-кластеров, получил улучшения в обработке сбоев и распределении ресурсов, что снижает риск «висячих» задач.
  • Поддержка OIDC: Внедрение OpenID Connect позволяет интегрировать кластеры с корпоративными системами аутентификации (например, Okta, Azure AD), что критично для безопасности в enterprise-среде.
  • Скрипты запуска (Startup Scripts): Появилась возможность автоматизировать настройку окружения при старте ноды, ускоряя развертывание новых инстансов.

Сравнение подходов: До и После обновления

Критерий Старый подход / Ручное управление Новое решение Together AI
Обнаружение сбоев Реактивное (после падения задачи) Проактивное (пассивные health checks)
Восстановление нод Требует вмешательства администратора Автоматический repair и замена
Аутентификация Локальные учетные записи / SSH Стандартный OIDC интеграция
Настройка окружения Ручная конфигурация каждой ноды Автоматизация через startup scripts

Почему это важно для разработчиков LLM

Для команд, обучающих модели на сотнях или тысячах GPU, время простоя стоит дорого. Каждые часы простоя из-за отказа одного GPU в кластере из 1000 устройств могут стоить тысяч долларов. Внедрение пассивных проверок и автоматического ремонта снижает операционные расходы (OpEx) и позволяет инженерам сосредоточиться на архитектуре моделей, а не на «тушении пожаров» в инфраструктуре. Поддержка OIDC также открывает двери для внедрения таких кластеров в крупные корпорации с жесткими требованиями к безопасности.

Источник: Together AI ↗