Гибридная архитектура: разделение труда
Компании AMD и Cerebras Systems объявили о партнерстве для создания платформы, объединяющей процессоры AMD EPYC в стойковой инфраструктуре Helios с решениями Cerebras Wafer-Scale Engine (WSE). Ключевая идея — дисагрегация (разделение) задач инференса LLM на два этапа, оптимизированных под разные архитектуры.
В отличие от концепции Nvidia CPX, где специализированные GPU берут на себя тяжелый префилл, здесь роли инвертированы:
- AMD Helios (EPYC + Instinct MI400): обрабатывает этап префилла (context/prefill). Эта часть требует высокой вычислительной мощности для обработки промптов и больших контекстных окон.
- Cerebras WSE: берет на себя этап декодирования (generation/decode). Здесь критична пропускная способность памяти для генерации токенов с низкой задержкой.
Метрики и производительность
Совместная платформа позиционируется как решение для высокой пропускной способности при низкой задержке. По оценкам партнеров, такое распределение нагрузки позволяет достичь показателя до 5x выше токенов в секунду на ватт (T/s/W) по сравнению с монолитными подходами. Инфраструктура Helios обеспечивает вычислительную емкость для сложных запросов, а WSE оптимизирован для чувствительных к задержкам операций генерации.
Сравнение подходов к дисагрегации
| Платформа | Этап Префилла (Context) | Этап Декодирования (Generation) |
|---|---|---|
| Nvidia CPX (отменен) | Специализированный GPU (Rubin CPX с GDDR7) | Стандартные GPU с HBM (Rubin) |
| AMD + Cerebras | AMD Helios (EPYC + Instinct MI400) | Cerebras WSE (Wafer-Scale Engine) |
Доступность и сроки
Cerebras планирует развернуть системы AMD Helios в своих собственных дата-центрах и интегрировать их с существующими стойками WSE. Комбинированное предложение станет доступно через Cerebras Cloud во второй половине 2026 года. Детали физической интерконнекты между системами и дополнительные бенчмарки на данный момент не раскрываются.
Источник: Tom's Hardware ↗
