WSE-3 Turbo: удвоение тактовых частот без новой литографии
Cerebras Systems представила обновленный процессор WSE-3 Turbo, который не использует новую технологическую норму, а достигает повышенной производительности за счет увеличения тактовых частот. Чип остается на базе 5-нм процесса TSMC, но его вычислительная мощность в режиме разреженных вычислений (sparse FP16) выросла с 125 до 250 PFLOPS. Это достигается за счет того, что все ключевые подсистемы чипа работают на удвоенной скорости.
Важным аспектом является энергопотребление. При удвоении производительности мощность чипа, по оценкам, выросла с ~23 кВт до ~54 кВт. Cerebras утверждает, что архитектура CS-4 способна обеспечить необходимое питание, что свидетельствует об успешном управлении кривой напряжения и частоты без сверхлинейного роста энергозатрат.
CS-4: первый стоечный (rack-scale) кластер Cerebras
Параллельно с процессором представлена система CS-4 — первое решение Cerebras, объединяющее несколько чипов WSE в единый вычислительный узрок внутри одной стойки. В отличие от предыдущей системы CS-3, где стойка содержала два независимых сервера, CS-4 физически и логически связывает три процессора WSE-3 Turbo.
Новая архитектура Nexus позволяет разместить мощное оборудование для питания и охлаждения спереди стойки, а сами чипы — сзади. Это обеспечивает модульность и готовность к будущим поколениям процессоров. Задержка ввода-вывода (I/O Latency) в системе снижена до 2 мкс, что критически важно для эффективного распределения задач между чипами.
Сравнение поколений: от одиночного чипа к кластеру
Переход от архитектуры CS-3 к CS-4 кардинально меняет масштаб вычислений. Если CS-3 предлагал 125 PFLOPS на один чип, то полная стойка CS-4 генерирует 750 PFLOPS. Ниже приведено сравнение ключевых характеристик эволюции платформы Cerebras.
| Параметр | WSE-2 (2022) | WSE-3 (2024) | WSE-3 Turbo (2026) | Система CS-4 (3x WSE-3 Turbo) |
|---|---|---|---|---|
| Вычислительная мощность (Sparse FP16) | 75 PFLOPS | 125 PFLOPS | 250 PFLOPS | 750 PFLOPS |
| Количество AI-ядер | 850,000 | 900,000 | 900,000 | 2,700,000 |
| Объем SRAM | 40 GB | 44 GB | 44 GB | 132 GB |
| Пропускная способность памяти | 20 PB/sec | 21 PB/sec | 43.2 PB/sec | 129.6 PB/sec |
| Пропускная способность Fabric | 27.5 PB/sec | 26.8 PB/sec | 53.5 PB/sec | 160.5 PB/sec |
| Транзисторов | 2.6 Trillion | 4 Trillion | 4 Trillion | 12 Trillion |
| Техпроцесс | TSMC 7nm | TSMC 5nm | TSMC 5nm | TSMC 5nm |
Стратегическое значение для рынка AI
Анонс WSE-3 Turbo и CS-4 позиционирует Cerebras как прямого конкурента NVIDIA и AMD в сегменте высокопроизводительных AI-ускорителей. Переход к стоечной архитектуре позволяет компании конкурировать не только с отдельными GPU, но и с кластерными решениями, предлагая альтернативу на базе wafer-scale вычислений. Увеличение пропускной способности сети до 900 GB/sec в стойке CS-4 закрывает один из главных bottlenecks при обучении больших языковых моделей (LLM).
Источник: ServeTheHome ↗
