星途科讯 38分钟前
Cerebras发布WSE-3T:算力带宽翻倍,CS-4机架去交换直连
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

针对高速 AI 推理中内存带宽这一核心瓶颈,Cerebras 周二发布了新一代晶圆级引擎(WSE)及 Nexus 机架系统。其餐盘大小的 AI 加速器内存带宽高达 21.6 PB/s,号称是英伟达或 AMD 旗舰 GPU 的 1000 倍。新系统旨在将每瓦吞吐量提升至上一代的十倍。

WSE-3T:频率翻倍的 " 涡轮 " 版

新发布的 WSE-3T(T 代表 Turbo)在计算能力、内存互连总线和 I/O 带宽上均实现翻倍。数据显示,其稀疏 FP16 算力从 125 PFLOPS 升至 250 PFLOPS,密集 FP16 算力从 12.5 PFLOPS 升至 25 PFLOPS,内存带宽从 21.6 PB/s 增至 43.2 PB/s,I/O 带宽从 1.2 Tbps 增至 2.4 Tbps。

值得注意的是,WSE-3T 并未改变硅片基础规格。其晶圆面积(46,225 mm ²)、工艺节点(台积电 5nm)、晶体管数量(4 万亿)、核心数(90 万)及 SRAM 容量(44 GB)均与两年前的 WSE-3 保持一致。性能提升主要源于供电效率的优化,使芯片工作频率从 1.4 GHz 翻倍至 2.8 GHz,从而实现更高的令牌生成速度。晶圆级 TDP 预计从 15 kW 增至 33 kW,系统级 TDP 预计从 23 kW 增至 46 kW。

尽管纸面数据亮眼,但实际效能需理性看待。Cerebras 的性能宣传高度依赖稀疏性,而大语言模型(LLM)推理通常更看重密集算力。若按 10 倍稀疏度折算,WSE-3T 的密集 FP16 性能约为 25 PFLOPS。此外,峰值内存带宽可能仅为理论值,因为在 LLM 推理中,单芯片往往难以饱和其 SRAM。

在应用策略上,Cerebras 不再试图独立运行整个推理堆栈,而是与亚马逊云科技(AWS)和 AMD 合作,将计算密集的提示处理部分卸载至 Trainium XPUs 和 Instinct GPU,自身则专注于充当解码加速器。凭借板上巨大的 SRAM 容量,Cerebras 仅需几十个处理单元即可运行万亿参数模型,远低于其他方案所需的数千个单元。鉴于 SRAM 容量自 WSE-2 以来未显著增加,业界推测下一代 WSE-4 可能会在适度提升算力的同时,重点翻倍 SRAM 容量。

CS-4 机架:模块化与去交换直连

伴随 WSE-3T 发布的 CS-4 机架系统,标志着 Cerebras 正式进军机架规模计算。借鉴英伟达 NVL72 和 AMD Helios 的思路,CS-4 采用模块化架构,将计算、供电和布线分离。芯片被封装在名为 " 背包 " 的独立模块中,每个 CS-4 最多可容纳三个 " 背包 ",插入机架背面,正面则部署电源架。由于单系统加速器数量增加三倍,预计总系统功耗在 120 kW 至 140 kW 之间,虽高于前代,但相比竞品即将推出的 240-250 kW 机架仍显保守。

在互联方面,CS-4 通过移除额外交换机,让芯片直接通信,将延迟从 5 微秒降至 2 微秒。这种二维环形拓扑结构支持流水线并行,特别适合对延迟敏感的多加速器推理场景。虽然也支持基于 RoCE 的交换式 fabric,但延迟会略有增加。据基准测试数据,在单个 CS-4 系统上,gpt-oss-120b 模型的推理速度可达每秒 4400 个令牌,远超当前基于 GPU 服务的每秒约 350 个令牌。该拓扑结构理论上可支持高达 50 万亿参数的模型。

Cerebras 预计,首批基于 CS-4 的系统将于本季度晚些时候上线。

【星途科讯 图文丨 Patrick 首发于 ZAKER 科技,转载请注明出处】

评论
大家都在看