星途科讯 3小时前
AMD联手Cerebras开发超低延迟AI推理方案,能效或优于英伟达
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

AMD 已联合芯片初创公司 Cerebras Systems,共同开发一种解耦计算平台。该平台将 AMD Instinct 系列 GPU 与 Cerebras 基于 SRAM 的 AI 加速器相结合,旨在为代理型工作负载(Agentic Workloads)提供超低延迟的推理能力。

这项合作在 AMD 首席执行官苏姿丰(Lisa Su)周四发表的 " 推进 AI" 主题演讲中正式公布。此举填补了 AMD 产品组合中的关键空白。此前,英伟达曾花费 200 亿美元收购 Groq 相关人才,以弥补其在快速推理领域的短板。

SRAM 技术赋能高效推理

Cerebras 联合创始人兼首席执行官安德鲁 · 费尔德曼(Andrew Feldman)曾批评英伟达仅为 "AI 军火商 "。与依赖 HBM4 显存的 GPU 不同,Cerebras 的晶圆级引擎(WSE)采用片上 SRAM 技术,速度比传统方案高出数个数量级。凭借这一优势,Cerebras 已成为全球最快的推理服务提供商之一,输出速度经常超过每秒 2,000 个 Token。

在该联合方案中,AMD Instinct GPU 负责处理计算密集型的提示词(Prompt)操作,而内存密集型的 Token 生成任务则卸载给 Cerebras 的 WSE 加速器。双方旨在实现更高交互性,同时不牺牲吞吐量或增加成本。费尔德曼表示,这种组合结合了 Instinct 在性能和内存容量上的优势,以及 WSE 在 SRAM 和内存带宽上的领先地位,能提供无与伦比的解决方案。

尽管两家公司未透露具体数据,但预计该组合将使每瓦特电力消耗所产生的 Token 数量提升高达 5 倍。

对标 Groq LPU,效率显著优化

Cerebras 加速器在此处的角色,类似于英伟达在 GTC 大会上随 Vera Rubin 机架系统发布的 Groq LPU(语言处理单元)。然而,在服务像 Kimi K2.5 这样的万亿参数模型时,英伟达方案需要相当于 2,000 颗 Groq LPU 的 SRAM 资源,而 AMD 与 Cerebras 的组合最多只需几十个加速器即可胜任。

该联合解决方案将于今年晚些时候在 Cerebras Cloud 上线。苏姿丰在随后的新闻发布会上表示,Cerebras 的技术与 Helios 配合良好,AMD 开放生态系统的理念是与拥有有用技术的多家公司合作。她补充道,未来将继续进行更多的工作负载解耦尝试。

【星途科讯 图文丨略略 首发于 ZAKER 科技,转载请注明出处】

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

amd 英伟达 ai 首席执行官
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论