驱动之家 6小时前
CUDA已不足为虑:AMD显卡AI神优化 2周时间性能涨3倍
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 2 日消息,NVIDIA 的 CUDA 公认护城河能力极高,AMD 的显卡跑实际应用往往要比 NVIDIA 吃亏很多,然而 AMD 最近说 CUDA 不足为虑也是真的,A 卡在优化上也做到神速提升。

SemiAnalysis 日前发布了一份 AMD 与 NVIDIA 显卡在 Qwen3.5 397B 及 MiniMax M3 两款开源大模型上的性能及成本对比,出战的是两边当前最强的 MI355X 显卡与 B300 显卡。

AMD 这边对比了两个时间点,一个是 8 月 12 日,一个是最新的 8 月 31 日,因为 NVIDIA 的显卡性能一如既往保持水准,AMD 则是在快速优化提升。

在 Qwen3.5 大模型上,AMD 在短短两周时间内就大幅提升了 MI355X 显卡的表现,8 月 12 日时 90 TTFT(首字时间)大多在 2.0 秒至 5.5 秒之间; 8 月 31 日时大部分工况的时延压缩到了 0.9 秒至 3.5 秒区间,响应速度提升近一倍。

此前 MI355X 的吞吐性价比天花板在 50M tok/$ 左右;优化后在低时延段(如 1.5s -2.5s)就突破了 80M-110M tok/$,并在 TP2 工况下最高达到了 ~140M tok/$,差不多三倍水平。

这个性能也非常接近 NVIDIA 当前的旗舰 AI 卡 B300 了,不过后者在低时延下的性能依然领先。

在 MiniMax M3 大模型上也有类似的结果,8 月 12 日时 MI3550X 跟 B300 差距很大,但到了 8 月 31 日,优化后的 MI355X 交互速度从之前大约 55tok/s/user 提升到了 230tok/s/user,也是三倍左右的提升。

整体来说,AMD 在过去两周时间内就大幅优化了 MI355X 的性能,两个开源大模型中各种工况下速度提升 2 倍到 3 倍是不成问题的,部分情况下提升超过 3 倍,尽管还不能说超越 B300,但性能水平也是天差地别了。

别忘了,AMD 的显卡在性价比上依然有优势的,MI355X 的每小时 Tco 成本是 1.5 美元,B300 是 2.26 美元,差距在 1/3 左右,折算下来 MI355X 的整体效益也很可观了。

AMD 的这些提升基本上符合他们发布 ROCm 10 时的宣传,在硬件不变的情况下各种优化就能把大模型的推理性能提升 3 倍以上。

有了这些基础,AMD 真的可以不用仰视 CUDA 的生态优势了,今年还会有性能更强大的 MI455X 新一代 AI 平台上市,继续优化的话说不定可以赶超 NVIDIA 一次。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

amd ai nvidia 开源 生态优势
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论