快科技 9 月 2 日消息,NVIDIA 的 CUDA 公认护城河能力极高,AMD 的显卡跑实际应用往往要比 NVIDIA 吃亏很多,然而 AMD 最近说 CUDA 不足为虑也是真的,A 卡在优化上也做到神速提升。
SemiAnalysis 日前发布了一份 AMD 与 NVIDIA 显卡在 Qwen3.5 397B 及 MiniMax M3 两款开源大模型上的性能及成本对比,出战的是两边当前最强的 MI355X 显卡与 B300 显卡。
AMD 这边对比了两个时间点,一个是 8 月 12 日,一个是最新的 8 月 31 日,因为 NVIDIA 的显卡性能一如既往保持水准,AMD 则是在快速优化提升。

在 Qwen3.5 大模型上,AMD 在短短两周时间内就大幅提升了 MI355X 显卡的表现,8 月 12 日时 90 TTFT(首字时间)大多在 2.0 秒至 5.5 秒之间; 8 月 31 日时大部分工况的时延压缩到了 0.9 秒至 3.5 秒区间,响应速度提升近一倍。
此前 MI355X 的吞吐性价比天花板在 50M tok/$ 左右;优化后在低时延段(如 1.5s -2.5s)就突破了 80M-110M tok/$,并在 TP2 工况下最高达到了 ~140M tok/$,差不多三倍水平。
这个性能也非常接近 NVIDIA 当前的旗舰 AI 卡 B300 了,不过后者在低时延下的性能依然领先。

在 MiniMax M3 大模型上也有类似的结果,8 月 12 日时 MI3550X 跟 B300 差距很大,但到了 8 月 31 日,优化后的 MI355X 交互速度从之前大约 55tok/s/user 提升到了 230tok/s/user,也是三倍左右的提升。

整体来说,AMD 在过去两周时间内就大幅优化了 MI355X 的性能,两个开源大模型中各种工况下速度提升 2 倍到 3 倍是不成问题的,部分情况下提升超过 3 倍,尽管还不能说超越 B300,但性能水平也是天差地别了。
别忘了,AMD 的显卡在性价比上依然有优势的,MI355X 的每小时 Tco 成本是 1.5 美元,B300 是 2.26 美元,差距在 1/3 左右,折算下来 MI355X 的整体效益也很可观了。

AMD 的这些提升基本上符合他们发布 ROCm 10 时的宣传,在硬件不变的情况下各种优化就能把大模型的推理性能提升 3 倍以上。
有了这些基础,AMD 真的可以不用仰视 CUDA 的生态优势了,今年还会有性能更强大的 MI455X 新一代 AI 平台上市,继续优化的话说不定可以赶超 NVIDIA 一次。



登录后才可以发布评论哦
打开小程序可以发布评论哦