驱动之家 9小时前
Kimi K3也为国产AI芯片优化:华为昇腾950DT性能超越NVIDIA B300
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 7 月 22 日消息,最近国产大模型 Kimi K3 的发布在国内外引发了热议,2.8 万亿参数的 K3 性能已经达到了世界顶级水平,前端编程甚至位列第一,要想跑通 K3 这个大模型,AI 平台的性能也至关重要。

以 K3 的参数量来看,当前已上市的平台中当然是 NVIDIA 的 Blackwell B200/B300 是最强的,但 K3 显然也会对国产 AI 平台做优化,也有国外的网友对比了华为昇腾 950DT 与 NVIDIA 显卡 B300 运行 K3 的效率。

他这个计算不是实际机器跑出来的,毕竟昇腾 950DT 国内也才刚开始部署,海外还拿不到,是基于 950DT 的参数来计算的。

对比的除了有 B300 之外,还有华为上一代的昇腾 910C 平台,可以看出昇腾 950DT 在每瓦 Token 生成数量上是占优的。

考虑到昇腾 950DT 在制程工艺上是要比 B300 落后两代水平的,因此华为自研的 AI 平台靠整体系统依然能获得优势,非常不容易,但这也彰显了华为提出韬定律是多么正确的思路。

昇腾 950 系列有昇腾 950PR 和昇腾 950DT 两款产品组成,二者使用的处理器核心是一样的,但搭配的内存系统不同,针对的市场也是不同的。

根据华为的说法,昇腾 950PR 采用的是昇腾 950 核心 +HiBL 1.0 内存,主要面向推理 Prefill 阶段和推荐业务场景,相比高性能、高价格的 HBM3e/4e,能够大大降低推理 Prefill 阶段和推荐业务的投资。

昇腾 950DT 更注重推理 Decode 阶段和训练场景,由于推理 Decode 阶段和训练对互联带宽和访存带宽要求高,华为开发了 HiZQ 2.0,使内存容量达到 144GB,内存访问带宽达到 4TB/s。同时把互联带宽提升到了 2TB/s。

华为的 Altas 950 超节点集群最大可支持 8192 张基于昇腾 950DT 的昇腾计算卡高速互联,卡规模是 Atlas 900 超节点(384 卡)的 20 多倍,是 NVIDIA NVL144 的 56.8 倍。

8192 张卡的总 FP8 算力达到 8EFLOPS,FP4 算力达 16EFLOPS,互联带宽高达 16.3PB/s,总内存容量达 1152TB,相比 Atlas 900 超节点,训练性能提升 17 倍,达到 4.91M TPS。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

华为 ai nvidia kimi 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论