快科技 9 月 6 日消息,OpenAI 发布的 GPT-6 Astra 大模型这两天还在刷屏,它是该公司首个使用 10 万卡训练的大模型,光这些显卡的费用就要 60 亿美元了,这也是国产大模型很难追赶的领域。
国内大模型发展最大的限制就是缺少足够的算力芯片,国内当然也在高强度发展自己的 AI 芯片,不论是华为、寒武纪、壁仞、摩尔线程还是百度、阿里、字节、腾讯等公司都在研发各种 AI 芯片。
但是大家也要面对现实,国产 AI 芯片在性能上跟美国的 AI 芯片差距还是不小的,下图汇总的国内外 AI 芯片算力性能对比可见一斑。

这张图对比了 AI 芯片的内存带宽及 FP16 算力性能 2 个指标,这都是 AI 大模型训练、推理的核心指标,国产中做得最好的还是华为的昇腾,性能追到了 780TFLOPS,带宽能到 780GB/s,带宽性能超过了 H100,算力性能还差距比较大。
说得更直白一点,国产 AI 芯片现在连 3 年前的 NVIDIA H200 显卡的性能都很难追上,后者 1700TFLOPS 的性能、900GB/s 的带宽放到现在都不弱。
当然,这张图里面的对比数据不算新了,华为已经有比昇腾 910C 更强的昇腾 950 了,用了自研的高性能内存,带宽也做到 4TB/s 了,整体性能虽然还是比 H200 差一些,但差距没有现在这样的代差了。
其他公司如寒武纪、摩尔线程、沐曦、壁仞等自研的 AI 芯片新一代产品的性能也大幅提升,前途还是很光明的。
国产 AI 现在被卡脖子的地方也就是上面 2 个关键指标——算力意味着先进工艺,带宽意味着内存,尤其是 HBM 内存,工艺及内存的产能不能大规模释放出来,国产 AI 芯片追赶 NVIDIA 的速度就会被拖累,不仅没法缩小差距,可能还会被现在的 B200、B300 及 Rubin Ultra 显卡甩开,生态就更难建立起来了。

往好的方面来看,这两个难题的解决速度比大家想象中的更快,先进工艺有了华为韬定律给出了新的方向,密度及性能大幅提升,明年的鲲鹏 960 CPU、昇腾 960 AI 性能会有一波强力拉升,这个领域的突破值得关注。

【本文结束】如需转载请务必注明出处:快科技
责任编辑:宪瑞


登录后才可以发布评论哦
打开小程序可以发布评论哦