这几天除了 Personal Agent(个人智能体)之外,AI 圈还有条新闻受到关注 :DeepSeek 下场帮华为开放芯片算子的新闻。
9 月 30 日,DeepSeek 宣布与华为合作,围绕昇腾 AI 芯片开源一系列编程基础设施,包括计算库、通信库,并推进一套基于 128 颗昇腾 950 的 Supernode(超节点)方案。
这其中最值得注意的是 TileLang,一种试图让 AI 芯片编程变得更简单的高层编程语言。
不少媒体都在说:"老黄最担心的事还是发生了,华为即将攻破 CUDA 生态。"
事实真的如此吗?
前哨会员对此应该不会太陌生。王煜全早在 2023 年就和大家讨论过:英伟达真正的壁垒早已经不只是 CUDA。
今年的 AI 产业追踪里,我们又反复提醒大家,CUDA 这道曾经最难复制的软件壁垒,也正在被 AI 一点点拆解。
DeepSeek 和华为这次合作 , 更像 AI 时代产业范式加速变化的一个缩影:AI 一边降低旧壁垒的追赶成本,一边又把竞争推向超节点、AI 工厂和更完整的产业生态。

7 月前哨专题《国产 AI 芯片产业链扫描》PPT
DeepSeek 为什么要亲自下场帮华为写软件?
先看这次 DeepSeek 到底在做什么。
一颗 AI 芯片真正跑起来,中间其实隔着好几层。
最底下当然是昇腾 950 这样的硬件,但有芯片不等于模型就能高效运行。
你还需要大量针对硬件优化过的 Kernel(计算内核),去完成矩阵乘法、Attention(注意力计算)、量化、MoE(混合专家模型)路由这些最基础的操作。
这就是 DeepSeek 这次开放计算库的意义。
同样一个计算任务,普通代码可能只能发挥一半芯片性能,一个高度优化的 Kernel 却可能把硬件性能吃到八九成以上。
所以很多时候,我们看到的 " 芯片性能差距 ",里面其实混着巨大的软件差距。
第二层是通信。
现在的大模型早就不是一张卡独立完成计算。几十张、几百张甚至几万张芯片必须一起工作,尤其是 DeepSeek 这样的 MoE 模型,不同专家可能分散在不同芯片上,每一次训练和推理都需要大量数据来回交换。
如果通信库做不好,128 颗芯片并不会自动变成一台强大的机器,只会变成 128 座互相堵车的小岛。
所以 DeepSeek 这次开放通信库,和华为推进 128 颗昇腾 950 组成的 Supernode(超节点),其实是一体两面 , 解决 " 一群芯片怎么一起算 "。**

华为昇腾 950 超节点
然后才轮到TileLang。
过去想把 GPU(图形处理器)性能压榨到极致,工程师往往要非常理解底层硬件:数据怎么分块、内存怎么搬、线程怎么排、哪些数据放进高速缓存。
CUDA 厉害的地方,就是英伟达用了近二十年,把这套复杂工作逐渐包装成成熟的软件栈和开发体系。
TileLang 则试图再往上一层。开发者不必从头告诉芯片 " 每个线程具体怎么干 ",描述 " 我要完成什么计算、数据如何分块、数据之间是什么关系 ",再让编译器把它翻译成适合不同硬件的底层实现。
TileLang 已经开始支持 CUDA、ROCm(AMD 开放计算软件栈)、Metal(苹果图形与计算接口)等不同后端,面向华为昇腾也出现了 TileLang-Ascend(TileLang 昇腾适配)。
DeepSeek 还基于 TileLang 开源了 TileKernels(高性能计算内核库),把 MoE 路由、量化等真实大模型里的高性能算子放进去。
所以 DeepSeek 亲自来做这件事一点也不奇怪。
芯片公司知道硬件怎么设计,模型公司却最清楚真实的大模型到底怎么 " 折磨 " 硬件:哪个算子最耗时间、MoE 的数据怎么流动、通信堵在哪里、哪些环节最值得优化。
过去是华为造芯片,模型公司来适配;现在开始变成模型公司反过来参与定义,下一代芯片到底应该怎么被使用。
这才是这次合作真正重要的地方。
AI 正在成为攻克 CUDA 的一件新武器
如果只看 DeepSeek,很容易误以为这是中国特有的国产替代故事。
实际上,今年整个 AI 芯片行业都在发生同一件事:大家开始用 AI 写 " 运行 AI 的软件 "。
AMD 就是最典型的例子。
过去开发者把 CUDA 项目迁到 AMD 的 ROCm,虽然已经有 HIPIFY(CUDA 代码迁移工具)这样的自动翻译工具,但仍然麻烦 , 要改算子、调内存、适配不同 GPU 架构,再不断修 Bug(程序缺陷)。
现在 AMD 正在把 Agent(智能体)直接引进这个流程。
它的 MOAT(多智能体迁移工具)可以让 Claude Code(Claude 代码智能体)或者 Codex(代码智能体)自动阅读一个 CUDA 项目:一个 Agent 分析代码,一个负责迁移,一个审查修改,另一个直接在 AMD GPU 上测试,失败后再返回继续调整。
今年推出的 ROCm.AI(AI 原生 ROCm 开发环境)又往前走了一步。
Claude、Codex、Cursor(AI 编程工具)、Gemini(谷歌 AI 模型)都可以直接调用 AMD 提供的 Skills(技能),帮助开发者安装环境、部署模型、寻找问题;Hyperloom(自动性能优化工具)甚至会自己寻找推理瓶颈、修改 Kernel,再验证性能有没有提高。

AMD ROCm.AI 智能体开发工作流
今年 7 月,Anthropic 和 AMD 签署大规模合作时,双方还明确写进协议:Claude 会帮助 AMD 优化 GPU 工作负载,加速 ROCm 开发。
这已经非常接近 "AI 自己帮助竞争芯片补软件生态 "。
另一边,我们介绍过的 Modular 也一直在做类似的事情。
它用 Mojo(编程语言)和 MAX(AI 推理平台),希望开发者写一次程序,底层系统尽可能替他处理不同芯片之间的差异。

Mojo 跨不同 GPU 硬件运行示意
OpenAI 的 Triton(高层 GPU 编程框架)走的也是这个方向。有意思的是,英伟达自己今年也开始给 Triton 提供 CUDA Tile IR(CUDA 分块中间表示)后端,让开发者继续使用更高层的编程方式,再由底层系统映射到英伟达硬件。
Google 甚至发布了 JAXBench(TPU 内核优化基准),专门测试 AI Agent 能不能自主优化 TPU(张量处理器)的底层 Kernel。
这些看起来分散的动作,其实都在指向同一个变化 :CUDA 锁住开发者的软件壁垒,正在被 AI 快速攻破。
AI 竞争的单位,已经从公司变成生态
这才是 DeepSeek 和华为这次合作更值得关注的地方。
如果只是比较一颗芯片快多少、一个编程工具好不好用,很容易低估今天 AI 产业的复杂程度。
英伟达这些年真正做的,就是不断把竞争单位往上推:从 GPU 到 CUDA,再从 CUDA 走向 NVLink(高速芯片互连)、NVSwitch(高速交换芯片)、网络、机架、超节点和 AI Factory(AI 工厂)。

2023 年 6 月《英伟达 &AI 芯片企业分析》专题 PPT
所以前哨早在 2023 年就提醒大家,英伟达真正的生态壁垒已经不只是 CUDA。
今年我们继续追踪 AI 如何反过来降低 CUDA 这样的旧软件壁垒,看到 AI 的竞争早已不是 DeepSeek 对英伟达、华为对英伟达这种简单的 " 一家公司打另一家公司 "。
它越来越像一组生态和另一组生态之间的竞争,而且竞争与合作会同时存在。
大家会争标准、争入口、争利润,也会在不同层级上彼此合作。
这才是这件事真正反映出的趋势:AI 正在加速技术迭代,也在加速产业重新组合。
未来决定胜负的,是谁能把模型、芯片、软件、开发者和应用组成一个迭代速度更快、成本更低、协同效率更高的生态。
这也是王煜全和大家持续追踪科技产业的价值所在:不只看今天谁发布了什么,更要看技术变化之后,新的产业壁垒又在哪里形成。
十一期间购买或续费前哨科技特训营会员,还可获赠蓝区 " 几岁 " 健康手环 1 个,并享 AI 王煜全 5 倍 Token(令牌)使用量(每人每月提问上限 300 次,已享每月 300 次额度的会员不再额外增加)。
如果你也想持续跟踪这些真正改变产业格局的信号,欢迎趁十一活动加入前哨科技特训营。


登录后才可以发布评论哦
打开小程序可以发布评论哦