DoNews 5小时前
日均消耗500万亿Token,华为计算如何为Agentic时代“提速”?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

撰文 | 李信马

题图 | DoNews 摄

" 今天中国日均 Token 消耗量约 500 万亿,以一张卡每秒 2000 个 Token 吞吐来推演,一天 8 万 6 千 400 秒,100 万亿的 Token,需要 57 万 8 千 700 卡,考虑实际使用过程中负载的变化,通常需要乘一个 1.3 的系数,即需要 75 万 2 千 300 卡,这是智算的规模。对于整个 Infra,还要有沙箱、调度、MCP Server 等通算服务器,支撑 100 万亿 Token,大约需要 7 万台通算服务器。"  

9 月 19 日,在华为全联接大会 2026 期间,华为计算首席战略官朱照生在他的主题演讲中先算了这么一笔账。进入 Agentic 时代,数据中心越建越多,但似乎还是不够用,有时候,一个长程的 Agent 任务则可能十几分钟甚至几个小时。Agent 的每一次思考、评估与回滚,都在放大算力的成本;当 Agent 开始介入企业与个人的日常,分钟级的等待差异,就是效率的分水岭。 

当 Token 成为新的生产要素,算力的分布与互联方式,正在成为决定智能化进程快慢的关键变量。正如朱照生所说:"Token 的输出,应该像闪电一样!" 而问题的关键,就是要解决时延的挑战。随着大模型规模迈向十万亿级,单台服务器已经满足不了模型的训练和推理,超节点集群也因此成为 Agentic Infra 中的正在进行时。2026 世界人工智能大会(WAIC)期间发布的《超节点定义与实践白皮书》将超节点为一种在物理上由多个计算节点通过高效互联协议紧密连接组成,具备跨物理节点统一内存编址能力,逻辑上具备 " 一台计算机 " 特征的计算系统。朱照生认为,未来通算与智算将在同一个机房,通算也要走向超节点,以满足多 Agent 交互所需要的海量沙箱,并瞬时启动。 

自然而然的,Agentic 开发与计算的变化,也会同步发生。

01.

算力新底座  

我们回溯下算力的演进就会发现,从单机多卡、多机集群到 " 超节点 + 集群 ",需求侧的变化驱动着架构的变化。模型参数量与训练集群规模的同步膨胀,让传统集群的局限越来越明显。这种局限是物理性的,通算与智算通常分布在不同机楼,相距数百米甚至数公里;光走一米需要 5 纳秒,1 公里的 RTT 就消耗 10 微秒,如今 Agent 高频交互中的等待基本都发生在网络交换层,把毫秒级的延迟累加为分钟级。 

所以,为了解决这个问题,华为面向 " 超节点 + 集群 " 提出了 Agentic 计算新开发方式,覆盖从单服务器到超节点开发、从进程走向 Agent 思程开发、从 SIMD 到 SIMD+SIMT 新同构开发、从 HiF8 走向低精 HiF4、从人工算子编程到 Agent 编程调优五大维度。 

面向超节点的开发,华为为开发者提供全面的、原子化的开发接口。对于离散、高频次的小块数据计算与通信场景,超节点的内存语义接口,即跨物理节点的 load/store 同步访问,可以大幅降低整个超节点的通信开销。" 举个例子,一个 256 专家并行系统中,如果每颗芯片跑一个 Expert,支持 96 个用户并发,那么模型每一层 All to All 的通信次数超过 700 万,其中超过 90% 的通信只有几个字节的小包。" 朱照生解释。 

而超节点消息语义接口,URMA 异步访问可以支持连续的大块数据的通信。这样,不仅海量 Agent 的沙箱能轻松实现秒级启动,KV Cache 的多级存储、搜索、推荐等场景,一样可以利用鲲鹏通算超节点来提升性能与收益。 

过去操作系统以 " 进程 " 管理按预定逻辑执行的程序,在 Agent 成为主流的运行对象后,需要对开放的目标不断探寻最优解,操作系统也需随之调整。openEuler 提出了 " 思程 " ThinkProcess(简称 ThinkPro),作为 Agent 思考、执行、探索和演进的基本单元,无论是状态管理、还是 CPU、内存等硬件资源的抽象,思程 ThinkPro 都提供了原子级 API:包括 User Space API 和 Kernel Space API,方便开发者根据自己的需要灵活调用。其中,User Space 负责状态管理,支持创建退出、状态融合与回滚;Kernel Space 提供资源抽象,实现通算与智算的融合调度与异构池化。 

面向昇腾 950 新代际,Ascend C 新增了 SIMD 与 SIMT 混合编程模式,开发者可以根据数据特征,在一个算子内核内自由组合两种模式,例如常用的 gather and add 算子,先以 SIMT 实现离散访存,再以 SIMD 完成连续数据累加;同时新增了 RegBase 编程模式,将数据搬运与 Reg 计算交给开发者自由控制。虚拟指令集层面,PTO-ISA 已形成包括基本运算、数据搬运、通信等 8 大类、120 余条虚拟指令,通过 Tile 级抽象实现代际兼容、让算子源码跨代迁移,并以 Auto/Manual 双模式支持细粒度操作底层硬件。用朱照生的话说:"Ascend C 的全新升级,目的是给开发者提供更高性能且更自由的编程环境。"  

数据格式的演进方面,低比特是 AI 计算的既定方向,华为去年发布了 8 位浮点格式 HiFloat8,过去一年 HiFloat8 进展超预期,团体标准已经完成,今年 8 月在 TC28 完成国标立项,并已申请 IEEE study group;超过 100 家科研单位与企业加入 HiFloat 社区,涵盖高校、行业伙伴及高通、科大讯飞等头部企业。 

围绕主流模型的训练与推理,HiFloat8 已完成从芯片、算子、训推框架到模型应用的全流程验证——训推精度与 BF16 平均误差在 0.5% 以内,性能较 BF16 提升约 30%。面向更低比特,HiFloat4 以 E6M2 全局缩放因子与 2 级局部微阶码,在 4bit 范围内实现更高精度的元素表达。预计未来几个月,基于 HiFloat8 的模型将陆续推向市场。 

最后,从算子生成,到模型适配、精度调优,再到行业部署,华为构建了覆盖全流程的 Agent 能力,加速 AI 原生应用在昇腾上的落地。CANNBot 可帮助开发者自动生成算子,常见 Vector 类算子仅需 3 小时,而传统人工开发往往以天计;模型适配环节,Model Agent 自动编排工作流与优化方案,免去繁琐的模型迁移与适配;MindStudio Agent 支持从集群到芯片的多级精度调优,压缩到小时级;行业落地环节,Solution Agent 内置 300 多个参考部署方案,可在几分钟内完成最佳参数寻优,做好 AI 落地的 " 最后一公里 "。

02.

生态商业化  

聊完了 Agentic 计算新开发方式,我们也要清楚,它能否落地,除了技术,还取决于生态的规模、厚度与开放程度。 

过去七年,鲲鹏生态完成了从起步到规模化的跃迁。openEuler 在 2019 年 12 月推出,2021 年捐赠给开放原子开源基金会,累计部署已超过 2000 万套,保持中国服务器操作系统第一份额;鲲鹏产业汇聚 416 万开发者,与 7200 家各行各业的 ISV 伙伴联合打造了 2.8 万个解决方案,并已在金融、互联网、运营商、数字政府等行业核心生产系统全面商用落地。金融的 Core Banking、手机银行,运营商的   CRM、计费,互联网的搜索、推荐、广告等,都是典型的行业解决方案。目前鲲鹏冷热数据识别准确率达 99%,KAE 压缩开销不到 5%(业界通常为 20%),沙箱内存超分率达 30%,一家股份制银行在同等业务性能下,每台服务器内存需求从 512GB 降至 384GB。 

但更令人惊喜的,是昇腾生态的进展。现场,朱照生的一句话震耳欲聋:昇腾已经跨越了生态拐点! 

为什么这么说?从今年 6 月起,CANN 社区就成为了中国活跃度最高的开源社区,月度活跃用户数超过 5200,非华为开发者数量首次超过华为开发者,日均新增合入代码超过 3 万行;基于 CANN 原生训练的大模型与多模态模型已超过 40 个。今年 7 月 28 日,昇腾成为 PyTorch 社区官方支持的首个中国算力平台,全球 PyTorch 开发者可直接选择在昇腾硬件上开发创新。

让开发者真正参与生态,是

华为接下来的核心落点。昇腾开源社区上线了万卡算力集群,注册即送 100 卡时,开发者提交 Issue、PR 即可获得积分,以积分换取更多卡时。对个人开发者与中小企业而言,万卡集群不再是少数大厂的专属资源,而是按贡献即可触达的公共能力。社区的基础设施也在 Agent 化,CI/CD 等待时间从几十分钟压缩到分钟级,Issue 自动答复与 PR 自动审核的质量与人类专家基本持平,从写代码到合入形成完整闭环。 

资金方面,华为已明确过去三年投入 30 亿元,未来三年再投入 50 亿元,建设开源开放的算力新生态: 

能力筑基。依托华为鲲鹏昇腾社区和开发者学习中心,为开发者提供场景化的成长路径与知识体系,帮助开发者打好技术基础。

持续创新。依托鲲鹏昇腾生态创新中心、卓越孵化中心等,提供技术与资源支持,与高校和企业开展联创,让开发者在实战中持续打磨和提升技术能力。

产研协同。通过鲲鹏昇腾种子计划与伙伴计划,从资源、技术、市场等多方面提供支持,与开发者共创未来。

华为把新一代算力基础设施的每一步,都与开发者生态的开放程度绑定在一起。 

当 Agentic 时代到来,算力不再是单点性能的堆叠,而是基础设施的分布与互联、开发范式的开放与效率、生态规模的厚度与活力。华为以开源开放为路径,以 " 超节点 + 集群 " 为底座,把选择权交给开发者,Agentic 时代的答案不会只来自一家企业,但我们期待,Agentic 时代的算力真的能 " 像闪电一样 ",随叫随到、低时延、高吞吐。

关于华为计算的故事,仍在继续。 

往期推荐

AI 支付进入 "ChatGPT 时刻 "?可能还没有那么快

AI 主机,一个新品类开启了它的前半程

把算力 " 叠 " 起来,华为 3D 数据中心重塑 AIDC 新范式

  END

扫码关注

「创新无边界」是我们的 slogan,我们不局限于对互联网行业的追踪与探索,更要向未来、向未知的方向大胆迈进。因此,「打造行业新标杆、解读商业新动向」是我们秉持的方向之一。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

华为 华为全联接大会 数据中心
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论