9 月 8 日,Arm 在上海举办 Arm Everywhere China 年度大会,发布移动端计算子系统 CSS for Mobile 2、云端计算子系统 Neoverse CSS N4,并更新了自有芯片 AGI CPU 的合作进展。
两条产品线,都把 CPU 放在了 AI 叙事的中心。手机 CPU 加强小模型推理,服务器 CPU 瞄准智能体运行。Arm 押注的是同一个变化:当用户开始让 AI 办事,模型给出的答案后面,还会跟着一连串需要执行的程序。
这些程序运行得如何,会决定 AI 究竟能替人省多少时间,也决定了算力预算该花在哪里。
大会现场展示的 Neoverse 计算子系统与 AGI CPU 模型给出方案以后还有活要干
让 AI 解释怎样分析一份销售表,它给出步骤,任务大致就结束了。让 AI 直接交付分析报告,后面的工作才刚开始。
它可能要读取文件,检查字段,写一段程序清洗数据,再运行程序生成图表。如果执行报错,还要把错误交回模型,修改代码,重新运行。模型与执行环境如此往返,直到产出结果。
在这条流程里,模型推理通常可以借助 GPU 或其他加速器,而读取数据、运行程序、管理进程等大量工作,仍由 CPU 及其所在的系统处理。
其中不少工作原本就由 CPU 承担。过去是人打开软件、发起操作、等待结果;智能体可以把这些步骤串起来,自动连续执行,也可以同时开展几个任务。变化发生在调用频率、并发量和资源调度上。随着这类应用增多,云平台除了供应模型推理,还要为它们准备足够的执行环境。
因此,模型提速并不保证整项任务按同样比例提速。程序排队、数据读取缓慢,或者工具调用迟迟没有返回,都可能让更快的模型停在那里等。CPU 性能只是其中一个因素,内存、存储和网络也会影响结果。用户等的是一份完成的报告,后台各个环节不能只顾自己跑分。
Arm 在本次云端发布中,特别强调了这种模型之外的计算需求。它同时区分了两类诉求:一些基础设施更看重吞吐效率,另一些智能体应用则对响应速度更敏感。前者关心一台机器能承载多少工作,后者关心眼前这项工作能否尽快往下走。
Arm 瞄准的增量,来自智能体使用规模扩大后增加的执行次数与并发任务。是否需要采购更多 CPU,取决于这些新增任务能否被现有系统消化。
在数据中心,服务器容量、电力和成本会约束这些执行任务。大量任务同时运行,会争用内存和 I/O 资源;核心再多,数据送不过来,执行效率照样上不去。
新发布的 Neoverse CSS N4 便同时增加计算密度与数据传输能力。产品资料显示,它单颗裸片最高支持 128 核,支持 LPDDR6 内存和 PCIe Gen 7 互连。相较 CSS N3,每插槽性能最高达到 2 倍,内存带宽最高达到 1.75 倍。这是平台层面的比较,不能全部归因于单个 CPU 核心变快。

CSS N4 同时提高核心容量、内存带宽和互连能力
对于前面那份销售报告,平台既需要让单个任务尽快读到数据、执行代码,也需要在许多用户同时提交任务时保持服务。扩充 CPU 核心、内存和互连,回应的是这两种压力。至于能多承载多少智能体,还要用具体任务和并发条件验证,发布会上的倍数不能直接换算成业务容量。
同一套任务到了手机上还要重算功耗
到了手机上,CPU 的角色又多了一层。它既要支持助手调用应用和系统服务,也可能直接承担部分小模型推理。后者取决于模型规模、延迟与功耗条件。
手机只有一块电池。一个经常唤醒、持续维护状态的助手,即使每次调用都不重,累积起来的能耗也会影响续航。Arm 在新一代移动平台里,同时加强了 CPU 的 AI 计算能力与能效。CSS for Mobile 2 中的 C2 集群,由 C2-Ultra 和偏重能效的 C2-Pro 组成,并配备双 SME2 单元。SME2 是第二代可伸缩矩阵扩展,可以提高 CPU 执行矩阵运算的效率,为部分小模型提供直接在 CPU 上运行的路径。
对系统来说,多一条运行路径就多一种安排任务的选择。模型多大、响应要多快、当前设备有多少功耗余量,都会影响计算该交给哪个单元。实际收益需要放到完整的应用中测,不能由一项峰值算力替代。
按照 Arm 公布的测试数据,相较 C1-Ultra,C2-Ultra 的 AI 性能最高达到 1.7 倍,单线程性能最高提升 15%,同等性能下功耗最高降低 38%。三项指标对应不同的性能和能耗比较,实际手机的表现还取决于芯片配置、软件与散热。
同一平台中的 Mali G2-Ultra NX,则把专用神经网络加速器集成到 GPU 内部,用于神经图形等负载。Arm 也在加强其他计算单元,让不同任务各有去处。
Arm 准备把这部分需求做到芯片生意里
计算需求发生变化,芯片公司接下来要决定以什么产品承接它。Arm 给客户准备了两条路。
CSS N4 面向仍要开发定制芯片的客户。Arm 先把 CPU 及相关系统部件集成并验证,客户再调整核心数量、缓存、内存和 I/O 等配置,用于云计算、数据处理单元 DPU、网络及其他专用设计。相比只拿到处理器 IP,客户少做一部分基础集成,又保留了决定产品配置的空间。
另一条路是采购 Arm 设计的 AGI CPU。这款芯片已于今年3 月 24 日发布,9 月大会更新的是合作与落地进展。据 Arm 本次发布资料介绍,OpenAI、Meta、Oracle、联想、Supermicro 等企业正在围绕它开发解决方案,火山引擎则在推进首批基于 AGI CPU 的智能体沙箱上市。
沙箱正是智能体执行代码的一种环境。平台需要隔离不同任务,分配计算资源,并处理网络和存储访问。Arm 与火山引擎的合作,把前面讨论的 CPU 需求落到了一个具体产品方向上。

火山引擎推进基于 Arm AGI CPU 的云服务与智能体沙箱
从 IP 到 CSS,再到成品芯片,Arm 参与一款产品的深度增加了。以往,客户从 Arm 获得设计,再完成芯片开发和产品交付;现在,客户可以把其中更多环节交给 Arm。由此增加的商业价值,也伴随着验证、供应和客户支持等责任,收入机会不能简单等同于利润增长。
更微妙的是客户关系。Arm 的芯片客户依靠自己的产品赚钱,当 Arm 也直接供应芯片,双方就可能在部分市场争取相同的订单。CSS N4 与 AGI CPU 并行,给客户留下了不同选择,却不会自动消除这种张力。Arm 如何支持伙伴的定制需求,如何安排自己的产品范围,都会影响这门生意能走多远。
这部分市场能有多大,还取决于智能体能否在实际业务中持续工作。应用只停留在演示阶段,就支撑不起长期的基础设施投入。即使需求增长,Arm 也要靠性能、能效和系统成本,争取客户选择自己的方案。
但评价 AI 算力的尺度已经可以向前多走一步。模型每秒生成多少内容,解释不了用户为什么仍在等待。等一份报告真的生成、一次操作确实完成,AI 的能力才算交到了用户手上。Arm 想争取的,就是这段从模型输出到任务完成之间的生意。



登录后才可以发布评论哦
打开小程序可以发布评论哦