新 CPU 集群将 AI 模型性能提升 70%。
作者 | ZeR0
编辑 | 漠影
芯东西 9 月 8 日报道,刚刚,在 Arm 年度旗舰活动 Arm Everywhere China 上,Arm 推出 AI 原生移动终端计算子系统 CSS for Mobile 2,及其包含的集成 SME2 的 Arm C2 CPU 集群、首款 AI 原生 GPU Mali G2-Ultra NX。

如今移动端计算需求持续提升:智能体要持续进行感知、记忆、推理和行动,游戏想把 PC 级光照、光追和复杂场景塞进手机,智能手机必须在巴掌大的空间里精打细算,这要求从整个计算平台层面进行协同优化。
对此,Arm 开始重新安排一台手机里的计算预算。其设计理念的集大成者,便是 CSS for Mobile 2。

Arm CSS for Mobile 2 主要由以下部分组成:

C2 CPU 集群:融合 C2-Ultra CPU、C2-Pro CPU 以及第二代 Arm 可伸缩矩阵扩展(SME2)技术,承担整个异构系统的任务编排,为低延迟、持续运行的端侧智能体提供更快响应。
Mali G2-Ultra NX GPU:集成专用神经网络加速器、全新执行引擎和第三代光线追踪单元,实现紧密耦合的 AI 加速,通过 3 项神经网络技术提升移动图形质量、帧率和能效,助力开发者在移动设备上打造桌面级游戏体验。
SI L2 系统互连:支持 LPDDR6,面向缓存一致性、低延迟和新内存类型优化,优化 CPU、GPU 与内存之间的数据传输路径,提供更快的内存访问,CPU 到 DRAM 的延迟比上一代 SI L1 减少约 45%,具备一致性和服务质量(QoS)能力,帮助管理和优化多个计算资源之间的任务调度与优先级分配。

对比上一代,C2 CPU 集群实现单线程性能最高提升 15%,集群级多线程性能提升 12%,最新 AI 模型性能最高提升 70%;Mali G2-Ultra NX 在部分神经图形场景中可将帧率和每帧能效分别提升多达 4 倍。

与上一代产品相比,搭载全新执行引擎和光追单元 RTUv3 的 Mali G2-Ultra NX 还使传统图形渲染提升:基准测试性能最高提升 20%,非 AI 游戏性能提升 14%,DRAM 流量最多降低 13%。

CPU 少等一点,GPU 少算一点,内存少搬一点,软件少折腾一点,省下来的每一毫秒、每一毫瓦,都为更多的智能、更流畅的画质、更长的续航腾出空间。
01.
Arm CSS for Mobile 2:
系统级协同,提升性能和响应速度
先来想象两个手机使用场景:
一个是智能体场景。用户把临近日期的结婚纪念日晚餐交给手机智能体。智能体要听懂语音,翻出日历里的日期,从照片和历史记录里寻找两个人的饮食偏好,搜索餐厅,再完成预订、发消息和查看当日菜单。一旦餐厅满了或用户不满意,整套流程还要重新来一遍。
另一个是手游场景。玩家走进洞穴,光会照亮环境、制造阴影,也会直接参与叙事和玩法。过去更常出现在 PC 和主机上的实时光照、光线追踪与虚幻引擎,被塞进了功耗和散热都极其有限的手机里。
前者考验手机能否根据一句话执行一连串行动,后者考验手机能否在几瓦功耗下实现更复杂的画面。此类任务的性能表现,都与 3 个维度紧密相关:各任务阶段的执行速度、数据在不同计算引擎间的传输效率、系统对全任务流程的协同调度能力。
这需要一个从系统层面进行设计和优化的计算平台。
Arm 交出的答卷是 CSS for Mobile 2,通过整合 Arm C2 CPU 集群、Mali G2-Ultra NX GPU、系统技术、软件与开发工具,从整体工作负载的角度,统筹优化性能、能效和数据传输效率。

面对高频并发的 AI 交互,抑或是复杂的图形工作负载,整套系统都能在移动设备的功耗、散热限制条件下高效运行,维持灵敏响应。
CSS for Mobile 2 还将系统优化延伸至物理实现阶段,使合作伙伴在开展 SoC 集成之前,便能将功耗、性能和面积(PPA)与架构设计进行协同考量。
Arm 合作伙伴可根据产品定位、性能目标和市场需求,既可以单独选用各个组件,又可以将其与自研 IP 或第三方 IP 结合,在更广泛的 CSS 配置中灵活集成,从而打造差异化的系统设计。

02.
C2 CPU 集群:AI 模型性能提升 70%,
更快完成智能体工作流
在 Arm CSS for Mobile 2 平台中,Arm C2 CPU 集群提供了支撑智能体 AI 工作流所需的可编程算力与编排能力,负责协调整个系统中的计算活动,决定每个阶段计算任务应该跑在 CPU、GPU、AI 芯片还是云端。
Arm C2 CPU 集群融合 C2-Ultra CPU、C2-Pro CPU 以及第二代 Arm 可伸缩矩阵扩展(SME2)技术,不仅提升了日常计算性能,还增强了端侧 AI 能力,为语音处理、信息检索和模型执行等工作负载提供更强支持。

C2-Ultra 提供平台中最高的单线程性能,重点改善应用启动、UI 交互、智能体编排和突发负载响应,相比上一代峰值性能提升超过 15%,相同性能下功耗降低 38%,运行微信、邮箱等任务的平均性能提升 12%。与搭载 SME2 的 C1-Ultra 相比,C2-Ultra 的峰值 AI 性能提升 70%。

C2-Pro 面向持续性能,在长时间工作负载中兼顾性能和能效,微架构延续上一代 C1-Pro,并可利用 N2 等先进制程节点提高频率和实现能力。
DSU(DynamIQ 共享单元)连接各 CPU 核心,为集群提供共享 L3 缓存,并负责核心之间更高效的数据与指令共享。

以 2 个 C2-Ultra 和 6 个 C2-Pro 的 8 核旗舰配置为例,C2 CPU 集群相较上一代实现:
最新 AI 模型性能最高提升达 1.7 倍;
单线程性能最高提升 15%,可降低单次决策和系统响应的延迟;
网页浏览速度提升 15%,应用启动速度提升 12%,进一步缩短了服务访问和任务执行所需的时间;
集群级多线程性能提升 12%,支持知识检索、模型准备、应用执行等任务并行处理。

合作伙伴可以根据实际需求,对 Arm 核心进行灵活配置。Arm 小核心通常按 2-3 年节奏更新,因此今年没发新的 Nano 级小核心。

Arm C2 CPU 集群中,实现 AI 加速的关键是 SME2 引擎,能在编码阶段计算每字节更多的 MAC。相较上一代,SME2 的 AI 算力翻倍,接近 6TOPS,非常适合跑对延迟敏感的轻量级端侧 AI 模型。
支付宝、安卓、OPPO、vivo、三星、网易伏羲、百度飞桨、阿里千问、淘宝、腾讯混元、腾讯多媒体实验室、虚幻引擎、Unity 中国等都是 SME2 生态伙伴。

端侧语言模型的编码阶段以矩阵乘法为主,属于计算密集型工作,SME2 可以直接提速;进入逐 Token 解码,模型权重需要反复从内存读取,瓶颈很快从计算转向带宽。
对此,C2 CPU 集群通过私有 L2 与共享 L3 缓存减少访问系统级缓存和 DRAM 的次数,为轻量级工作负载提供更低延迟。

同时,SME2 架构中的查找表指令 LUTi 让 2-bit、4-bit 等低比特权重一直保持压缩状态,直到进入计算核心时,再批量展开成 INT8、FP16 或 FP32 等计算格式,从而能消除查找繁重工作负载的内存访问,减少内存容量需求。

在涵盖语音处理、记忆检索、推理、应用执行和网页浏览等环节的端到端智能体 AI 工作流测试中,相比上一代配置,搭载 SME2 的 C2-Ultra 配置整体性能提升 24%。

运行语音转文本模型时,搭载 SME2 的 Arm C2-Ultra 相比 C1-Ultra 可降低 40% 的延迟,让语音指令响应更快。

在记忆阶段,搭载 SME2 的 C2-Ultra 的内存信息检索与搜索性能较上一代提升 41%,可助力智能体更快速地访问设备端存储的上下文信息。

在推理阶段,小语言模型能够将用户请求与检索到的上下文结合起来,生成结构化指令并调用相应工具,以执行下一步操作。在跑测试的各类模型中,C2-Ultra 平均速度较上一代提升 25%。

03.
首款 AI 原生 Mali GPU:直接集成
神经网络加速器,把 PC 级游戏体验塞进手机
如何在手机端实现更高清、逼真、精细、稳定的游戏视觉体验?这关系到 GPU 的进化。
Arm 去年通过 SME2 增强了 CPU 的 AI 能力,今年则进一步把 AI 原生能力扩展到 GPU,让 AI 与传统渲染重新分工,简单内容继续交给传统 GPU,复杂光照、超分、降噪和插帧则由神经网络承担。
新发布的 Arm Mali G2-Ultra NX 是 Arm 首款 AI 原生 Mali GPU,通过将专用神经网络加速器紧密集成至着色器核心,并结合全新执行引擎和第三代光线追踪单元(RTUv3),为移动图形带来 AI 原生能力。

更复杂的光照会增加计算和数据移动需求,而神经网络技术有助于控制成本,将更强大的光线追踪硬件与神经网络技术相结合,可在移动渲染限制下,更高效地呈现更丰富的视觉细节。
腾讯游戏已将自身 AI 创新与 Arm 的神经图形技术结合,验证神经图形能提升移动设备上的帧率和能效,同时保持出色的画面质量;Unity 中国也会把 Arm GPU 与神经加速能力集成到团结引擎核心层;网易《燕云十六声》游戏计划在今年加入 Arm NSS 支持。

1、将 AI 加速能力集成到图形处理管线,兼顾画质提升和功耗控制
Mali G2-Ultra NX 把专用神经网络加速器直接嵌入着色器核心,能复用 GPU 的内存系统、一致性缓存和控制结构,神经网络加速器不工作时还可以通过电源门控关闭,可在约 1W 功耗范围内呈现惊艳图形。
这有助于减少数据在不同计算单元之间的传输,并提升整个管线的执行效率,让图形、通用计算和神经网络能够并行运行。

通过将传统渲染与神经网络技术相结合,开发者能在保持画面质量的同时,降低 GPU 和系统工作负载。

以下三项神经图形技术充分展示了这一架构所带来的能力:

(1)神经超级采样(NSS,Neural Super Sampling):通过低分辨率渲染结果,重建更高分辨率图像。例如,系统可以只渲染约 1/4 的目标像素,其余细节由模型补全,从而降低传统渲染开销。

相比传统渲染,加 NSS 后可实现几乎翻倍的帧率、减半的外部内存流量。


(2)神经帧率提升(NFRU,Neural Frame Rate Upscaling):通过在两个真实渲染帧之间生成一个中间帧来提高帧率,实现更流畅的游戏体验。

在《光影新生》游戏中,它使 MegaLights 可使用超过 1000 个光源,这在过去的移动设备上并不可行。
基于 NFRU,Mali G2-Ultra NX 可支持 120fps 的游戏稳定运行,并将内存流量减少 33%。

(3)神经超级采样与降噪(NSSD,Neural Super Sampling and Denoising):结合基于神经网络的超分辨率重建与降噪技术,让系统在减少每像素光线数量之后,仍能恢复较为干净的画面,从而在具有复杂光照和阴影的高负载光线追踪场景中提升图像质量。

Arm 使用的是卷积神经网络,从游戏真实渲染数据中训练,再结合颜色、深度、运动向量和历史帧完成超分、插值与降噪。
相关模型已上传至 Hugging Face 和 GitHub。开发者可针对不同游戏内容、艺术风格和质量目标重新训练或微调模型,让模型适应独特的美术风格。
在 Arm 展示的三帧序列里,第一帧和第三帧各自只渲染 1/4 像素,剩余部分由 NSS 或 NSSD 重建。中间一帧完全由 NFRU 生成。三帧合计只有 1/8 像素由传统方式实际渲染,其余 7/8 由 AI 重建或生成。

与传统渲染相比,NFRU+ NSSD 神经图形可带来以下收益:每秒帧数最高提升至 4 倍,DRAM 带宽占用最多降低至原来的 3/10,每帧动态能耗最多降低至原来的 1/4。

由 Arm 与 Sumo Digital 基于虚幻引擎联合打造的《光影新生》游戏,引入 NFRU 和 NSSD 技术后,与上一代传统渲染相比,可实现最高 4 倍的性能提升,并将外部内存流量最多降低 70%,并在约 2W GPU 功耗预算下持续运行 60fps。

Arm 提供的开发者工具栈包含 NSS 和 NFRU,以及面向 Vulkan 的机器学习扩展和包括虚幻引擎在内的主流游戏引擎插件。软件开发套件支持与自定义引擎集成,性能分析、图形优化、训练和模型优化工具可帮助开发者评估并微调神经图形工作负载。

2、全新执行引擎:提高寄存器数量和分配灵活性
Mali G2-Ultra NX 搭载的全新执行引擎,是 Arm Mali 过去 7 代产品中规模最大的指令集架构升级,可支持每个线程束的寄存器数量是上一代的 2 倍。

它采用动态寄存器分配机制,有助于在着色程序规模扩大、复杂度增加的情况下,减少寄存器的溢出。
3、第三代硬件光追:降低光追成本,缓解内存压力
Arm 第三代硬件光线追踪技术使移动设备能支持更复杂的光照、阴影、反射和几何效果。全新光线追踪架构在主流光线追踪基准测试中,可将 DRAM 流量最多降低 13%,有助于缓解内存压力。

新架构采用了更小巧、更高效的光线 - 三角形数据结构,以降低光线追踪工作负载的成本;对不透明度微贴图(OMM,Opacity Micromaps)提供了硬件级支持,从而能够更高效地处理复杂的透明几何体。

这使得移动设备能呈现更丰富的植被、更精细的织物纹理、多层材质表面及其他复杂场景元素。
在 Arm 的一项演示中,使用 OMM 可将帧率提升 30%,同时将光线追踪工作负载最多降低 70%。

迄今 Arm Mali GPU 出货量已超过 140 亿颗,这一庞大基础使 Arm 能够将神经网络技术带入全球移动生态系统。
04.
开箱即用的软件生态,
加速端侧 AI 开发与创新
Arm CSS for Mobile 2 拥有完善的软件生态支持。依托 Arm 数十年的软件投入及全球超过 2200 万的 Arm 开发者社区,开发者可通过熟悉的框架和开发环境轻松调用其平台能力,打造更智能的端侧 AI 体验。
会上,Arm 专程讲解了 KleidiAI 及 Arm AI Portal 共同打通的从硬件到软件的开发链路。
KleidiAI 与主流 AI 框架的深度集成,为 Arm CPU 提供了优化的软件执行路径,包括能够充分利用 SME2 特性的 AI 工作负载,让软件在支持 SME2 的设备上自动加速。
Arm 列举了多项模型与生态合作,包括谷歌 Gemma、腾讯混元、阿里千问,相关工作涉及 SME2 加速、2-bit 量化、模型压缩、文本转语音等。在近期的一次黑客松中,开发者把 SME2 集成到健身、游戏和助眠等多种应用。
Arm AI Portal 为开发者和智能体提供了一个开发入口,在统一平台汇聚经过优化和验证的模型、性能与准确性数据、代码示例以及部署资源,帮助开发者充分调动 CPU 端 SME2、GPU 端神经网络加速器等能力,将经优化的 AI 模型与高端移动设备的性能优势紧密结合。

入口既可以通过网页前端使用,也可以通过 MCP 服务器、Skill 或插件接入开发环境。开发者可安装 Arm MCP 服务器,将 AI Portal 的能力直接接入 Codex、Claude Code 等智能体工作环境。
其模型库支持按照设备类型、架构、运行时、数据类型和模型格式进行筛选,以缩短从选型到部署的路径。
对于拥有自有模型的开发者,Arm 还提供早期访问版模型优化工具,帮助其针对目标设备进行优化和适配。
基于上述工具,开发者能够为特定工作负载选择合适的模型,了解其在 Arm 平台上的性能表现,并加快从评估到部署的整个开发流程。
05.
结语:为更高效、更智能的
移动 AI 体验奠定坚实基础
移动 AI 的下一个阶段,将不再限于芯片峰值算力或单一跑分成绩,而是取决于整个系统将用户意图转化为实际行动的综合能力。
随着智能体 AI 持续演进并融入日常交互,底层平台将成为决定这些体验能否高效、大规模落地的关键因素。
Arm CSS for Mobile 2 正是为这一转变而打造,围绕响应速度、能效与持续执行能力,对计算资源、系统 IP、物理实现和软件生态进行一体化协同优化,把 CPU 变成智能体的编排层,把 GPU 变成图形与神经计算的混合引擎,再用系统互连和软件工具把不同计算资源串起来。
在进一步减少无效等待、重复计算和数据搬运的基础上,Arm 既为芯片合作伙伴提供了可灵活配置的基础平台,也为开发者搭建了从平台能力到应用落地的更直接路径,让从芯片设计到开发都变得更加高效。




登录后才可以发布评论哦
打开小程序可以发布评论哦