驱动之家 18小时前
Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 8 日消息,过去两年,生成式 AI 让手机等终端能回答问题,如今的智能体(Agent)AI 则要求终端能完成任务替人办事,这个转变看起来只差一步,对终端硬件的要求却是完全不一样。

生成式 AI 只需要处理一次请求,一次推理,一次响应,算力峰值过后系统回到低功耗待命。但智能体 AI 需要感知用户意图、检索记忆、推理规划、跨应用执行,整个过程涉及语音识别、向量检索、小模型推理、大模型调用等多个环节的串联。

这种工作负载的特征是:延迟敏感、突发性强、内存密集、高度异构,没有任何单一计算单元能独立胜任,CPU 负责编排调度,GPU 负责并行计算,加速器负责特定任务,云端的超大模型随时待命。

问题在于,这些组件之间的数据传输效率、任务调度协同、内存访问延迟,才是决定用户体验的关键。

对此 Arm 在 Everywhere China 活动上,正式发布了第二代移动终端计算子系统 CSS for Mobile 2,这也是首个 AI 原生移动计算平台,它集成了最新的 Arm C2 CPU 集群、首个 AI 原生 Mali GPU G2-Ultra NX。这并非一个单纯更快的 CPU 或 GPU,而是从架构设计、物理实现到软件生态,共同展开的系统级协同优化。

C2 CPU 集群

在 CSS for Mobile 2 平台中,承担中枢调度角色的是 C2 CPU 集群,旗舰参考配置采用 2+6 布局,两颗支持 SME2 可扩展矩阵延伸指令集的 C2-Ultra 核心,搭配六颗 C2-Pro 核心,通过 DSU 共享 L3 缓存。

C2-Ultra 是 Arm 迄今最强大的移动 CPU 核心,能效方面,根据 Arm 公布的数据,GeekBench 6.3 单线程提升 15%,多线程提升 12%;Speedometer 3.1 网页浏览性能提升 15%;应用启动加速 12%;而在相同性能输出下,C2-Ultra 的功耗相比上一代 C1-Ultra 大幅降低了 38%。

从微架构层面看,相比上一代 C1-Ultra,C2-Ultra 的改进集中在三个方向:

更大的执行引擎。C2-Ultra 在 4.45GHz+ 频率下实现了超过 15% 的峰值性能提升,核心能够同时容纳更多在途指令,具备更高的指令级并行度,配合智能推测机制,每个活跃周期能完成更多有效工作,因数据依赖导致的空闲等待周期明显减少。

更聪明的数据搬运。数据加载效率提升,依赖数据返回后相关工作能更快启动;Load/Store 缓冲区扩容,核心能同时跟踪更多内存操作;预取更精准,可预测的数据流在核心请求前就被拉近。这三项叠加,大幅减少了后端停顿。

更精准的分支预测。在浏览器、应用启动及各类基准测试场景下,大幅降低了复杂工作负载中的分支误预测,减少错误路径执行造成的资源浪费。配合更强大的取指能力、目标地址预测,以及更快的误预测恢复机制,确保了核心拥有持续稳定的指令流供给。

SME2 与 LUTi

SME2 可扩展矩阵延伸指令集是 C2 CPU 集群 AI 能力的核心,要知道端侧智能体并不是一个大模型包办一切,而是一组各司其职的专用小模型,语音、记忆检索、推理各用各的模型,由 CPU 上的编排层统一调度,SME2 的价值正体现在这些轻量模型上。

C2-Ultra 还引入了对 LUTi 查表指令的支持,该指令专为查找密集型工作负载设计,能够大幅减少频繁的内存访问,在 2-bit 超低精度量化模型下进一步释放内存带宽压力。

在实际运行中,编码阶段是计算受限,用 SME2 提高计算密度;解码阶段是带宽受限,用 LUTi 负责内存与带宽优化,两者强强联合,完成了对端侧 AI 模型全链路推理的高效覆盖。这也是为什么 Arm 强调 SME2" 天然适合构成移动端智能体的轻量模型积木 "。

实测数据显示,在语音识别(Moonshine、Parakeet)、个人记忆检索(LFM 2.5-Colbert-350M 多语言搜索)以及推理生成(LFM 2.5 1.2B、Qwen 3.5 0.8B/2B、MiniCPM 5 1B、Gemma 4 E2B 等端侧小模型)三类工作负载中,2 × C2-Ultra + SME2 相比 2 × C1-Ultra + SME2,实现了平均 1.7 倍的性能提速。

Arm 还用一个 " 策划周年纪念晚餐 "Agent 工作流演示了体验:语音转文字阶段,C2-Ultra 比 C1-Ultra 提速 40%;记忆检索阶段快 41%;推理生成结构化提示词阶段提速 25%。整个流程的总耗时从 C1-Ultra 的约 450 毫秒缩短至 C2-Ultra 的约 280 毫秒,而在启用 SME2 后,延迟被进一步压缩 24%。

能在约 200 毫秒级完成 " 感知 - 记忆 - 推理 - 执行 " 的全链路闭环,这意味着端侧 AI 智能体的响应速度已正式跨入用户无感等待的即时交互区间。

还有一个值得注意的细节是 C2 CPU 集群的灵活性,Arm 提供了从入门级 2N 到旗舰 2U+6Pro 的多种配置,三档不同微架构(Ultra/Pro/Nano)可在同一集群内混搭,每档核心独立调频,合作伙伴可以根据产品定位灵活配置。

Mali G2-Ultra NX:首款 AI 原生 Mali GPU

CPU 之外,图形一侧的压力同样急剧攀升,更高分辨率、更大规模的开放世界、更复杂的光线追踪,负载复杂度的增速已经超过手机功耗预算的增长上限。在 1 – 2W 的功耗与散热约束下,全分辨率、逐帧完整渲染的传统渲染路径,已无法平衡桌面级画质与高持续帧率的需求。

Arm 给出的破局方案是神经图形(Neural Graphics):采用选择性渲染,并利用 AI 算法重建画面细节、中间帧及光照。原生渲染的像素占比可大幅降低至 1/8,剩余 7/8 的画面全由 AI 重建,同时保持与原生渲染相媲美的画质水平。其设计目标是在 1W 的功耗预算内,实现高保真的神经图形渲染体验。

Mali G2-Ultra NX 是首款 AI 原生 Mali GPU,AI 原生主要体现在三个架构层面的创新:

第一,神经加速器(NX)直接嵌入着色器核心。将专用神经加速电路与 GPU 的执行引擎、内存系统、控制结构紧密集成。NX 单元支持 INT8 与 INT16 精度计算,运行频率最高可达 GPU 频率的 2 倍,支持完整张量运算与权重压缩,还集成了运动引擎与光流加速器。

这种深度集成使得神经图形任务能够与传统图形、计算流水线并行执行,并直接复用 GPU 的缓存与内存子系统,极大减少了跨单元的数据搬运开销。

第二,全新执行引擎(EE)。这是 7 代以来最大的 ISA(指令集架构)重构,直接面向虚幻引擎 5 的 Nanite 虚拟几何体与 Lumen 动态全局光照而设计。面对日益复杂的现代着色器,寄存器溢出往往是导致性能暴跌的主因。

而新一代 EE 将每个 Warp 的寄存器容量直接翻倍,并支持 16-Warp 粒度的动态宽寄存器分配,大幅减少了溢出损失,GPU 能更高效地运行更大规模的着色器程序,为更丰富的场景、更高视觉保真度与更稳帧率预留算力余量。

第三,第三代光线追踪单元(RTU v3)。移动端光追的核心瓶颈在于,随着场景几何复杂度激增,传统 BVH 结构中的三角形节点数据急剧膨胀,迅速挤爆缓存并吃满带宽。RTU v3 引入了更紧凑的三角形存储结构,重复边与共享顶点不再需要重复存储,从而将更多数据塞进缓存,大幅释放 DRAM 带宽压力。

同时,硬件级不透明度微图(OMM)的引入,让光线与复杂透明 / 半透明几何体(如树叶、栅栏)的命中测试变得极度精确,降低了透明物体的光追计算成本。官方数据显示使用 OMM 可使帧率提升 30%,同时将光线追踪工作负载最多降低 70%。

得益于架构层面的创新,Mali G2-Ultra NX 带来三项神经图形技术:

NSS(神经超级采样):以低分辨率进行渲染,并通过神经网络重建出高分辨率图像。支持将 540p 的渲染输入重建为 1080p 的高保真输出,画质表现直逼桌面级神经超分方案,且原生渲染的像素量仅为原来的 1/4。

实测数据显示,在持续功耗约束下,NSS 实现了 1.9 – 2.1 倍的帧率提升,同时将 DRAM 带宽开销削减 50%,单帧动态能耗降低 50% – 60%。

NFRU(神经帧率提升):由前后两帧原生渲染画面提供颜色、深度与运动矢量(Motion Vector)作为输入,结合硬件级光流加速器,辅助神经网络生成高质量的中间帧。在实际测试中,NFRU 能够将游戏的持续帧率从 60FPS 拉升至 120 FPS,同时将 DRAM 访存流量降低了 33%。

NSSD(神经超级采样与降噪):专为光追场景打造的神经重建技术。移动端光追因功耗限制,初始渲染往往处于极低采样率状态,导致画面充满了高频噪点。NSSD 利用神经网络同时接管超采样放大与光追降噪两大核心工序,直接一步到位输出清晰、无噪点的高分辨率光追画面。

NSS、NFRU 模型已在 Hugging Face 与 GitHub 开源,虚幻引擎等主流引擎插件即插即用;Arm 表示改造现有游戏周期在 3 至 6 个月,新作则在 18 个月以内。

Arm 还演示了与 Sumo Digital 联合打造的《光影新生》(Neural Dawn)手游,作为首款在移动端落地 UE5.5 MegaLights 的作品,它在无需预烘焙光照的前提下支持最多 1400 个动态光源,这种负载过去在手机上不可想象。

在上一代 CSS G1-Ultra 平台上只能跑 15FPS,在 Mali G2-Ultra NX 上就能以 60 FPS 持续运行,4 倍帧率提升,70% 能效提升,70% DRAM 流量降低。官方确认该游戏将于 2026 年内随首批 Mali G2-Ultra NX 设备推出。

传统图形性能方面,Mali G2-Ultra NX 同样带来了全方位的两位数提升:传统光栅化与光追游戏基础性能均提升 9%;在各大基准测试中,Steel Nomad Light 提升 17%,Invitro 2 提升 18%,安兔兔 v11 提升 20%,Solar Bay Extreme 更是大幅提升 24%。综合来看,其平均游戏性能提升约 20%,且光追场景下的单帧 DRAM 带宽需求降低了 14%。

SI L2 系统互连

CPU 和 GPU 再强,如果数据在系统中的传输效率低下,整个平台的性能就会被拖后腿。CSS for Mobile 2 用新一代 SI L2 系统互连接替了 SI L1,通过通道化互连架构,把 C2 CPU 集群、Mali G2-Ultra NX、统一内存与各类设备组织为一个整体。

SI L2 的核心能力主要体现在四大维度:

带宽与内存:完整支持 LPDDR6 标准,为统一内存架构提供更高吞吐的带宽保障;

访存延迟:显式访存请求(Demand Load)从 CPU 到 DRAM 的延迟相比 SI L1 骤降约 45%,这正是端侧 AI 实现即时响应的关键底层支撑;

系统协同:提供面向软件编程模型的高效可扩展硬件一致性(Hardware Coherency),以及针对多元流量画像的高级 QoS 机制,确保 CPU、GPU 高并发运行与共享数据时的秩序与效率;

安全与 PPA:实现了高能效的 MTE(内存标签扩展)与 DVM(分布虚拟内存)支持,兼顾低面积与低功耗的物理设计。

高达 45% 的内存延迟削减,叠加 LPDDR6 带来的高吞吐带宽,才是 C2-Ultra 与 Mali G2-Ultra NX 性能提升能够全面兑现的系统性前提。这也是 Arm 以计算子系统(CSS)形态交付的真正价值所在,在 AI 原生时代,单纯堆砌最快的 CPU 和最强的 GPU,根本拼不出最低的系统级延迟。

软件生态:让硬件能力开箱即用

软件生态同样是 Arm 布局最深、最久的一环。作为软硬协同的核心加速引擎,主力开发者工具 KleidiAI 已实现 100+ 第三方应用集成、12+ 主流 AI 框架深度适配,并积淀了 200+ 经过深度优化的微内核与 14 万行代码,为 Arm CPU 搭建起极致高效的算子执行路径。

例如 Qwen3-TTS、HY-MT1.5-1.8B-2Bit 等前沿大模型,在经过 Arm 针对性优化后,均可直接部署并无缝跑在 C2-Ultra 的 SME2 算力单元之上。

全新的 Arm AI Portal 作为面向 AI 应用开发者的统一入口,提供预优化模型、性能与精度数据、代码示例和部署资源,还集成了 MCP 服务器以支持智能体 AI 开发环境。

开发者可以在平台上找到适合特定工作负载的模型,了解其在 Arm 硬件上的性能表现,加速从评估到部署的全流程。对于有自研模型的开发者,Arm 还提供早期访问版模型优化工具。

神经图形方面,Arm 神经图形开发套件(ArmNG SDK)提供 NSS 和 NFRU 的开放模型(已在 Hugging Face 和 GitHub 发布)、Vulkan ML 扩展、虚幻引擎插件和自定义引擎 SDK,配套性能分析、图形优化、训练和模型优化工具。

CSS for Mobile 2 反映的是 Arm 对移动计算演进方向的判断,手机等移动终端 AI 的发展将由智能体 AI 与 AI 原生图形两类工作负载共同定义,这两类负载的需求既有交叉也有差异。

智能体 AI 最关键的是响应链路,从语音、记忆检索、推理到应用调用的多阶段串行流程,每一步的延迟都会累积成用户可感知的等待,因此 Arm 把重心放在 CPU 的编排能力、SME2/LUTi 对低精度小模型的加速,以及 SI L2 对内存延迟的削减上。

AI 原生图形则更关注吞吐与能效,在 1 – 2W 的功耗预算内同时维持高帧率与高画质,因此 Arm 选择把神经网络加速器做进着色器核心、用选择性渲染加 AI 重建绕开渲染墙。

但这两类负载还有一个共同点,它们对计算平台系统级协同的要求远超以往,CPU、GPU、互连、内存与软件整体协同效率的提升,远比任何单点峰值算力重要。

CSS for Mobile 2 是 Arm 这个判断的完整落地,至于实际情况如何,且等搭载它的旗舰 SoC 用实测说话。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai arm gpu 物理 用户体验
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论