雷锋网 21小时前
CPU加速AI普及,GPU首次加AI,Arm为何把NPU留给伙伴?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

个人 AI 的实现,到底需要一套怎样的计算底座?当手机开始理解用户意图、调用工具并连续完成任务,计算平台要支撑的已不只是一次模型推理,而是完整的个人 AI 体验。

在今天的 Arm Everywhere China 2026 大会上,Arm 发布了最新的 CSS for Mobile 2。可以观察到,AI 在全新的手机计算子系统中扮演了两个不同角色,CPU 通过增强 AI 计算能力,帮助更多应用用上 AI;Mali GPU 首次原生集成神经网络加速器,用 AI 推动游戏性能和体验跨越式提升。

Arm 的 CPU 正在推动端侧 AI 进一步普及。" 目前几乎所有旗舰智能手机,无论是安卓还是 iOS 手机,均已采用 SME2 技术。"Arm 边缘 AI 智能终端计算副总裁 James McNiven 表示。SME2 是 Arm 给 CPU 增加的一套 AI 矩阵运算加速能力。

新一代 Arm C2 Ultra 带来 15% 的单线程性能提升,增强 SME2 支持的 C2 CPU 集群,在特定 AI 模型上的执行性能可达到上一代的 1.7 倍。

全新的 Arm Mali GPU 让人眼前一亮。在《光影新生》演示中给出的数据显示,Mali G2-Ultra NX 借助神经图形技术,相比没有 AI 辅助渲染的上一代 Mali G1-Ultra,帧率与能效最高达到 4 倍。AI 开始参与画面重建,让手机能够以不同于传统渲染的方式获得更高的游戏性能。

CPU 加速 AI 普及,AI 加速 GPU 进化。但在这套面向个人 AI 的平台中,Arm 为什么没有同时纳入自家的 NPU?James McNiven 解释:" 在移动设备领域,Arm 一贯的思路是将 NPU 层面的技术创新更多交由合作伙伴主导。"

把 NPU 的差异化创新留给伙伴后,Arm 将重点放在 CPU、GPU 以及支撑硬件能力的软件生态上。从 KleidiAI 到神经图形模型、SDK 和游戏引擎合作,Arm 正在缩短处理器能力与开发者应用之间的距离。软硬件一体的系统和生态正是 Arm 在 AI 时代能够继续成为领导者的关键。

SME2 成为旗舰标配,Arm CPU 加速端侧 AI 普及

个人 AI 带来的计算负载,比运行一次模型复杂得多。以预订结婚纪念日晚餐为例,智能体需要完成语音转文字,搜索用户喜欢的餐厅、日历和相册,再生成指令、访问网页并执行操作,如果餐厅订满,整套流程还要重新运行。

CPU 既要运行部分轻量级模型,也要承担工具调用和任务编排,每个环节的延迟都会影响最终体验。

Arm C2 Ultra 针对这类负载增强了单线程性能、执行引擎和数据访问能力。根据 Arm 给出的数据,其单线程性能和网页浏览性能均提升 15%,应用启动和多线程性能分别提升 12%。单线程性能的提升,会直接影响智能体交互、工具调用和并行任务的响应速度。

在 C2 CPU 集群中,C2 Ultra 负责需要快速响应的突发负载,C2 Pro 则以更高能效承担持续任务。Arm 的合作伙伴可以按照产品定位调整两类核心的数量,而不是用一种核心覆盖所有场景。对于同时包含模型推理、系统服务和前台应用的个人 AI 负载,这种配置空间比单独追求一个峰值数字更有实际意义。

更明显的 AI 性能提升来自 SME2。在特定 AI 模型中,增强 SME2 支持的 C2 CPU 集群,执行性能可以达到上一代的 1.7 倍。不过,端侧 AI 不仅受计算能力限制,也经常受制于内存带宽。

以大语言模型为例,处理整段输入的预填充阶段包含大量矩阵运算,更接近计算密集型任务;逐字生成答案时,处理器需要频繁读取模型权重,又更容易受到内存带宽限制。

SME2 提高矩阵计算效率,低位宽与缓存设计则减少需要搬运的数据,几项改进分别对应模型运行的不同阶段。

面对计算密集型负载,量化是一个解决方法,从 INT8、INT4 进一步走向 INT2。位宽降低后,计算量和数据量随之减少,但也可能损失精度。Arm 边缘 AI CPU 产品管理总监 Daniel Lu 对雷峰网 ( 公众号:雷峰网 ) 表示:" 量化感知训练能够缓解模型从 INT8 降到 INT4、INT4 降到 INT2 带来的精度损失,业界也在持续缩小精度损耗。"

相比追求更高的主频或峰值算力,Arm 更关注降低延迟。Daniel Lu 表示," 如果一味追求峰值性能,反而可能影响延迟。持续运行的高计算密集型算法更适合 GPU 或 NPU,CPU 则应聚焦低延迟应用,以及能够控制在本地算力预算内的小语言模型。搭载 SME 引擎的 CPU 集群等效算力约为 5 至 6TOPS。"

内存受限时,再高的计算性能也可能消耗在等待数据上。Daniel Lu 介绍,C2 CPU 集群同时配备私有 L2 缓存与大容量共享 L3 缓存,能够减少访问系统级缓存乃至 DRAM 的频次,从而降低延迟以及数据移动产生的功耗。

从低位宽矩阵计算到缓存拓扑,C2 CPU 集群针对的是端侧 AI 落地后的实际瓶颈。SME2 已经进入几乎所有旗舰手机,下一步的关键是让开发者更方便地使用这层广泛存在的 AI 能力。

Mali GPU 首次集成 AI 加速器,手游性能跨越式提升

如果说 CPU 的进化是让更多应用能够使用 AI,Mali G2-Ultra NX 则让 AI 直接参与图形计算,改变 GPU 输出画面的方式。

实时光线追踪、复杂几何细节和动态全局光照正在进入手机,散热、电池容量和内存带宽却很难同步跃升。依靠 GPU 逐像素渲染,开发者不得不在画质、帧率和功耗之间反复取舍。

Mali G2-Ultra NX 首次在 Mali GPU 中原生集成神经网络加速器,让手游开发者不再需要反复取舍。

全新 GPU 采用神经超级采样(NSS)技术,先以较低分辨率渲染,再由神经网络重建高分辨率画面;神经超级采样与降噪(NSSD)同时处理光追噪声;神经帧率提升(NFRU)则利用前后两个真实渲染帧重建中间帧。

这不是让大语言模型 " 凭空生成 " 画面。Mali G2-Ultra NX 采用卷积神经网络,以 GPU 渲染的真实画面、运动向量和深度信息为输入完成重建。开发者也可以用自己的游戏内容训练模型,让输出保持原有的美术风格。

在《光影新生》的三帧演示中,第一帧和第三帧只有四分之一像素采用传统方式渲染,中间帧完全由 AI 重建。综合计算,八分之七的像素由 AI 完成重建。

AI 插帧也会带来新的延迟问题。以 30FPS 为例,每个真实帧的时间预算约为 33 毫秒,系统既要完成真实帧渲染,也要在合适的时序插入重建帧。如果调度不当,帧率数字提高了,操作响应仍可能变慢。因此,NFRU 不仅依赖 GPU 中的 NX 单元,也需要 Android 帧节奏机制和游戏引擎共同配合,保证生成帧进入显示链路时不破坏交互延迟。

这使 Mali G2-Ultra NX 的帧率与能效最高达到上一代的 4 倍,DRAM 流量最高降低 70%。如果不使用神经图形技术,Arm 给出的综合游戏基准性能平均提升 20%,同频游戏实测性能最高提升 14%。两组数字的差距,正体现了 AI 为 GPU 打开的增量空间。

传统图形能力也在升级。Mali G2-Ultra NX 引入新的执行引擎和第三代光追单元,以更紧凑的三角形数据表达减少重复数据,在现有光追基准测试中可将 DRAM 带宽需求降低约 13%。

"AI 增强图形将逐渐成为行业标配。"James McNiven 指出,Arm 会同时加强 AI 功能和传统图形渲染技术。神经网络加速器并非取代渲染单元,简单画面的传统渲染成本已经很低,面对几何细节和光照更复杂的内容,AI 重建才更容易体现效率优势。

这颗 GPU 也能承担图形之外的 AI 计算。Arm 边缘 AI 高级产品经理 Deyan Lazarov 告诉雷峰网,只要神经网络采用 INT8 等合适的数据格式,就可以在 GPU 上运行;即使部分计算使用浮点格式,GPU 也能处理。不过,现阶段 Arm 的重点仍是图形应用。

CPU For AI,解决 AI 如何走向更多应用;AI For GPU,回答 AI 如何改进已有的计算产品。两条路径在 CSS for Mobile 2 上交汇。

NPU 留给伙伴,Arm 用系统和软件支撑个人 AI

Arm CSS for Mobile 2 没有集成 Arm NPU,并不意味着个人 AI 不需要 NPU。CPU 适合任务编排、工具调用和低延迟的轻量级负载,GPU 兼顾图形与通用计算,NPU 则擅长持续运行计算密集型模型。

James McNiven 表示:" 在移动设备领域,Arm 一贯的思路是将 NPU 层面的技术创新更多交由合作伙伴主导,我们在物联网场景有 Ethos 系列 NPU。"

手机芯片厂商通常拥有自己的 NPU 架构,也会围绕自有模型、操作系统和第一方 AI 功能深度优化。

第三方应用面对的情况不同。开发者需要覆盖不同品牌和芯片,如果每款 NPU 都单独适配,成本会明显提高。CPU 和 GPU 相对标准化的编程环境,更适合作为广泛应用的共同基础。具体任务运行在 CPU、GPU 还是 NPU,则通常由系统厂商通过软件调度。

Arm CSS for Mobile 为合作伙伴保留了配置空间。C2 CPU 集群最高支持 14 个核心,客户可以按工作负载搭配 C2 Ultra 与 C2 Pro。Mali G2-Ultra NX 也允许配置着色器核心和 NX 单元,再围绕工艺、频率和功耗优化。

Arm 的重点,是提供经过系统优化的 CPU、GPU、互联 IP,以及连接硬件与应用的软件系统 CSS。与以往相比,Arm 今年发布新一代 CPU 和 GPU 时,也把软件栈和生态放在了更重要的位置。

Deyan Lazarov 解释:" 我们高度重视软件生态建设,核心目标是降低开发者使用门槛,让技术更易于上手。" 过去彼此分开的图形、通用计算与神经网络计算,正在进入统一的计算体系,开发工具也需要随之打通。

在 GPU 方面,Arm 开放神经图形模型,并提供 SDK、示例代码和游戏引擎插件,还与腾讯游戏、Unity 中国等伙伴推进适配。在 CPU 的软件生态构建上,KleidiAI 把针对 SME2 优化的计算内核接入不同 AI 框架。开发者无需直接处理底层指令,也能调用新的硬件能力。

这层软件抽象对端侧 AI 尤其重要。模型和应用如果需要逐一识别底层 CPU 指令、GPU 单元和不同芯片配置,新硬件能力很难快速普及。当优化内核通过常用框架和引擎交付,开发者沿用熟悉的工具链,就能在不重写应用的情况下获得硬件加速。

Arm Everywhere China 2026 反复强调软件,目的正是让新增算力真正进入应用,而不是停留在芯片规格表中。

这也是 Arm 从 IP 走向 CSS 后必须补上的一环。单独提供 CPU 或 GPU IP,客户需要自行完成大量集成和系统优化。CSS 组合 CPU、GPU 和系统 IP,帮助客户缩短芯片研发周期。软件生态继续向上连接模型、框架与应用,让硬件能力更快转化为产品体验。

个人 AI 仍在快速变化,CPU、GPU 和 NPU 的分工也会继续调整。相比给出一种固定组合,Arm 选择提供可配置的计算基础,再用软件降低开发和迁移门槛。

CPU 推动 AI 普及,AI 推动 GPU 进化,合作伙伴用 NPU 形成差异化,软件把不同处理器连接到应用。持续迭代的硬件和不断完善的软件生态,将成为 Arm 在个人 AI 时代继续站在计算中心的关键。

雷峰网原创文章,未经授权禁止转载。详情见转载须知

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai arm 安卓 gpu 技术创新
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论