个人 AI 的实现,到底需要一套怎样的计算底座?当手机开始理解用户意图、调用工具并连续完成任务,计算平台要支撑的已不只是一次模型推理,而是完整的个人 AI 体验。
在今天的 Arm Everywhere China 2026 大会上,Arm 发布了最新的 CSS for Mobile 2。可以观察到,AI 在全新的手机计算子系统中扮演了两个不同角色,CPU 通过增强 AI 计算能力,帮助更多应用用上 AI;Mali GPU 首次原生集成神经网络加速器,用 AI 推动游戏性能和体验跨越式提升。
Arm 的 CPU 正在推动端侧 AI 进一步普及。" 目前几乎所有旗舰智能手机,无论是安卓还是 iOS 手机,均已采用 SME2 技术。"Arm 边缘 AI 智能终端计算副总裁 James McNiven 表示。SME2 是 Arm 给 CPU 增加的一套 AI 矩阵运算加速能力。
新一代 Arm C2 Ultra 带来 15% 的单线程性能提升,增强 SME2 支持的 C2 CPU 集群,在特定 AI 模型上的执行性能可达到上一代的 1.7 倍。
全新的 Arm Mali GPU 让人眼前一亮。在《光影新生》演示中给出的数据显示,Mali G2-Ultra NX 借助神经图形技术,相比没有 AI 辅助渲染的上一代 Mali G1-Ultra,帧率与能效最高达到 4 倍。AI 开始参与画面重建,让手机能够以不同于传统渲染的方式获得更高的游戏性能。
CPU 加速 AI 普及,AI 加速 GPU 进化。但在这套面向个人 AI 的平台中,Arm 为什么没有同时纳入自家的 NPU?James McNiven 解释:" 在移动设备领域,Arm 一贯的思路是将 NPU 层面的技术创新更多交由合作伙伴主导。"
把 NPU 的差异化创新留给伙伴后,Arm 将重点放在 CPU、GPU 以及支撑硬件能力的软件生态上。从 KleidiAI 到神经图形模型、SDK 和游戏引擎合作,Arm 正在缩短处理器能力与开发者应用之间的距离。软硬件一体的系统和生态正是 Arm 在 AI 时代能够继续成为领导者的关键。
SME2 成为旗舰标配,Arm CPU 加速端侧 AI 普及
个人 AI 带来的计算负载,比运行一次模型复杂得多。以预订结婚纪念日晚餐为例,智能体需要完成语音转文字,搜索用户喜欢的餐厅、日历和相册,再生成指令、访问网页并执行操作,如果餐厅订满,整套流程还要重新运行。
CPU 既要运行部分轻量级模型,也要承担工具调用和任务编排,每个环节的延迟都会影响最终体验。
Arm C2 Ultra 针对这类负载增强了单线程性能、执行引擎和数据访问能力。根据 Arm 给出的数据,其单线程性能和网页浏览性能均提升 15%,应用启动和多线程性能分别提升 12%。单线程性能的提升,会直接影响智能体交互、工具调用和并行任务的响应速度。
在 C2 CPU 集群中,C2 Ultra 负责需要快速响应的突发负载,C2 Pro 则以更高能效承担持续任务。Arm 的合作伙伴可以按照产品定位调整两类核心的数量,而不是用一种核心覆盖所有场景。对于同时包含模型推理、系统服务和前台应用的个人 AI 负载,这种配置空间比单独追求一个峰值数字更有实际意义。
更明显的 AI 性能提升来自 SME2。在特定 AI 模型中,增强 SME2 支持的 C2 CPU 集群,执行性能可以达到上一代的 1.7 倍。不过,端侧 AI 不仅受计算能力限制,也经常受制于内存带宽。
以大语言模型为例,处理整段输入的预填充阶段包含大量矩阵运算,更接近计算密集型任务;逐字生成答案时,处理器需要频繁读取模型权重,又更容易受到内存带宽限制。
SME2 提高矩阵计算效率,低位宽与缓存设计则减少需要搬运的数据,几项改进分别对应模型运行的不同阶段。
面对计算密集型负载,量化是一个解决方法,从 INT8、INT4 进一步走向 INT2。位宽降低后,计算量和数据量随之减少,但也可能损失精度。Arm 边缘 AI CPU 产品管理总监 Daniel Lu 对雷峰网 ( 公众号:雷峰网 ) 表示:" 量化感知训练能够缓解模型从 INT8 降到 INT4、INT4 降到 INT2 带来的精度损失,业界也在持续缩小精度损耗。"
相比追求更高的主频或峰值算力,Arm 更关注降低延迟。Daniel Lu 表示," 如果一味追求峰值性能,反而可能影响延迟。持续运行的高计算密集型算法更适合 GPU 或 NPU,CPU 则应聚焦低延迟应用,以及能够控制在本地算力预算内的小语言模型。搭载 SME 引擎的 CPU 集群等效算力约为 5 至 6TOPS。"
内存受限时,再高的计算性能也可能消耗在等待数据上。Daniel Lu 介绍,C2 CPU 集群同时配备私有 L2 缓存与大容量共享 L3 缓存,能够减少访问系统级缓存乃至 DRAM 的频次,从而降低延迟以及数据移动产生的功耗。
从低位宽矩阵计算到缓存拓扑,C2 CPU 集群针对的是端侧 AI 落地后的实际瓶颈。SME2 已经进入几乎所有旗舰手机,下一步的关键是让开发者更方便地使用这层广泛存在的 AI 能力。
Mali GPU 首次集成 AI 加速器,手游性能跨越式提升
如果说 CPU 的进化是让更多应用能够使用 AI,Mali G2-Ultra NX 则让 AI 直接参与图形计算,改变 GPU 输出画面的方式。
实时光线追踪、复杂几何细节和动态全局光照正在进入手机,散热、电池容量和内存带宽却很难同步跃升。依靠 GPU 逐像素渲染,开发者不得不在画质、帧率和功耗之间反复取舍。
Mali G2-Ultra NX 首次在 Mali GPU 中原生集成神经网络加速器,让手游开发者不再需要反复取舍。
全新 GPU 采用神经超级采样(NSS)技术,先以较低分辨率渲染,再由神经网络重建高分辨率画面;神经超级采样与降噪(NSSD)同时处理光追噪声;神经帧率提升(NFRU)则利用前后两个真实渲染帧重建中间帧。
这不是让大语言模型 " 凭空生成 " 画面。Mali G2-Ultra NX 采用卷积神经网络,以 GPU 渲染的真实画面、运动向量和深度信息为输入完成重建。开发者也可以用自己的游戏内容训练模型,让输出保持原有的美术风格。
在《光影新生》的三帧演示中,第一帧和第三帧只有四分之一像素采用传统方式渲染,中间帧完全由 AI 重建。综合计算,八分之七的像素由 AI 完成重建。
AI 插帧也会带来新的延迟问题。以 30FPS 为例,每个真实帧的时间预算约为 33 毫秒,系统既要完成真实帧渲染,也要在合适的时序插入重建帧。如果调度不当,帧率数字提高了,操作响应仍可能变慢。因此,NFRU 不仅依赖 GPU 中的 NX 单元,也需要 Android 帧节奏机制和游戏引擎共同配合,保证生成帧进入显示链路时不破坏交互延迟。
这使 Mali G2-Ultra NX 的帧率与能效最高达到上一代的 4 倍,DRAM 流量最高降低 70%。如果不使用神经图形技术,Arm 给出的综合游戏基准性能平均提升 20%,同频游戏实测性能最高提升 14%。两组数字的差距,正体现了 AI 为 GPU 打开的增量空间。
传统图形能力也在升级。Mali G2-Ultra NX 引入新的执行引擎和第三代光追单元,以更紧凑的三角形数据表达减少重复数据,在现有光追基准测试中可将 DRAM 带宽需求降低约 13%。
"AI 增强图形将逐渐成为行业标配。"James McNiven 指出,Arm 会同时加强 AI 功能和传统图形渲染技术。神经网络加速器并非取代渲染单元,简单画面的传统渲染成本已经很低,面对几何细节和光照更复杂的内容,AI 重建才更容易体现效率优势。
这颗 GPU 也能承担图形之外的 AI 计算。Arm 边缘 AI 高级产品经理 Deyan Lazarov 告诉雷峰网,只要神经网络采用 INT8 等合适的数据格式,就可以在 GPU 上运行;即使部分计算使用浮点格式,GPU 也能处理。不过,现阶段 Arm 的重点仍是图形应用。
CPU For AI,解决 AI 如何走向更多应用;AI For GPU,回答 AI 如何改进已有的计算产品。两条路径在 CSS for Mobile 2 上交汇。
NPU 留给伙伴,Arm 用系统和软件支撑个人 AI
Arm CSS for Mobile 2 没有集成 Arm NPU,并不意味着个人 AI 不需要 NPU。CPU 适合任务编排、工具调用和低延迟的轻量级负载,GPU 兼顾图形与通用计算,NPU 则擅长持续运行计算密集型模型。
James McNiven 表示:" 在移动设备领域,Arm 一贯的思路是将 NPU 层面的技术创新更多交由合作伙伴主导,我们在物联网场景有 Ethos 系列 NPU。"
手机芯片厂商通常拥有自己的 NPU 架构,也会围绕自有模型、操作系统和第一方 AI 功能深度优化。
第三方应用面对的情况不同。开发者需要覆盖不同品牌和芯片,如果每款 NPU 都单独适配,成本会明显提高。CPU 和 GPU 相对标准化的编程环境,更适合作为广泛应用的共同基础。具体任务运行在 CPU、GPU 还是 NPU,则通常由系统厂商通过软件调度。
Arm CSS for Mobile 为合作伙伴保留了配置空间。C2 CPU 集群最高支持 14 个核心,客户可以按工作负载搭配 C2 Ultra 与 C2 Pro。Mali G2-Ultra NX 也允许配置着色器核心和 NX 单元,再围绕工艺、频率和功耗优化。
Arm 的重点,是提供经过系统优化的 CPU、GPU、互联 IP,以及连接硬件与应用的软件系统 CSS。与以往相比,Arm 今年发布新一代 CPU 和 GPU 时,也把软件栈和生态放在了更重要的位置。
Deyan Lazarov 解释:" 我们高度重视软件生态建设,核心目标是降低开发者使用门槛,让技术更易于上手。" 过去彼此分开的图形、通用计算与神经网络计算,正在进入统一的计算体系,开发工具也需要随之打通。
在 GPU 方面,Arm 开放神经图形模型,并提供 SDK、示例代码和游戏引擎插件,还与腾讯游戏、Unity 中国等伙伴推进适配。在 CPU 的软件生态构建上,KleidiAI 把针对 SME2 优化的计算内核接入不同 AI 框架。开发者无需直接处理底层指令,也能调用新的硬件能力。
这层软件抽象对端侧 AI 尤其重要。模型和应用如果需要逐一识别底层 CPU 指令、GPU 单元和不同芯片配置,新硬件能力很难快速普及。当优化内核通过常用框架和引擎交付,开发者沿用熟悉的工具链,就能在不重写应用的情况下获得硬件加速。
Arm Everywhere China 2026 反复强调软件,目的正是让新增算力真正进入应用,而不是停留在芯片规格表中。
这也是 Arm 从 IP 走向 CSS 后必须补上的一环。单独提供 CPU 或 GPU IP,客户需要自行完成大量集成和系统优化。CSS 组合 CPU、GPU 和系统 IP,帮助客户缩短芯片研发周期。软件生态继续向上连接模型、框架与应用,让硬件能力更快转化为产品体验。
个人 AI 仍在快速变化,CPU、GPU 和 NPU 的分工也会继续调整。相比给出一种固定组合,Arm 选择提供可配置的计算基础,再用软件降低开发和迁移门槛。
CPU 推动 AI 普及,AI 推动 GPU 进化,合作伙伴用 NPU 形成差异化,软件把不同处理器连接到应用。持续迭代的硬件和不断完善的软件生态,将成为 Arm 在个人 AI 时代继续站在计算中心的关键。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。


登录后才可以发布评论哦
打开小程序可以发布评论哦