助力移动计算步入新时代
在不久前举办的 Arm Everywhere China 年度大会上,Arm 正式推出其第二代移动终端计算子系统(CSS for Mobile 2),在单一计算平台中实现对智能体 AI 和 AI 原生图形技术的全面支持。该系统集成全新 Arm Mali G2-Ultra NXGPU、搭载 SME2 的 Arm C2 CPU 集群、增强型系统 IP、物理实现方案以及开发者就绪的软件生态系统,并针对下一代移动设备进行了全面优化。
其中,Arm Mali G2-Ultra NX 是首款集成专用神经网络加速器的 MaliGPU,可将神经网络计算与传统图形处理紧密融合,实现更高的能效和响应速度。这款 GPU 在神经网络处理场景下可实现最高 4 倍的 " 每瓦性能 " 提升,与上一代产品相比,在现有游戏内容中可实现高达 14% 的性能提升。为了展示它的性能,Arm 也在现场为我们演示了他们与 Sumo Digital 联合开发的游戏《光影新生》,它拥有过往手游难以企及的更具电影感的光影效果,以及更流畅、更高分辨率的游戏体验。未来,包括网易的《燕云十六声》计划于今年向玩家推出支持神经超级采样的版本,腾讯的《暗区突围:无限》也正在与 Arm 开展神经超级采样与降噪(NSSD)技术演示的共研,为玩家带来游戏体验的革命性升级。
除此之外,Arm 还在本次大会上公布了全新的 Arm C2 CPU 集群,结合了 Arm 性能最强大的移动 CPU —— C2-Ultra、面向能效优化的 C2-Pro CPU,以及双 SME2 单元,能使 AI 工作负载直接在 CPU 上实现高响应、低延迟处理,同时与各类 AI 加速器无缝协同工作。C2 CPU 集群配置了翻倍的 SME2 计算能力,可使最新小语言模型的运行速度提升高达 70%,进一步增强 CPU 对 AI 工作负载的加速能力。
最后,Arm 还公布了第二代移动终端计算子系统—— CSS for Mobile 2,它是 Arm 针对智能体 AI 和神经图形技术正在重塑移动设备的能力需求这一趋势而打造的,Arm 认为下一代移动 AI 体验将不再由单一加速器来定义,而是通过在统一优化的系统中融合各类 AI 能力,共同打造全新的移动体验。
大会结束后,我们也有幸和其他国内媒体一起,对 Arm 边缘 AI 执行副总裁 Chris Bergey 和 Arm 边缘 AI 智能终端计算副总裁 James McNiven,进行了长达四十多分钟的采访,和他们一起聊了聊目前 Arm 的产品生态和技术亮点,以及他们对整个行业和 Arm 未来发展的期待,以下是详细的采访内容。

Q:我们了解到 Arm NX 单元支持 INT8 和 INT16 精度。有信息显示平台可实现 FP16 精度运算,请问 FP16 运算为何不由 NX 单元承担,请问这背后有哪些考量?
James McNiven:Arm 神经网络加速器本身支持的数据格式是 INT8 和 INT16。这样的设计是为了在保证神经超级采样(Neural Super Sampling, NSS)等应用场景所需精度的同时,实现更高的效率,并提供优异的能效与性能表现。同时,我们也支持 FP16 在内的浮点格式运算,但这部分的能力并不在神经网络加速器内部,而是由执行引擎中的标准着色器核心来处理。这样能够针对不同类型的工作负载,在专用 AI 加速与通用计算能力之间取得最佳平衡。
Q:今天上午提到的神经网络加速器,为什么是放在 GPU 里面,而不是放在 NPU 里面?
James McNiven:我们认为,不同类型的 AI 工作负载需要不同形式的加速能力,而异构计算正是满足各类计算需求的最佳方式。不同的应用场景和计算强度,需要由不同类型的计算引擎来承担。因此,我们在 GPU 中集成的神经网络加速器,专门用于加速神经图形相关工作负载,并针对这类任务进行了高度优化。与此同时,我们在最新的 C2 CPU 集群中,配置了最多两个 SME2 单元,能够基于 CPU 指令集对 AI 工作负载进行加速,从而提供更快速的响应能力和更低的延迟。简而言之,我们认为在每一种计算引擎中都应具备相应的 AI 加速能力,让各类工作负载都能够在最适合的计算单元上高效运行。此外,我们的芯片合作伙伴通常也会集成专用 NPU,以加速其自身特定的 AI 应用和工作负载。
另外,我想强调一点,将 SME2 部署在 CPU 集群中,能够提供极低延迟和快速响应能力,同时还能充分利用 CPU 已有的安全模型与安全机制。而将神经网络加速器集成在 GPU 内部,则能够共享执行引擎的内存和缓存资源,例如 L1 和 L2 缓存,因此能够以更高效率处理 AI 图形相关工作负载,并实现更快的响应速度。这种设计带来的好处是,不仅能够获得最佳性能和能效表现,还能够让 AI 加速功能与图形渲染管线紧密协同,与其他工作负载进行统一调度和并行处理,从而发挥整个系统的最佳效率。
Q:目前存储价格暴涨,未来两年很难改变。请问从 CPU 或 GPU 设计的角度,Arm 是否有相关的技术规划或战略,来应对持续走高的存储成本压力?
Chris Bergey:移动产业当前确实正承受着来自多个方面的成本压力,不仅是存储价格,还包括晶圆成本。因此,我们正与合作伙伴共同努力,全力推进全链路优化,其中关键的一项就是推动 AI 模型向更小、更高效的方向演进,在有限的资源条件下实现更好的性能与能效。举例来说,我们已经与阿里巴巴通义千问合作,在 SME2 上实现了 2-bit 量化模型。由于模型规模非常小,因此能够在性能、成本和能效之间取得更好的平衡。此外,通过让图形能力具备神经网络处理能力,我们可以减轻系统内其他承担同类任务加速器的压力,从而实现效率提升。因此,我们正尝试从多个不同维度来应对这一挑战,但这确实是一项艰巨的任务。
Q:去年参加 Arm 活动时,我体验的是搭载天玑 9400(Cortex-X925 架构)的手机,之后联发科(MTK)发布了天玑 9500,CPU 架构从 Cortex-X925 升级到了 C1。当时了解到这一升级能为开发者带来显著的性能提升,但今年换用天玑 9500 手机后,日常使用中并未感受到明显的性能或速度提升。请问是什么因素制约了 C1 架构与上一代 Cortex-X925 架构之间在实际使用体验上的差异?另外,Arm 发布 C2 架构后,将如何进一步加快与合作伙伴在开发层面的协作,更好地赋能终端用户?
James McNiven:我不便对合作伙伴的具体产品实现做评价。谈到性能提升幅度,实际表现要看具体运行的负载。从 Cortex-X925 升级到 C1-Ultra,单线程性能确实实现了较大幅度的跃升:IPC 实现了两位数增长,同时主频也有所提高,综合性能最高可实现约 20% 提升,不过具体表现会随实际负载不同而变化。
展望 C2-Ultra 乃至未来的发展,我们将持续致力于每年实现两位数的性能提升。我希望大家从这次发布中看到的不仅仅是基准测试成绩的提升,更包括 AI 性能、应用启动速度以及其他各项用户体验指标的持续改善。
对于 Arm 在生态里的定位:我们投入大量资源做生态适配,推动各大 AI 框架支持 SME2。过去一年,我们已经公布了多个框架合作,把 SME2 优化落地到产品当中。我们也持续与安卓生态协同合作以提升相关效率;在图形领域,联合腾讯游戏、Unity 中国等众多合作伙伴,落地 NSS 和神经帧率提升(Neural Frame Rate Upscaling,NFRU)等新功能。这也是我们同时在 CPU 和 GPU 两端都高度关注 AI 性能提升的原因。再回应前面提到的问题,比如今天腾讯游戏的伙伴提到的神经纹理压缩(Neural Texture Compression)就是很好的案例:在画质不变的前提下大幅缩小文件体积,节省设备内存,这同样是我们重点布局的方向。
Q:刚才提到了《光影新生》这款游戏,能否介绍下它当前的开发进展,以及后续的发售计划?
Chris Bergey:这款游戏由 Sumo Digital 负责开发。我们邀请他们基于我们的理念和神经网络技术来打造这款游戏,并在概念设计等方面与他们进行了合作。这款游戏目前已经完成制作。我们希望能够适配本次发布的这款全新芯片平台,因此大概还需要 30 至 60 天的测试与验证周期,以确保能够为玩家带来出色的体验。具体的上线时间,我们会另行通知。
Q:关于 CPU 内部统一的神经网络加速器设计,相较于传统 NPU 这种独立的原生 AI 计算划分方式,对于算力利用会有什么区别?在架构层面具体改变了什么?
Chris Bergey:两者间存在不少差异。SME2 最独特的一点在于,它的编程方式和 CPU 保持一致:开发者无需采用独立的编程模型,而是可以沿用熟悉的 CPU 编程方式,通过指令直接调用 SME2 的矩阵计算能力,正因如此,SME2 能够实现极低的延迟,同时也更易于开发和编程。
大家应该还记得,去年我们介绍了 Arm Kleidi 软件库。开发者将其集成到 AI 框架,或者使用像 ExecuTorch 这样的抽象化框架时,底层软件会自动完成适配。如果硬件配备了 SME2,它就能够自动调用这一能力;如果硬件不支持,则不会调用。
类似地,神经网络加速器通过基于 Vulkan 的 GPU 工作流进行编程。相比之下,NPU 通常作为独立加速器进行调度,因此采用的是不同的编程模式。事实上,来自不同供应商甚至不同产品形态的加速器,其编程模型也各不相同,具有相当的独特性。这也正是开发者需要重点考量的地方,即根据自身工作负载的运行需求,选择合适的技术路径。
Q:智能体(agent)需要持续调用工具并保持运行状态,而智能手机受电池功耗、内存资源约束比较大。请问对于 Arm 平台而言,如何解决 AI 智能体持续运行所带来的内存和功耗难题?
James McNiven:这取决于我们如何定义 " 持续运行 " 这个概念。手机本身一直向网络发送信号,持续在后台运行各类任务。所以,全时段高强度占用整个系统,与按周期进行调度,这两者之间是有区别的。目前许多 OEM 厂商和智能体供应商也还在摸索这部分的实现方案。但实现高效的持续运行的智能体工作负载并非不可能,关键在于任务的运行强度。部分智能体可以周期性触发运行,但并不需要微秒级不间断持续工作。
Chris Bergey:另外我想补充两点。第一,我们在玩游戏时,通常同时活跃的线程数量是三到四个,这样的状态可能持续一个小时甚至更久,这说明通过智能调度能够实现很多可能性。第二,可以利用充电场景:当您晚上给手机充电时,设备可以进行大量的 KV 缓存优化和上下文预处理等工作。因此,可以将其理解为两种不同的运行模式:电池供电模式,以及充电供电模式。在充电状态下执行词元(token)生成这类高负载任务,就能让设备在移动使用阶段拥有更高的运行效率。
Q:Arm 的边缘计算布局目前已经从智能手机延伸至 PC、机器人以及物理 AI 等多个场景,并针对不同领域陆续推出了相应的计算子系统(CSS)。请问 Arm 是如何定义不同领域之间计算子系统边界的?这套 CSS 基础子系统是否会在不同领域间实现复用,还是会针对不同领域持续进行差异化演进?
Chris Bergey:简单来说,核心判断依据就是市场需求。举个例子,NVIDIA RTX 产品所采用的 Cortex-X925 核心,其实是两年前搭载在 CSS for Mobile 中的成熟技术,就当时的市场需求而言,那是最合适、最成熟的解决方案。
如今,我们在 PC 领域看到了更强劲的发展势头,不光是 Arm 架构设备相关生态在发展,还包括其他方面的积极进展。与此同时,我们也看到了越来越多独特的需求,包括安全能力以及其他各类功能特性。在这种情况下,我们就会有针对性地打造全新的 CSS 及差异化产品。相关进展欢迎大家持续关注。总结来说,我们会复用成熟 IP 和组件,但产品的演进方向完全取决于市场和客户的实际需求。
Q:过去几年,移动端 GPU 技术似乎一直追随桌面端的发展路径。目前,桌面端的 DLSS 5 已经实现了完整的画面帧生成,能够生成游戏本身未渲染的一些细节元素;而移动端 GPU 目前更多还是聚焦在超分辨率和增强上。请问,移动端的神经图形技术,距离 DLSS 5 这种帧生成渲染水平还有多远?Arm 在技术路线图中是否有相关规划?
James McNiven:二者底层技术原理高度相近,我们同样具备超级分辨率能力,同时通过神经帧率提升(Neural Frame Rate Upscaling,NFRU)实现了完整的帧生成能力。与其他方案相比,我们方案的一大差异点,是自始至终将能效放在核心位置。这一点从模型规模上就能体现出来,受能效优先的设计思路约束,我们的 NSS 模型相比其他复杂度更高的同类方案,体量要精简很多。就当前能力与 DLSS 5 的对比而言—— DLSS 5 目前已经支持多帧生成,而现阶段 NFRU 主要实现单次额外帧生成,也就是实现帧率翻倍,这是我们当前所能实现的技术能力。当然,我们也计划进一步拓展至多帧生成能力。
此外,我们也将看到诸如全局光照、辐射缓存等技术带来的新应用场景,这些都是我们正在布局的未来技术方向。但在当前阶段,我们更希望确保能够高效地实现高质量的图形效果,因此现阶段的重点仍聚焦于超分辨率和帧率提升,也就是实现帧率翻倍的效果。
还有一点值得一提——我们一直非常积极地推动开放模式的生态。开发者可以直接前往 Hugging Face 下载模型权重,并结合我们提供的工具进行实验和开发。我们希望通过这种开源模式,激发包括 Arm 在内以及行业其他厂商的创新活力。我们非常期待更多公司能够充分利用这套开放能力,目前我们也已经看到越来越多的行业协作。我们认为,这种开放协作的模式与传统做法有所不同,同时也能够为整个生态带来独特而长远的价值。



登录后才可以发布评论哦
打开小程序可以发布评论哦