雷科技 17小时前
Arm发布CSS for Mobile 2:GPU唱主角
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

今天去了趟上海的 Arm Everywhere China,Arm 发布了新一代 AI 原生计算平台,说实话这种芯片计算平台的发布特别硬核,实在是考验我的吸收理解能力,我尽量写通俗一些,让大家都能看懂。

一年前,Arm Unlocked 上海站的主角是 Lumex CSS,这是 Arm 第一代面向手机的计算子系统,把 CPU、GPU、系统互联和软件做成一个完整平台交给芯片厂,不再是一个个单独的 IP 核。

今天,Arm 发布了第二代移动终端计算子系统(CSS for Mobile 2),也就是去年 Lumex 的第二代。

只看参数表的话,这是一次标准意义上的年度升级,CPU 单线程提升 15%,GPU 基准性能最高提升 24%。

不过,一整天的活动听下来,我越来越确定一件事,GPU 才是 Arm 今年真正想讲的故事。

从 IP 到 Lumex 再到 CSS for Mobile 2,Arm 向前迈进一步

Lumex 今年改成了 CSS for Mobile 2,有人可能会疑惑为什么换名字,我们特地问了 Arm 这个问题,其实是有意为之,改名就是为了简化命名体系,CSS for Mobile 表意清晰,一看就知道是针对移动领域的平台,与之相比,此前 COMPUTEX 上还发布了 CSS for PC,这样大家一眼就能看清每个平台针对哪个品类。

名字变了背后,是 Arm 在交付方式上向前迈了一步,前文有提到,以前 Arm 交付的是单个 IP 核,芯片厂商自己拿回去组合,从 Lumex 开始,甚至从 Arm CSS for Client 开始,Arm 在 IP 授权的基础上,又多了一种选择,即把 CPU、GPU、系统互连、物理实现、软件工具链预先整合好,做成一个完整平台交给芯片厂商。

要特别说明的是,这不是捆绑销售,合作伙伴既可以整套采用 CSS 平台,也可以单独选用其中某个组件,还可以和自研或第三方 IP 结合,根据产品定位、性能目标和市场需求灵活搭配。

大家可以理解为 CSS 提供的是一个经过系统级优化的参考方案,用不用、用多少,主动权在客户手里。

CSS for Mobile 2 的三大件分别是 C2 CPU 集群、Mali G2-Ultra NX GPU 和 SI L2 系统互连,而这三大件的设计,都围绕同一个原点:智能体。

Arm 认为,手机上的 AI 正在从问答助手变成能自主完成任务的智能体,而智能体的工作流可以拆成四步:

第一步是感知,听懂用户在说什么、理解意图;

第二步是记忆,调取日历、照片、偏好等上下文信息;

第三步是推理,根据已知信息规划下一步该做什么、生成结构化指令;

第四步是行动,调用对应的 App 或服务把事情办完。

当然,全程还有一个编排层在调度,决定每一步该跑在哪个计算资源上,CPU 就是这个体系的编排调度中心,C2 CPU 集群集成了双 SME2 引擎,就是专门用来跑轻量级 AI 任务的。

按 Arm 官方的说法,轻量模型通常指 20 亿至 30 亿参数规模,比如 Gemma-2B、腾讯混元 HY-1.8B-2Bit,这个规模的模型放在 CPU 上跑,延迟比 NPU 还低,而且跨平台兼容性好。

具体参数方面,最新 AI 模型性能最高提升 1.7 倍,语音转文本延迟降低 40%,单线程性能提升 15%。这些提升贯穿智能体工作流的各个环节,比如更快的语音处理缩短交互起始延迟,更快的记忆检索让智能体迅速调取上下文,更快的推理速度让决策更及时等。

值得一提的是,目前 vivo X300 系列、OPPO Find X9 系列、三星 S26 系列,包括 iPhone 等几乎所有旗舰手机,都已经采用了 SME2 技术,这意味着 Arm 在 CPU 端的 AI 能力已经实现了大规模落地。

手机 GPU 撞墙之后

说完 CPU,来说说今年的重头戏:GPU。

当前手机游戏的画面越来越复杂,高分辨率、高帧率、大世界、光线追踪,每一项都在增加 GPU 的工作量。而手机的功耗预算就那么多,散热空间也有限,GPU 的性能增长追不上游戏复杂度的增长,这是所有手机 GPU 厂商都要面对的一堵墙。

Arm 的解法是 Mali G2-Ultra NX,这个名字里的 "NX",就是 Neural Accelerators(神经网络加速器)的意思。

从这就可以看出,Arm 做了一个和很多厂商不同的选择,没有把 AI 加速器做成独立的 NPU 放在 GPU 旁边,而是直接集成进了着色器核心内部。

这个设计的好处是数据不用在 GPU 和 NPU 之间来回搬运,神经图形任务和渲染任务可以并行跑,共享 GPU 的内存系统和缓存,延迟更低、效率更高。而且这部分加速器面积极小,带电源门控,不用的时候直接关掉不耗电。

其实就像两个人一起拼乐高,如果一个在客厅、一个在卧室,零件要来回传递,效率很低;如果两个人坐在同一张桌子前,共享一个零件盒,随时能看到对方拼到哪了,配合起来就快得多。

基于 NX 加速器,Arm 带来了三项神经图形技术:

神经超级采样(NSS):GPU 先渲染低分辨率画面,再用神经网络重建到高分辨率,最高提升 2 倍 FPS,外部内存流量降低 50%。

神经帧率提升(NFRU):在两帧之间生成 AI 中间帧,支撑 120 FPS 持续游戏,DRAM 流量降低 33%。

神经超级采样与降噪(NSSD):把超分和降噪结合,专门用于复杂光追场景,在低采样率的光追画面上同时提升分辨率和去除噪点。

说到这里难免有人会问:这和 NVIDIA 的 DLSS 有什么区别?

Arm 也很坦诚,直言不讳表示底层要实现的场景确实高度相似,超分、帧生成、降噪,但手机必须在功耗和散热约束下重新设计整套东西,所以 Arm 的模型更小更省电,而且是开放的,手机厂商验证之后可以按自己的产品需求修改和定制,目前 Arm 正与腾讯游戏合作探索神经动态全局光照等下一代技术。

说白了,移动端再怎么堆料,在绝对画质方面肯定比不过桌面显卡,但我认为 Arm 的方向是对的,在手机个位数性能释放的功耗预算里,用 AI 来补画面,确实是一条 " 曲线救国 " 路。

抛开 AI,传统图形渲染依旧有硬实力

说了这么多 AI,不如实际跑跑看效果。

在 Arm Everywhere China 上,Arm 展现了和 Sumo Digital 基于虚幻引擎 5.5 联合打造了一款叫《光影新生》demo,支持 MegaLights,场景内最多 1400 盏动态光源,光照与阴影全部为光线追踪实时计算,没有预烘焙,实际效果非常惊艳。

作为参考,它原来只有 15 FPS,但在 Mali G2-Ultra NX 平台上跑到了持续 60 FPS,相当于帧率最高 4 倍的提升,同时 DRAM 流量还最多降低了 70%。

如果以为 G2-Ultra NX 只靠 AI,那就小看它了,这一代 GPU 在传统渲染上也有实打实的提升,主要有两项关键升级。

其中一个是全新的执行引擎,这是 Mali 七代产品以来最大的指令集架构升级,每个线程束的寄存器数量比上一代多了一倍,支持动态寄存器分配。

在面对 UE5 Nanite 和 Lumen 这类越来越复杂的着色器程序,寄存器翻倍能有效减少溢出到内存的情况,让大着色器更高效地运行。

另一个是第三代光线追踪单元,采用了更紧凑的光线-三角形数据结构,光追基准测试的 DRAM 流量降低 13%。同时硬件支持不透明度微贴图(OMM),能高效处理植被、织物这类透明几何体,演示中帧率提升 30%,光追负载降低 70%。

硬件能力到位了,开发者能不能方便地用上才是关键,Arm 在这方面也做了不少铺垫。

针对开发者生态,Arm 推出了神经图形开发套件(Arm Neural Graphics Development Kit),目前 NSS 和 NFRU 模型已经在 Hugging Face 和 GitHub 上开放。

国内大厂的合作进展也很快,腾讯 Magic Dawn、Unity 中国团结引擎已集成;网易《燕云十六声》今年将推出 NSS 版本,腾讯《暗区突围:无限》、叠纸的《无限暖暖》也在集成中。另外据小米官方信息,玄戒 O3 也采用了 G2-Ultra NX。

还是那句话,AI 不是万能的,神经图形更像是一个工具,用在什么场景、用到什么程度,最终还是开发者说了算。

写在最后

一整天活动下来,有两点观察想和大家分享。

第一、神经图形在移动端确实到了可用的节点,模型、插件、demo 都有了,还有明确的接入周期和国内厂商的适配名单,这些都是技术从概念走向落地的信号。当然最终效果还要看量产机型和实际游戏,但至少路径我觉得是清晰的,不再是 PPT 上的画饼。

第二是关于 CSS 平台模式的一点思考,Arm 把 CPU、GPU、互连、软件整合得越来越深,那各家终端的差异化从哪里来?

针对这个问题,Arm 也对雷科技表示,平台解决的是基础能力的下限, 保证每一家采用 CSS 的芯片都能达到不错的性能、能效和兼容性,而差异化交给合作伙伴在平台上做,核心数量、频率、工艺节点、自研 IP 的混接,都由厂商自己决定。

相当于 Arm 的平台化不是要把厂商变成贴牌工厂,而是把重复造轮子的工作交给自己,让厂商把精力放在真正能体现差异的地方。

以上就是我在 Arm Everywhere China 的所见所闻,至于 Arm 这种模式能不能走通,等量产机型出来就会有答案了。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

arm ai gpu 芯片 上海
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论