
作者 | 云鹏
编辑 | 漠影
今天,各类智能终端都在向智能体(Agentic AI)方向快速进化,AI 加速从云端走向边缘,越来越多的 AI 功能可以在端侧高效、快速、安全的实现。
用户只需一句话,智能体就能执行几十甚至上百步操作完成复杂任务;有时你甚至不需要说话,智能体就能感知你所在的环境、理解你的需求、根据记忆主动提供贴心的服务。

就在最近,芯片生态巨头高通再次 " 亮剑 ",提前剧透了即将在 2026 骁龙峰会上发布的新一代骁龙旗舰移动平台将采用的诸多硬核技术升级,揭秘了 CPU、GPU、NPU 等核心模块面向 AI 智能体的一系列能力强化细节。
从 CPU 缓存架构革新突破存储瓶颈、AI 渲染深度集成于图形管线、GPU 专用 AI 核心的引入到 NPU AI 计算单元和共享内存的升级,我们看到,新一代骁龙旗舰移动平台完成了一次围绕智能体的全面进化,也将成为 2026 年下半年旗舰 AI 手机之战的关键底层支撑。
一、NPU 成智能体时代 " 刚需 ",高通联合行业头部构建新一代终端侧 AI 架构
谈及 AI 时代芯片变革,NPU 的进化始终是行业核心议题。
相比 CPU、GPU 这两个更基础、发展历史更长久、更成熟的 SoC 组成单元,NPU 的发展从源头就与 AI 强相关—— Neural Processing Unit ,神经网络处理单元,也因此NPU 在智能体时代几乎成为智能终端在算力层的 " 标配 "。

尤其在当下的智能体浪潮中,AI 不仅需要更强的推理能力,还需要持续低功耗运行、全天候感知、多模态、低时延等诸多特性的支撑。
这一趋势下,高通将在新一代旗舰平台上发布新的Hexagon NPU和两项关键技术创新,包括新的Element Accelerator 和更大的共享内存系统。
据了解,Element Accelerator 专为生成式 AI 和智能体 AI 的 Transformer 工作负载打造,其结合向量计算单元和标量计算单元,能加速大模型中最关键的运算,让智能体更快地响应、更高效地推理,同时兼顾能效表现。
此外,Hexagon NPU 扩展了大容量共享内存,可以让模型状态、上下文信息和 KV-cache 数据存储在更靠近 AI 计算单元的位置,进而缓解内存瓶颈。
这样一来,智能体在处理更长上下文、调用更多工具以及执行更多并发任务时就可以运行更流畅响应更及时、实现更快 token 生成速度,可以用更少的等待时间完成回答、修订、规划和执行,这对 AI 智能体体验的提升非常重要。

简单来说就是在兼顾模型性能质量的同时降低模型对存储的消耗:一个 300 亿参数的 MoE 模型可以在保持数百亿参数可用的同时,在 NPU 上每次生成一个词元,仅需激活约 30 亿个被路由选中的参数。
MoE 会根据输入动态选择专用专家网络,从而减少实际计算负载和内存带宽需求,结合智能的专家模块闪存到内存加载管理机制与缓存技术,以低功耗和低内存需求实现更大模型级别的 AI 体验,颇有 " 事半功倍 " 的效果。
同时,对 INT2、INT4、INT8、FP8 和 FP16 的支持,让开发者能更灵活地在性能、内存、模型质量和功耗之间取得平衡。
对于基于 INT4 的模型,Hexagon NPU 可以实现最高 50% 的预填充性能提升、更快的解码吞吐速度、增强的推测解码、更快的词元生成速度。直观效果就是,智能体响应更快、性能更强、结果更个性化,首次生成时间低于 1.5 秒,近乎即时交互。
总体来看,新一代 Hexagon NPU 融合了计算性能、存储架构、灵活性等多方面创新,形成了由 Element Accelerator、向量和标量计算单元、更大的共享内存以及基于闪存的模型加载机制共同构成的协同架构,在支撑智能体 AI 端侧落地方面起到了关键作用。
二、5GHz 高主频、动态缓存架构创新,Oryon CPU 让智能体有个 " 强大脑 "
在 AI 大模型刚刚诞生之初,AI 生成文字、图片是主要用例,那时 AI 应用的需求更多侧重 GPU,而在智能体时代,海量复杂任务的拆解、规划执行,海量数据的感知、处理、分析,都对 CPU 提出了更高要求。
用高通的话来说,CPU 是定义整个平台的核心基础,也是决定整体性能表现的关键所在。

值得注意的是,这一极高的主频并非仅依靠先进制程工艺实现,高通为其进行了完整的定制化设计,从 CPU 内核的微架构、落地方案到 CPU 子系统,研发团队对每个组件都进行了精细调校,最终突破移动芯片限制,实现 5GHz 主频。
在高主频基础上,新一代 Oryon CPU 的关键IPC 性能也进一步提升,两者相结合,让手机在启动 App、网页、游戏、内容创作等场景都更流畅,同时让手机在处理智能体 AI 需求时,CPU 的每一次调度、协调、复杂计算都更高效。
众所周知,缓存对 IPC 的表现至关重要。从智能体规划任务调用工具到多任务多线程并行进行,这些场景涉及大量数据访问,都对缓存有高要求。
为此,高通在下一代旗舰移动平台中引入了新的动态缓存架构 Qualcomm Oryon FlexCache,实现 " 定制化 " 的 CPU 体验,其支持异构计算核心访问相同的缓存池,系统可以根据工作负载动态调整分配缓存资源。

在当前行业普遍面临存储供应短缺的背景下,这项技术的创新意义尤为凸显:FlexCache 减少了核心访问系统内存的频率,因此即使在内存资源受限的情况下,CPU 也能提供稳定的性能表现。
在 AI 智能体时代,FlexCache 的重要性更加突出。智能体往往会执行一连串任务,不同任务步骤需要跨不同核心轮流执行。由于所有核心共享同一缓存空间,任务切换过程中相关数据依然保留在缓存中,无需重复加载,智能体能够更高效地在不同核心间协同运行。
从 CPU 主频、IPC 核心性能的大幅提升,到 FlexCache 缓存架构层的颠覆式升级,新一代 Oryon CPU 可以说给智能体时代的旗舰移动平台夯实了根基。
新的 Oryon CPU 会在智能体工作流中承担更多的编排规划工作,统筹平台各类计算资源、协调工作流,并根据智能体的需求调用相应工具,让 AI 手机可以更好地应对更复杂、更有挑战的 AI 应用需求。
三、把 AI 专用核心塞入 GPU,AI 颠覆游戏体验的时代已经来了
聊完了 CPU,我们将目光聚焦于 GPU。今天,AI 游戏时代俨然已经到来,AI 愈发深度地与游戏开发、游戏玩法相结合。
前不久 PC 端侧发布的 DLSS 5 技术,将 AI 模型深度融入图形渲染管线,对端侧游戏市场带来颠覆性冲击。而在移动游戏市场,必然需要高通这样的芯片玩家来推动 AI 变革的落地。
在高通看来,移动游戏行业十年来一直在追求三件事:主机级的画质、稳定的帧率,以及出色的电池续航。在过去的大部分时间里,用户只能选其二。而高通通过结合 AI、专用芯片和先进内存架构,力图让这三件事得以兼得。
为此,高通在 GPU 层面祭出多项硬核技术大招。
首先是AI 图形渲染技术—— Adreno Neural Fusion,这一技术将神经处理、AI 超分和帧生成统一整合到单一图形管线中,可以在降低渲染成本和功耗的同时,实现更高的视觉质量,可以说是既要又要了。
值得一提的是,高通还第一次将专用于 AI 的 GPU 核心 Adreno Matrix Cores 引入图形管线,搭配 18MB 的 Adreno 独立高速显存(HPM),实现 AI 工作负载的本地处理,从而降低延迟、延长游戏时的手机续航时间。
纵观行业,英伟达、苹果公司分别在 2017 年、2025 年给自家 GPU 中加入了专用的 AI 核心,前者是 Tensor Core,后者是 Neural Accelerator。高通的入场进一步证明,这已经是行业头部玩家共识的 GPU 迭代重要方向之一。
高通技术公司产品市场高级总监 Cisco Cheng 提到,新一代高通 Adreno GPU 在图形性能和能效两方面都实现了迄今为止最大的代际提升。
与之前的解决方案相比,Adreno Neural Fusion 提供了更好的图像质量,减少了画质瑕疵,提升了帧稳定性,并保持细节锐利清晰。
引入Adreno Matrix Cores也是非常关键的一步,这是一组专为 AI 设计的 GPU 核心,能在图形管线内直接运行 AI 模型。
借此,开发者可以以更低的延迟和更小的功耗开销运行日益复杂的渲染模型,神经计算不再需要离开图形管线去别处完成。
高通称这是其 AI 路线图上的一个重要里程碑:从 NPU、CPU 到 GPU,骁龙平台中的每个核心引擎都已得到 Matrix 加速能力的加持。
当然,GPU 在 AI 任务处理方面同样离不开高效存储的支撑。Adreno Matrix Cores 搭配了 18MB 的专用优化缓存—— Adreno 独立高速显存(HPM),集成于 Adreno GPU 平台中。
HPM 为 GPU 提供了大容量、低延迟的直接内存访问,让基于图块的渲染、帧缓冲和计算工作负载可以留在图形子系统内部处理。更少的数据传输意味着更低的延迟、更高的效率。
对开发者而言,采用率和性能同样重要。Adreno Neural Fusion 是同类中首个获得主流游戏引擎支持并已商用的移动 AI 超分技术。Adreno Neural Fusion 目前已获得 Unity 和 Unreal Engine 两大主流游戏引擎的支持。
据了解,高通会在今年的骁龙峰会上揭晓所有支持并率先采用这一技术的游戏,其中部分将于今年实现商用。
随着未来越来越多游戏采用 Adreno Neural Fusion,在 AI 加持下,搭载骁龙平台的设备会在游戏方面获得更好画质、更流畅游戏体验和更高能效。AI 给移动游戏体验带来颠覆式升级,已成必然。
结语:旗舰芯围绕 AI 深度进化,高通全力冲刺 Agent 时代
从 NPU、CPU 到 GPU,高通旗舰平台核心模块的诸多技术升级都直指智能体时代端侧 AI 落地的关键痛点,如何让 AI 在端侧跑的 " 多快好省 ",高通可以说给行业抛出了新的高效解法。
在智能体时代,传感器中枢始终保持环境语音感知,SoC 其余模块则按需唤醒,各司其职:Oryon CPU 负责指挥、规划、推理,并协调整个工作流程,Hexagon NPU 和 Adreno GPU 共同承担 AI 推理,高通的思路十分明确。
面向未来智能体时代的智能终端大战,高通已经给行业筑牢了扎实的底层算力平台,基于其上,各家大厂会亮出怎样的旗舰 AI 产品,端侧 AI 体验又会迎来怎样的革新?我们拭目以待。


登录后才可以发布评论哦
打开小程序可以发布评论哦