美国当地时间 9 月 22 日,高通在 "2026 骁龙峰会 " 上推出第六代骁龙 8 超级至尊版和第六代骁龙 8 至尊版两款旗舰移动平台,两款芯片均采用 2nm 制程工艺,并打破长期以来仅推出一颗高端旗舰 SoC 的惯例。小米、vivo、OPPO、荣耀等厂商均出现在首批采用名单中。
就在一周前,联发科发布的天玑 9600 Pro 同样采用 2nm 制程。随着全球两大主要安卓手机 SoC 厂商相继推出 2nm 旗舰产品,旗舰移动芯片的制程竞赛正式从 3nm 迈入 2nm 阶段。
不过,相比强调性能的提升,今年高通明显把更多篇幅留给了 Agentic AI(智能体 AI)。高通公司总裁兼 CEO(首席执行官)安蒙在主题演讲中强调:" 智能体时代已经到来。推理成为关键,边缘侧将发挥重要作用。" 按照高通对下一阶段 AI 终端的判断,AI 正在从响应用户指令的工具,进一步变成能够理解上下文、拆解任务,并在获得授权后执行操作的智能体。
为了推动更加复杂的智能体 AI 落地手机,高通此次联合阶跃星辰、无量火和江波龙,基于第六代骁龙 8 超级至尊版,将一款 300 亿参数的 MoE 模型部署至手机端。值得注意的是,目前能够在手机本地运行的大模型更多集中在数十亿参数量级,而参数更大的模型则可以为更复杂的手机智能体提供底层能力。
可以看到,当手机开始承担越来越复杂的 AI 推理和智能体任务,移动芯片的新一轮竞争正在从 " 手机性能有多高 ",转向 " 手机本地能够运行多大的 AI,以及 AI 究竟能替用户完成多少事情 "。
手机芯片开始为 Agent" 重新设计 "
过去几代旗舰手机芯片的升级重点,是让手机 " 算得更快 ",一颗旗舰手机 SoC 将多个功能模块集成在单一芯片上,比如 CPU 影响应用启动和系统响应速度,GPU 主要承担图形和游戏计算,ISP 负责影像处理,NPU 则主要承担 AI 计算。每一代旗舰芯片的竞争,也往往围绕这些模块各自提升了多少展开。
但 Agent 的出现正在模糊这些边界。一个能够真正替用户办事的 AI,并不是在 NPU 上完成一次模型推理就结束了。以规划一次出差为例,智能体可能需要先读取邮件中的时间和地点,理解用户的行程需求,再调用航班、酒店、地图和日历等服务,持续完成多个步骤;在这一过程中,还可能需要调用用户的个人知识和历史信息,并保存上下文。
这意味着,AI 从过去相对单一的问答、修图、摘要等任务,进一步走向连续执行任务后,所需要的不只是更高的 NPU 算力,而是 CPU、GPU、NPU、内存、存储之间更高效的协同。
" 我们刚刚进入智能体时代的开端,智能体需要全新的系统架构,而骁龙正是为这个时代打造的平台。" 安蒙在此次峰会上说道。事实上,随着 AI 承担的任务越来越复杂,手机芯片内部不同计算单元的分工也将随之变化。
围绕智能体的工作方式,此次高通重新设计了手机的芯片。比如,CPU 搭载高通定制 Oryon CPU 内核,采用 8 核架构,主频最高达到 5GHz,这是业界首个主频突破 5GHz 的移动 CPU;高主频之外,高通还在 GPU 中加入 AI 专用核心并配备独立高速缓存,在 NPU 中增加 Transformer 加速器并扩容内存,优化传感器中枢里的低功耗感知能力等,使得新骁龙双旗舰芯片可以让手机在有限的功耗内完成更复杂的连续智能任务。
除此之外,高通为数据中心 AI 推理设计的 HBC(高带宽计算)技术未来也计划应用于骁龙平台。HBC 的核心思路之一,是通过 3D 堆叠让计算单元与内存更加靠近,以降低 AI 计算过程中数据搬运带来的性能和能耗损失。
端侧模型从 7B 走向 30B
当 CPU、GPU 和 NPU 开始围绕 Agent 协同工作,另一个备受关注的问题是,手机本地究竟能够运行多大的模型?
过去几年,这个问题的答案一直受手机内存和功耗的严格限制。相比拥有数百 GB 甚至 TB 级显存的云端服务器,智能手机通常只有十几 GB 的运行内存,其中还需要为操作系统和大量应用留出空间。因此,即使芯片 AI 算力不断提升,把几十 B 参数的大模型搬到手机本地运行,过去仍面临较高门槛。
vivo 副总裁、OS 领域副总裁周围日前在接受包括记者在内的媒体采访时回忆,直到去年,行业对于端侧大模型落地规模的判断仍相对谨慎。
" 去年我们觉得手机上跑 3B、7B(Billion,代表十亿)的模型,对于内存来说都很吃力。" 周围表示,变化出现在今年初。
据周围介绍:" 随着 MoE(混合专家)等稀疏模型架构的发展,大模型每一次运行不一定需要调用全部参数,即不用一次加载完,可以每次只加载一个或者几个专家模型。"
这成为 300 亿参数模型开始走向手机端的关键。传统 Dense(稠密)模型在推理过程中需要调用整个模型,而 MoE 模型内部可以包含多个针对不同任务训练的 " 专家 "。面对具体任务时,系统只选择其中部分专家参与计算。因此,即使模型拥有 300 亿总参数,单次推理真正参与计算的参数量也可以远低于 300 亿,从而降低对计算资源和内存带宽的需求。
高通此次联合阶跃星辰、无量火和江波龙部署的 StepEdge-Omni 30B-MoE 也采用了该技术路线。其中,无量火通过 CPU、GPU 和 NPU 异构调度,使该模型运行内存需求相比常规方案下降超过 50%;江波龙则通过端侧存储方案,让模型权重从闪存加载,并通过存储与计算协同减少模型对运行内存的持续占用。
随着 Agent 需要处理更复杂的任务,它需要理解更长的上下文,拥有更丰富的知识,并具备更强的推理、规划和工具调用能力。更大的模型容量,为这些复杂智能体能力提供了更大的空间。据高通现场展示,300 亿参数模型能够实现从邮件中读取信息,随后完成行程规划、日历同步、航班和酒店推荐,并最终生成邮件草稿的功能,并且整个过程均在本地完成,无需云端调用。
从高通此次发布的两颗芯片,以及 300 亿 MoE 模型在手机上的运行来看,移动芯片已经在为下一阶段的 AI 手机重新搭建底座。


登录后才可以发布评论哦
打开小程序可以发布评论哦