【CNMO 科技消息】9 月 23 日,在 2026 骁龙峰会期间,高通技术公司宣布携手阶跃、无量火与江波龙开展四方合作,基于第六代骁龙 8 超级至尊版移动平台,将阶跃 StepEdge-Omni 30B-MoE(混合专家)模型面向端侧进行深度适配与推理优化,成功打造具备自主服务和个性化能力的端侧智能体助手,并在峰会现场完成基于高通参考设计的现场演示,验证了复杂智能体 AI 工作流在智能手机上的高效部署与规模化扩展能力。

第六代骁龙 8 超级至尊版与第六代骁龙 8 至尊版
此次合作解决了大参数模型在端侧部署的关键行业痛点,让 300 亿参数量级模型具备在智能手机上规模部署的条件,将推动更加复杂的智能体 AI 体验落地智能手机,并利用端侧用户数据和平台能力实现更加个性化的智能体服务。与每次推理均需激活全部参数的 Dense 模型相比,MoE 模型仅按任务需要激活部分专家模块,在保持大模型容量与能力的同时,显著降低计算量和内存带宽需求,日益成为推动云端规模大模型向终端侧部署的重要技术路径之一。
第六代骁龙 8 超级至尊版移动平台搭载全新 Qualcomm Oryon CPU、下一代 Qualcomm Adreno GPU 和重新设计的 Qualcomm Hexagon NPU,并配备 LPDDR6 内存与高速存储通道。定制 Qualcomm Oryon CPU 峰值频率高达 5GHz,并引入全新的可扩展缓存架构 Qualcomm Oryon FlexCache;Adreno GPU 引入针对 AI 负载打造的 Adreno Matrix Cores,并支持全新 Adreno Neural Fusion 特性;Hexagon NPU 面向智能体 AI 的 Transformer 工作负载引入全新的 Element Accelerator,并将大容量共享内存扩容 50%。

第六代骁龙 8 超级至尊版
在此之上,无量火的自研 Ember 推理引擎与 Ember Kernel 端侧编排内核基于第六代骁龙 8 超级至尊版移动平台的 AI 性能基础和完整软件栈支持,以 XCompute 异构调度实现跨 CPU/GPU/NPU 的统一高性能编排,在不修改模型结构、不损失推理精度的前提下,使阶跃 30B-MoE 模型的运行内存需求相比行业常规方案降低超 50%。基于江波龙提供的端侧 AI 存储解决方案,模型权重可从端侧闪存高效加载,通过存储与计算协同减少大模型对运行内存的持续占用,进一步提升模型加载和运行效率。
得益于此,该端侧智能体助手实现了从邮件理解到行程规划、日历同步、航班酒店推荐、行程分享到邮件草拟的全链路自主办公,全程本地完成,无需云端调用。得益于 NPU+GPU 双引擎协同,模型预填充吞吐性能超过 330 Token/s,对比仅使用 NPU 的通用推理方案提升超过 30%,解码吞吐性能超过 28 Token/s,并能保持持续稳定运行,且首个词元生成速率达到毫秒级,对比云端 API 调用快数倍至数十倍。
高通技术公司高级副总裁兼手机业务总经理 Chris Patrick 表示:" 此次合作展现了硬件、软件、内存和 AI 模型等多个领域的技术进步,如何推动日益复杂的 AI 工作负载直接在移动终端上运行。通过与阶跃、无量火和江波龙合作,我们优化了阶跃 30B-MoE 模型在第六代骁龙 8 超级至尊版移动平台上的部署,在提升吞吐性能、降低内存需求的同时,实现了持续稳定的终端侧运行。"
阶跃副总裁、端侧模型负责人俞刚表示,阶跃 30B-MoE 模型是目前市面上最大的手机端侧模型,也是首个在第六代骁龙 8 超级至尊版移动平台上完成跑通和验证的 MoE 模型。
无量火 CEO 王瑜琨表示,Ember 推理引擎将大模型内存需求降低超过 50%,让手机即可流畅运行 30B 大型 MoE 模型。
江波龙副总裁、嵌入式存储事业部总经理黄强表示,江波龙将行业独有的 iSA 存储智能体率先适配第六代骁龙 8 超级至尊版移动平台,通过存算协同释放平台算力价值。


登录后才可以发布评论哦
打开小程序可以发布评论哦