驱动之家 昨天
高通第六代骁龙8至尊版系列集成全新Hexagon NPU:专为AI智能体打造
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

快科技 9 月 11 日消息,高通在其官网介绍了全新一代 NPU,即 Hexagon NPU,这款 NPU 专为下一代 AI 智能体打造。

据悉,高通第六代骁龙 8 至尊版系列引入了全新的 Hexagon NPU 和两项关键特性,包括全新 Element Accelerator 和更大的共享内存系统。

Element Accelerator 专为赋能当今生成式 AI 和智能体 AI 的 Transformer 工作负载而打造。结合向量计算单元和标量计算单元,它能够加速大模型中最关键的运算,帮助智能体更快地响应、更高效地推理,并在保证移动端能效的前提下,提供更丰富的体验。

同样重要的是,Hexagon NPU 大幅扩展了大容量共享内存。通过让多模型状态、上下文信息和 KV-cache 数据存储在更靠近加速器的位置,该平台能够缓解内存瓶颈,让智能体在处理更长上下文、调用更多工具以及执行更多并发任务时,始终保持流畅响应。

上述技术创新共同定义了新一代 Hexagon NPU 的角色,即直接在终端侧运行更多智能体 AI 体验。

Element Accelerator、向量与标量扩展单元和更大的共享内存,组成一套协同架构,助力 NPU 加速 Transformer 工作负载、处理控制逻辑复杂的智能体任务 .

并将更多上下文数据保留在靠近计算单元的位置。值得注意的是,Hexagon NPU 同样面向下一代模型架构而打造。

高通表示,公司正与领先的内存和模型厂商合作,引入混合专家模型(Mixture-of-Experts,MoE)构建新一代终端侧 AI 架构。这意味着一个 300 亿参数的 MoE 模型在保持数百亿参数可用的同时,在 NPU 上每次生成一个词元仅需激活约 30 亿个被路由选中的参数。

与每次推理都需要更大部分网络参与的密集模型不同,MoE 会根据输入动态选择专用专家网络,从而减少实际计算负载和内存带宽需求。

结合智能的专家模块闪存到内存加载管理机制与缓存技术,这种方法能够以低功耗和低内存需求的方式实现更大模型级别的 AI 体验,为智能手机带来响应迅速且注重隐私保护的生成式 AI。

混合专家模型通过选择性激活专用专家网络,能够提升效率和质量,无需每次请求都调用整个模型。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:振亭

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 高通 第六代 骁龙 元和
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论