快科技 9 月 14 日消息,在 2026 中国算力大会上,由移动云联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同打造的国内首个国产 GPU+ 类脑芯片大模型异构混合推理系统正式发布。
该系统采用国产 GPU+ 类脑芯片架构,对标英伟达 Vera Rubin+Groq 方案,是国内首个将国产通用 GPU 与类脑芯片深度融合的异构推理系统。

项目团队从系统架构创新入手,创新实现 Transformer 模型 PD/AF 分离推理模式。大模型被做 PD/AF 拆分,不同模块部署到最擅长的芯片上。
Attention 注意力计算交由国产 GPU 承载,发挥其通用计算优势。FFN 前馈网络延时敏感模块交给类脑芯片处理,充分利用存算一体与片上大容量 SRAM 的架构优势。
团队自研模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度与结果聚合,彻底突破传统单 GPU 推理的固有瓶颈。
经 DeepSeek V4 Flash 实测,相较同类国产 GPU 算力集群,该系统推理输出和能效均提升 1 倍以上,业务运营成本降低 40% 以上,实现自主可控。
中国移动云公司类脑与光实验室技术总监杜宇健表示,引入类脑算力相当于给现有 GPU 资源 " 涡轮增压 ",让国产芯片在不依赖先进制程的前提下实现推理性能翻倍。
成果可广泛适配 Token 工厂、AI 代码生成、多智能体协同、智能制造等高实时性场景,同时面向金融、安防、通信等安全敏感行业提供全栈国产化推理底座。
该团队计划将核心异构推理框架逐步开放,赋能国内 GPU 与类脑芯片厂商及算力运营商。



登录后才可以发布评论哦
打开小程序可以发布评论哦