爱云资讯 1小时前
国产GPU+类脑异构混合推理系统于2026中国算力大会全球首发
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

9 月 11-13 日,2026 中国算力大会于河北廊坊举办。由中移 ( 苏州 ) 软件技术有限公司联合中国电子科技南湖研究院、北京灵汐科技有限公司、上海天数智芯半导体股份有限公司、中国移动通信集团江苏有限公司、清华大学、北京大学共同研发的基于国产 GPU+ 类脑芯片的大模型异构混合推理系统,在本届大会 " 算力首创首发发布会 " 完成全球首次公开亮相。该成果是清华大学孵化的灵汐科技在云侧大模型极致推理方向的重要落地实践,利用我国在类脑芯片方面的优势为智能体时代大模型推理提供国产化异构全新解决方案。

当前,AI 智能体、长上下文大模型、文生视频等业务快速普及,Token 生成规模持续暴涨。传统纯 GPU 推理集群长期受 " 内存墙 "" 调度抖动 " 约束,在长上下文推理场景下,面临首 Token 延迟高、算力利用率不足、功耗与部署成本居高不下等现实痛点,难以满足智能体时代高并发、低时延推理的规模化落地需求。面向国产算力自主可控的时代要求,项目团队探索架构创新,融合国产通用 GPU 与灵汐科技类脑芯片各自技术优势,利用我国在类脑计算芯片的优势在相对落后工艺基础上打造国内对标国外主流 GPU 下一代国际先进的 Vera Rubin with Groq 异构推理方案的国产化系统。

该异构混合推理系统将基于 Transformer 结构的大模型进行 PD+A 拆分,创新性的将不同模块有序的部署在 GPU+ 类脑异构算力系统。其中,Prefill 阶段及 Attention计算模块交由国产 GPU 承载,FFN ( MOE 专家 ) 延时敏感模块交由类脑芯片处理,通过自研模型编译器、高速互联协议与统一异构推理引擎,实现两类算力的任务拆解、协同调度、结果聚合,充分发挥类脑芯片存算一体、片上大容量 SRAM 的架构优势,突破传统 GPU 推理的固有瓶颈。

数据显示 ( 3 台天数较早型号的 GPU 服务器 +3 台类脑机柜 ) ,运行 Deepseek V4 Flash 模型,相较同等投入规模的纯 GPU 集群,推理输出和推理能效均提升 1 倍以上。业务运营成本下降 40% 以上。同时,还可持续提升国产 GPU 集群在长文本输入下的推理输出性能。成果适配Token 工厂、AI 代码生成、多智能体协同、智能制造等高实时性场景,同时面向金融、安防、通信等安全敏感行业,提供全栈国产化推理底座

项目拥有完整自主知识产权,累计形成 15 项授权发明专利、6 项软件著作权,覆盖异构调度、类脑芯片架构、编译工具链、集群资源管理等全栈关键环节,技术目前已达到小批量试产阶段。整套方案不依赖海外高端芯片与先进制程,依靠系统架构创新实现与国际顶尖异构推理架构对标的能力,为我国大模型推理算力自主可控提供重要实践样本。在本次中国算力大会上,该成果入选 " 算力首创首发 " 成果名录,面向产业客户、科研机构、投资机构完成首次公开展示。

首发发布环节外,灵汐科技团队、中移 ( 苏州 ) 软件技术有限公司、中国电子科技南湖研究院、上海天数智芯半导体股份有限公司将在大会期间开展技术交流与产业对接,倾听行业真实业务诉求。依托天数智芯国产通用 GPU 成熟工程化能力,配合灵汐类脑芯片存算一体、片上 SRAM 的架构优势,突破异构芯片流水线调度优化、跨架构高速协同联动等核心技术难题,全面拓宽高并发、低时延大模型业务的承载上限,树立了国产异构算力融合联调的行业标杆。后续灵汐科技将联合各合作方持续迭代这套异构混合推理方案,扩大主流大模型适配范围,推进在智算中心、行业算力平台的试点落地,把类脑架构的技术优势转化为规模化提升国产大模型推理能力的双引擎发动机。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 清华大学 北京大学 gpu 芯片
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论