经济观察网 20小时前
天数智芯发布天垓300,面向三类智能构建新一代通用算力底座
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

2026 世界人工智能大会期间,天数智芯正式发布新一代通用 GPU 旗舰产品天垓 300。作为公司新一代架构的首款产品,天垓 300 面向人工智能从信息处理、任务执行到未知探索的发展趋势,围绕芯片架构、关键算子、系统扩展和软件生态全面升级,以对标并超越 Hopper 架构国际主流方案 ( 以下简称 Hopper 方案 ) 的效能表现,为 AI 规模化应用提供高质量算力支撑。

天垓 300 PCIe 板卡和 OAM 模组

天垓 300 基于 SIMT 通用计算架构,可高效支持标量、矢量和张量等多种计算类型,并围绕 Attention、MoE、AF 分离、PD 分离及大规模系统扩展等关键技术进行优化,进一步提升底层算力向实际 Token 产出和业务价值的转化效率。在复杂业务负载下,产品兼顾计算效率、业务时延和 TCO,满足人工智能规模化应用对通用性、性能和成本的综合要求。 

天数智芯 AI 与加速计算负责人单天逸表示,人工智能正从理解与生成信息的 " 信息智能 ",迈向具备规划和执行能力的 " 行动智能 ",并进一步拓展至能够建模、预测和探索未知的 " 探索智能 "。三类智能对计算提出不同要求,也构成了天垓 300 的产品设计主线。

信息智能:突破关键瓶颈,提升大模型训推效率

随着模型参数规模扩大、上下文长度增长和推理请求增加,算力平台既要提升训练吞吐,也要兼顾推理响应和使用成本。针对大模型计算中的核心环节,天垓 300 重点优化了 Attention 与 MoE。 

在 Attention 计算中,天垓 300 通过提升矩阵计算与向量计算的并行效率,减少数据读写等待和冗余计算,在不同精度下实现超过 90% 的 Attention 效率,效能优于 Hopper 架构主流方案。在长序列任务中,产品能够更加充分地利用计算资源,提升训练与推理效率。在上下文 64k 的场景中,天垓 300 的 Attention 效能高于 Hopper 方案 10%。 

针对 MoE 架构中的专家调度和数据路由损耗,天垓 300 通过算法与硬件协同优化,提高专家与计算单元利用率。在 DeepSeek V4 MoE 场景中的计算效率突破 70%,综合训练效能和性价比优于 Hopper 方案;在推理场景中,可在保持相同响应体验的情况下承载更多并发请求,以相同算力投入完成更多推理任务,平均效能高于 Hopper 方案 10%。

行动智能:优化 PD 分离,提升 Agent 响应与执行效率 

Agent 不仅要理解目标和规划任务,还要持续调用工具并完成执行,对首字响应、生成速度和多卡通信提出了更高要求。为此,天垓 300 强化 PD 分离能力,分别针对上下文处理的 Prefill 阶段和逐 Token 生成的 Decode 阶段进行差异化优化,让 Agent 既能 " 想得快 ",也能 " 做得快 "。

在 Qwen、GLM、Kimi、DeepSeek 等主流模型测试中,天垓 300 首字延迟较 Hopper 架构主流方案降低约 20%。针对 Decode 阶段高频、多卡、小数据量通信,产品通过降低协议开销、优化链路路径和数据流转机制,使平均通信延迟降低约 13%。在 GLM 5.2 等模型的 Decode 测试中,效能较 Hopper 方案提升 10%,可为智能编程、办公助手和业务自动化等 Agent 应用提供更加及时、流畅的交互体验。在 PD 分离中 Prefill 和 Decode 的效能都能高于 Hopper 方案,实现全面突破。

探索智能:回归计算本质,支撑多元算法演进

在新材料发现、气象预测、数字孪生和世界模型等场景中,AI 需要参与复杂系统建模、实验验证和未来预测,计算范式也由相对集中的大模型负载,拓展至矩阵求解、动态规划、稀疏计算和仿真模拟等多类任务。

天垓 300 坚持 " 回归计算本质 ",不局限于 Transformer 架构,可高效支持标量、矢量和张量计算,覆盖 FP4、FP8 等多种精度及 MMA、DPX、FMA 等指令。除 Attention、FFN 和 MoE 外,还可适配矩阵求解、动态规划、稀疏计算和数字孪生等任务,为现有算法优化和未来计算范式演进预留空间,帮助客户通过虚拟仿真降低现实世界中的实验成本和试错风险。

在 Cosmos3 世界模型中,天垓 300 的推理效能相较 Hopper 方案同样高出 10%。

不止于芯片:以底层创新与全栈生态释放通用算力价值

支撑三类智能的,是天垓 300 在底层架构上的持续创新。ixSMEX 通过提高数据复用率减少重复访存;ixDPX 将动态规划中原本需要六条指令完成的计算压缩至一条;ixTrans 则通过无损矩阵转置,降低存储冲突和显存开销,进一步释放芯片计算效能。

天数智芯认为,通用 GPU 的长期价值不仅来自单颗芯片的性能,更在于构建一个通用、好用、易用的生态。公司自 2018 年起持续完善软件栈,目前已开发近百个加速库,并形成覆盖通信、编译、驱动、量化和性能分析的工具体系。天垓 300 同步支持全球主流大模型框架、模型及关键加速组件,可减少客户在迁移、适配和性能调优中的重复投入。

目前,天垓 300 已具备规模化应用条件,并与国内云厂商、服务器厂商、互联生态及超节点系统开展深度适配,可支持从单机到万卡集群的规模化部署。

天垓 300 并非一款孤立的芯片产品,其背后是一套由硬件、软件、系统与合作伙伴共同构成的生态。未来,天数智芯将与更多产业链伙伴共同完善通用 GPU 产品与生态,以高质量算力赋能智能社会,推动人工智能重塑千行百业。

免责声明:本文观点仅代表作者本人,供参考、交流,不构成任何建议。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

人工智能 ai 天数智芯 世界人工智能大会 芯片
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论