热点科技 昨天
WAIC 2026现场,天数智芯发布天垓300,国产GPU开始比拼实际效率
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

今年逛 WAIC,有一个变化挺明显。聊算力的人依然很多,但大家讨论的重点已经和前两年不太一样了。过去更多是在比芯片参数、比峰值算力,今年不少厂商都开始强调模型真正跑起来之后的效率,比如训练速度、推理响应、多卡通信,以及软件生态和整体部署成本。

天数智芯这次发布天垓 300,关注点也放在了这里。相比单纯提升算力指标,它更强调 Attention、MoE、Agent 推理等真实应用场景的优化,希望把底层算力更高效地转化为实际业务能力。

天数智芯 AI 与加速计算负责人单天逸将 AI 的发展划分为三个阶段:处理和生成内容的 " 信息智能 "、能够规划并执行任务的 " 行动智能 ",以及面向科学发现和未知探索的 " 探索智能 "。在他看来,不同阶段对应着不同的计算需求,这也成为天垓 300 此次产品设计的核心思路。

针对目前应用最广泛的大模型场景,天垓 300 重点优化了 Attention 和 MoE 两项核心计算负载。大模型参数越做越大,上下文窗口越拉越长,Attention 运算已经成为整个训练和推理流程中最吃性能的环节。天数智芯公布的数据显示,天垓 300 在不同精度下的 Attention 计算效率都超过了 90%;在 64K 长上下文的测试场景里,整体效能比 Hopper 架构的主流方案高出大约 10%。

MoE(混合专家模型)同样是当前主流大模型的重要方向。为了减少专家调度和数据路由带来的性能损耗,天垓 300 针对算法和硬件进行了协同优化。官方数据显示,在 DeepSeek V4 MoE 场景下,产品计算效率超过了 70%,推理阶段也能够在保持响应体验的同时支持更多并发请求。

除了训练,大模型推理也是此次升级的重点。尤其是 Agent 兴起之后,模型不仅需要理解用户需求,还要不断调用工具、规划流程并完成执行,这也对首字响应速度、多卡通信以及整体时延提出了更高要求。

针对这一变化,天垓 300 分别对 Prefill 和 Decode 两个阶段也进行了优化。按照官方公布的数据,在 Qwen、GLM、Kimi、DeepSeek 等主流模型测试中,产品首字延迟相比 Hopper 方案降低约 20%;针对 Decode 阶段频繁的小数据通信,平均通信延迟降低约 13%。这些优化最终对应的是智能编程、办公助手、企业自动化等 Agent 应用更快的响应体验。

除了生成式 AI,天数智芯此次也把重点放到了未来可能快速增长的探索智能领域,包括世界模型、新材料研发、数字孪生、气象预测等科学计算场景。

不同于只针对 Transformer 进行优化的设计思路,天垓 300 采用 SIMT 通用计算架构,可支持标量、矢量和张量等多种计算类型,同时覆盖 FP4、FP8 等多种计算精度,并支持矩阵求解、动态规划、稀疏计算等不同计算任务。官方介绍,在 Cosmos3 世界模型测试中,天垓 300 推理效能同样较 Hopper 架构主流方案提升约 10%。

据天数智芯介绍,公司自 2018 年以来一直在完善软件生态,目前已开发近百个加速库,并支持主流 AI 框架、模型及关键加速组件。天垓 300 也已经与国内云厂商、服务器厂商等展开适配,可支持从单机到万卡集群部署,进一步降低企业部署和迁移成本。天数智芯此次带来的天垓 300,并没有只围绕某一项性能指标做优化,而是把重点放在大模型训练、Agent 推理以及科学计算等不同应用场景。从现场介绍来看,这款产品希望覆盖的不只是当下的大模型应用,也希望为未来更多 AI 计算需求做好准备。

在热点科技看来,今年 WAIC 释放出一个比较明显的信号:国产 GPU 的竞争重点正在发生变化。过去行业更多讨论芯片参数和峰值性能,而随着大模型、Agent 不断进入实际应用,企业开始更加关注训练效率、推理体验、软件生态以及整体部署成本。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

天数智芯 ai 数字孪生 芯片 kimi
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论