DoNews 前天
对话中昊芯英CEO,一家芯片公司的独行之路
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

撰文 | 雁   秋

编辑 | 李信马

题图 | 中昊芯英

在 WAIC 2026 期间,中昊芯英落地了两件事:

一件,是第二代自研 TPU 架构 AI 芯片 " 须臾 " 首秀,其 896TFLOPS 的混合精度算力相较传统芯片降低 50% 的功耗。

另一件,由中昊芯英和杭州电信、中兴通讯联合打造的华东地区(杭州)首个国产 TPU 千卡智算集群落地,有媒体称这 " 标志着国产算力从实验室走向大规模商用 "。

华东地区(杭州)首个国产 TPU 千卡智算集群现场

中昊芯英专注做国产 TPU 芯片,是国内掌握高性能 TPU 架构 AI 专用算力芯片核心技术的公司之一。旗下产品从 " 刹那 " 到 " 须臾 ",用八年进化轨迹揭示了中国 AI 算力产业在通用 GPU 之外的另一条可能路径。

相较初代 TPU AI 芯片," 须臾 " 性能有着怎样提升?国产化率达到多少?在 Token 经济下,公司会在何时实现投入与回报的真正平衡?WAIC 期间,DoNews 与中昊芯英创始人、CEO 杨龚轶凡以及中兴通讯、中国电信相关负责人进行了对谈。

01.

年,死磕 TPU

提起芯片,大多数人想到的是 GPU,它诞生于 1990 年代,开始是为了游戏而做的,其核心任务是将三维物体在二维屏幕上快速显示。这也决定了它的架构:单卡独立运行、少量芯片互联完成图形任务。在 AI 时代,人们发现 GPU 算力强,就用来做 AI。

TPU 则不同。中昊芯英 2018 年成立之初,就做了一个在当时看起来很 " 非主流 " 的判断:基于 Attention 机制的 Transformer 架构大模型,一定会成为未来 AGI 的核心技术载体。所以他们从一开始就把芯片架构定在 " 大规模深度学习、海量神经网络分布式并行运算 " 这个专属场景上。

中昊芯英创始人、CEO 杨龚轶凡在媒体采访中回溯了这一逻辑,他认为,英伟达、AMD 深耕 GPU 架构近三十年,旁人几乎没有弯道超车的可能。而 TPU 芯片本身就是为了深度学习,或者大规模深度学习的模型设计,无论是硬件栈还是软件栈,都比 GPU 更适合当前的 AI 发展。

架构之间的差异会演变成不同的结果。

TPU 可以塞进去的脉动阵列比 GPU 多得多,算力密度天然更高;GPU 为了照顾图形渲染,得留一堆通用控制单元,但 TPU 不需要,可以把这些资源全部释放给计算、通信和存储搬运。功耗优势也很明显,同样的模型计算能力下,TPU 的功耗可以做到对标 GPU 产品的 70% 左右,而且这个优势在集群规模扩大时会被指数级放大。

杭州电信智算及 IDC 中心总经理王良在运营实践中验证了这个判断:"TPU 擅长做张量运算,推理能力是它的长处之一。"   此外,广义的 GPU 正在往泛化异构方向发展,谷歌 TPU 的持续迭代和价格竞争力已经证明了专用架构的商业价值。

八年前,中昊芯英选择 TPU 这条路时,没多少人理解。但八年后,全球算力市场 GPU 份额已经下滑到 50% 左右,TPU 架构占了另外半壁江山。

02.

国产化率有几成?

中昊芯英在 2023 年成功流片了国内首枚高性能 TPU AI 专用算力芯片 " 刹那 ",并实现量产和产业化。三年后,中昊芯英基于 " 刹那 " 规模化落地的实践经验,推出了新一代 TPU AI 芯片 " 须臾 "。相较第一代," 须臾 " 的性能提升了 3 倍,且芯片整体功耗没有出现明显上涨。

不过,一般提到 " 国产 " 都会逃不开一个追问:到底有多少是自己的?

杨龚轶凡在回答 DoNews 的提问时,给出了几个明确的数字:" 中昊芯英从算子层面来说国产化率是 100%,没有购买任何数字 IP,所有核心 IP 都是自己开发的,指令集、计算平台也全部 100% 自研。"

所谓指令集,可以看作是芯片的 " 语言 "。如果指令集依赖外部授权,不仅每一代产品都要支付高昂授权费,更关键的是永远无法真正掌握芯片的演进方向。从中昊芯英的自研程度看,其从芯片底层数据链路到上层软件栈,不存在对外部第三方 IP 或闭源组件的依赖。当然,硬件自主只是个开始,国产芯片从 " 可用 " 到 " 好用 ",软件栈是最大的坎。" 要看使用者生态、自身的灵活性以及芯片的性能,是否能够得到最大化的输出。" 杨龚轶凡判断,行业至少还需要两到三年时间才能让软件栈真正成熟。

当前,几乎所有主流国产大模型都能在中昊芯英的 TPU 上运行。以智谱、DeepSeek 等头部模型为例,中昊芯英可以在新模型发布当天就实现快速适配跑通。在基础适配跑通后,为把性能优化到极致,中昊芯还会用两周至一个月的时间进行专项调优工作,把芯片算力利用率、模型吞吐性价比打磨至最优水平。

为此,中昊芯英采用了务实的打法——以 "Token Factory" 模式对外提供标准化 API 服务,客户只需要调用 API 完成模型部署。" 客户并不关心算力运行在什么框架,关心的是百万 Token 的成本和实现时间。"

这种方式让芯片在软件栈尚未完全成熟时即可实现商业化落地,同时在真实业务场景中持续收集反馈、迭代软件栈。 

03.

限制 Token 才是价值的显现

架构决定芯片的天花板,国产化是企业底线。但影响这盘棋局的大小,是 2026 年突然踩下油门的 Token 经济。

Agent 的规模化落地让算力需求特征发生根本性转变:输入 Token 规模远超输出 Token,两者差距最高能到一万倍。

这给算力基础设施提出了新要求:PD 分离,即 Prefill-Decode 分离调度。简单理解,就是把模型处理输入内容的 Prefill 阶段和 Token 输出内容的 Decode 阶段拆开调度,分别交给最擅长的硬件去跑。

在这个场景下,TPU 的架构优势又被放大了。通用 GPU 要兼顾全场景,而 TPU 底层架构原生支持 PD 分离调度,落地门槛更低、调度效率更高。

需要注意的是,Token 经济爆发也带来了新的困境。在过往文章《企业想用 AI 赚钱,得先挺过 " 奇点 " 前夜》中我们曾提到某高管提出的 Token 经济三大定律,其中的奇点定律直指产业背后的商业逻辑:奇点之前,成本曲线与价值曲线之间存在落差——虽然单 Token 价格在持续走低,但由于企业用量暴增,总体算力投入反而在扩大,企业陷入 " 越用越便宜、越用花越多 " 的困境。

用得太顺手,依赖性太强,大家开始反思两个问题:第一,投入量和产出是否成正比?第二,这些 Token 到底有没有被很好地使用?

" 很多人用 Token 做原本不需要 Token 解决的事情,或者就是用来‘玩’,没有应用在真实生产环境里,造成了大量浪费。" 杨龚轶凡坦言,公司内部甚至开始主动限制 Token 使用,因为消耗量已经远超合理预期。

个体效率与组织效率的 " 时差 ",恰恰是 Token 经济当前最微妙的阶段。杨龚轶凡观察到,当企业开始主动限制 Token 时,恰恰说明一线员工已经从心底认可了大模型的价值。

" 单个研发人员的效率可能提升了 5 到 10 倍,但这并不代表公司的整体效率或盈利能力得到同步提升。对任何组织来说,中间永远存在一个滞后过程。" 这个 " 滞后 " 正是当前 Token 经济悖论的症结所在,只有当公司运作方式能够适应大模型的发展节奏,当大部分工作都能由模型协同完成,才是真正的拐点。

当大家都在主动 " 限流 " 时,意味着供需双方已经完成了价值认可的第一步。接下来的核心命题就是让组织效率匹配个体效率的提升,一旦这个匹配完成,Token 经济才可以从不计成本转向精打细算,在奇点处完成交汇。

写在最后

" 须臾 " 可以说是国产算力长河中的一个锚点,中昊芯英用 100% 自研指令集和规模化集群验证了一个道理,在 AI 时代,追赶并非唯一选择,架构创新才会有超车的机会。

往期推荐

每 10 天就诞生一家具身智能独角兽,为什么你的机器人还没到货?

WAIC 2026,腾讯云在企业级 AI 上又做了这些升级

当数字人有了 " 活人感 ":百度一镜的 WAIC 时刻

  END

扫码关注

「创新无边界」是我们的 slogan,我们不局限于对互联网行业的追踪与探索,更要向未来、向未知的方向大胆迈进。因此,「打造行业新标杆、解读商业新动向」是我们秉持的方向之一。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

中兴通讯 ai 芯片 杭州 核心技术
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论