驱动之家 7小时前
黄仁勋刚说完TPU不敢跑分!谷歌甩出实测数据:性能领先B200达50%
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 11 日消息,据 SemiAnalysis 发布的最新报告,谷歌第七代 TPU Ironwood 每美元推理性能最高领先英伟达 B200 达 50%,对 B300 领先 96%。

今年 4 月,黄仁勋在播客中公开质疑 TPU 不敢参加公开跑分,称 "TPU 不来,Trainium 不来 "。五个月后,谷歌带着实测数据如约而至。

测试采用 Qwen3.5 397B FP8 模型,FP8 对 FP8 公平对比,输入 8000 token、输出 1000 token。在每秒 100 token 单用户吞吐基准下,TPU 每百万 token 成本仅 0.181 美元。

B200 每百万 token 成本 0.222 美元,B300 高达 0.276 美元。TPU 分别便宜 19% 和 34%。若将中位响应时间限制在 20 秒,TPU 成本降至 0.098 美元。

TPU 的成本优势并非来自峰值算力。实测中 TPU 物理吞吐仅领先约 5%,但每小时租赁成本远低于 GPU,叠加价格差后放大为 50% 的每美元性能领先。

价格优势只是第一层冲击,更令英伟达忌惮的是软件生态的松动。谷歌推出 TorchTPU,利用 PyTorch 的 PrivateUse1 后端接口,让 TPU 直接成为原生 Torch 运算设备。

开发者只需将一行代码 device = torch.device ( 'cuda' ) 改为 device = tpu.get_device ( ) ,无需重写训练循环或修改模型架构,即可在 TPU 上运行。

此外,Ironwood 单芯片配备 192GB HBM,是上代 Trillium 的 6 倍,可容纳更大 KV Cache。矩阵单元采用 256 × 256 脉动阵列,原生支持 FP8 运算。

硬件实力的提升,也让谷歌在销售策略上更加主动。谷歌自去年起开放 TPU 直接销售,不再只依赖云端租赁。据悉,Anthropic 已采购超 100 万颗 TPU,到 2029 年将超越 DeepMind 成为全球最大 TPU 单一用户。

TorchTPU 预计 10 月 PyTorch 大会期间开源,届时 TPU 对开发者的迁移门槛将降至一行代码。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

谷歌 黄仁勋 英伟达 脉动 物理
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论