8 月 25 号,OpenAI 公布了首款自己研发的芯片 Jalape ñ o 的性能测试数据,这个和博通一起开发的推理专用 ASIC,在能效和延迟这两个关键指标方面,比英伟达 GB300 要好上不少!

先看配置。Jalape ñ o 是纯推理芯片,不做训练,从设计之初就围绕大模型推理负载优化,砍掉了通用 GPU 所有图形计算冗余。
台积电 3nm 工艺,搭配定制 Arm CPU 和博通 Tomahawk 交换芯片,配 HBM4 高带宽内存。标称 TDP 只有 700W —— GB300 是 1400W,下一代 Rubin 平台 1800W 起步。
最夸张的是开发周期,行业常规是 18 到 36 个月,但这款芯片从设计启动到流片就用了 9 个月!为什么能那么快?因为芯片开发全程大量采用了 AI 辅助设计。

OpenAI 官方公布的推理性能数据:GPT-OSS 120B 模型下,每瓦混合吞吐量比 GB200 高出 1.9 倍,端到端推理延迟低约 1.7 倍;在 DeepSeek R1 670B 这种大参数模型上,700W 的 Jalape ñ o 也稳压 1400W 的 GB300。
第三方半导体机构 SemiAnalysis 测出来的数据是,单卡推理的时候,吞吐量差不多是 1459 tokens/s,GB200 才 535 tokens/s,差不多有 2.7 倍的优势,端到端任务延迟,Jalape ñ o 就只要 1.65 秒,GB300 得接近 6 秒,差距有 3.6 倍。

还有一个细节,Jalape ñ o 不只是适配 GPT 系列,各种开源大模型都能流畅运行,甚至还能移植运行经典游戏《Doom》,这就说明它的架构有一定通用性。
OpenAI 为什么要自己做芯片?答案就一个词:成本。推理占 AI 全生命周期算力负载的 80% 到 90%,是最大的算力市场。Jalape ñ o 的核心目标是把大模型推理的总体拥有成本降约 50%,摆脱对通用 GPU 的依赖。

一颗 700W 的芯片干 1400W 的活,电费省一半,对 OpenAI 这种按 token 计费跑推理的巨头来说,省下来的钱是天文数字。
短期来看,Jalape ñ o 今年年底才规模化部署,而且只自用不对外卖,不会抢英伟达的第三方客户。但现在谷歌、Meta、亚马逊都在推自研推理 ASIC,这也足够让英伟达有些头疼了。


登录后才可以发布评论哦
打开小程序可以发布评论哦