★ 设为星标 | 只讲人话,带你玩转 AIGC。
昨天,OpenAI 公布了 Jalape ñ o 的首批性能测试结果。
这是 OpenAI 的第一颗定制推理芯片,由 OpenAI 负责核心架构设计,Broadcom 参与芯片实现和网络连接,Celestica 负责电路板、机架和系统整合。
OpenAI 计划在 2026 年年底前开始部署 Jalape ñ o。Gen 2 已经进入深度开发阶段,Gen 3 也开始成形。
这不是一块用来秀肌肉的样品,而是 OpenAI 准备长期投入的一条芯片产品线。

图:Jalape ñ o 芯片
跟 Nvidia 正面对打
这次 OpenAI 使用 SemiAnalysis 的公共 InferenceX 基准,测试了 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个开放权重模型。
其中,GPT-OSS 对比 Nvidia GB200,DeepSeek 和 Kimi 对比 GB300。测试采用固定的 8K 输入、1K 输出和 STP 模式,衡量完整请求的吞吐量、功耗和延迟。
综合三个模型,Jalape ñ o 在峰值吞吐状态下,每瓦能够完成的 AI 工作量达到 Nvidia 对比系统的 1.5 至 1.9 倍,端到端延迟优势达到 1.7 至 3.6 倍。

图:Jalape ñ o delivers more throughput per kilowatt
在强调即时响应的高交互任务中,性能优势进一步扩大到 2.1 至 4.1 倍。
更关键的是,Jalape ñ o 在整个测试区间都处于帕累托前沿 ( pareto frontier ) 。
这个词听着挺学术,理解起来很简单:在相同延迟下,它能提供更高吞吐量;在相同吞吐量下,它又能提供更低延迟。竞争对手很难在不牺牲一项指标的情况下超过它。
既想马儿跑得快,又想马儿吃得少。
以前只能选一个,现在 OpenAI 说它两个都要。
最夸张的数据出现在 DeepSeek R1 上。
GB300 此前能够达到的最佳 Token 间时间为 5.90 毫秒,相当于每个用户每秒获得约 169 个 Token。
把 Jalape ñ o 限制在相同输出速度下,它每千瓦可以处理 12,258 个混合 Token,而 GB300 只有 118 个。
差距达到 104.3 倍。

图:Mixed-token throughput matched at the existing accelerator ’ s fastest decoding speed
这个数字是真的,但不能理解成 Jalape ñ o 的整体性能是 GB300 的一百多倍。
它反映的是一个特定场景:当双方都必须维持 169.41 token/s/user 的高交互速度时,Jalape ñ o 还能同时服务大量请求,GB300 的总体吞吐量却已经降得很低。
就像两家餐厅都承诺一分钟上一道菜。GB300 为了兑现承诺,只敢接一桌;Jalape ñ o 保持同样速度,还能同时接很多桌。
如果比较双方各自的峰值单位功耗吞吐量,Jalape ñ o 在 DeepSeek R1 上的优势约为 1.7 倍。这个数字没有 104.3 倍那么炸裂,却更适合判断两套系统的整体能效差距。

图:DeepSeek R1 "Peak and matched throughput" 对比图
另外两个模型也呈现出相同趋势。
Jalape ñ o 运行 GPT-OSS 时,峰值单位功耗性能约为 GB200 的 1.9 倍;运行 Kimi K2.5 时,约为 GB300 的 1.5 倍。在匹配 Nvidia 此前最佳交互速度的条件下,两者的单位功耗吞吐量优势分别扩大到 53.7 倍和 56.1 倍。
Jalape ñ o 的额定功耗为 700 W,测试任务中的持续实测功耗没有超过 550 W。
作为对比,GB200 和 GB300 的公开封装额定功耗分别为 1,200 W 和 1,400 W。
不过,550 W 是 Jalape ñ o 在特定任务中的实测值,1,200 W 和 1,400 W 是 Nvidia 芯片的额定功耗,两边不是完全相同的测量口径。
OpenAI 正式计算单位功耗成绩时,使用的是各款芯片的公开额定功耗进行统一换算。
即便把宣传滤镜摘掉,Jalape ñ o 的表现依然很猛。
它把计算、内存、网络、软件和机架放在一起设计,尽量将模型状态和 KV Cache 保留在本地,减少数据在核心与芯片之间来回搬运。
Nvidia 的 GPU 需要兼顾训练、推理、科学计算和图形处理,优势是通用、成熟、生态庞大。Jalape ñ o 则是一台专门为大模型推理改装的赛车。
赛车不一定能去野外,但在赛道上,它连后排座椅都嫌重。
AI 开始设计自己的芯片
Jalape ñ o 另一个有意思的地方,是 AI 直接参与了芯片开发。
OpenAI 只用了 9 个月,就把它从初始设计推进到流片。AI 帮助工程师探索实现方案、缩短设计和验证周期,还参与优化了芯片里的算术电路。
OpenAI 不只用 AI 设计芯片,还故意把芯片设计成容易被 AI 编程的样子。
工程师描述数据放在哪里、不同部分怎样通信、任务什么时候同步,Codex 和 GPT-Astra 再继续优化任务的映射、放置和调度。
三个原本不在生产计划里的开放权重模型,只用了 2 个月就被适配到较高性能。在 GPT-OSS 的部分注意力和混合专家模块上,AI 生成的实现比人类专家编写的版本快 1.5 至 1.8 倍。
注意,这只是选定模块,不是整个模型快了 1.8 倍。
OpenAI 想做一条龙
Jalape ñ o 真正重要的地方,不是某一个跑分超过了 Nvidia。
OpenAI 正在把模型、产品、API、推理软件、芯片、内存、网络和数据中心连接起来。
模型在真实场景里遇到的问题,可以直接反馈给芯片团队;芯片获得的新能力,模型和软件又能马上针对它优化。
苹果曾经用类似的方法,把芯片、操作系统和硬件产品绑在一起,做出了很难被单点复制的体验。
OpenAI 现在想把这套逻辑搬到 AI 上:
AI 帮助设计芯片,芯片负责运行 AI,AI 再继续优化芯片上的程序。
这个循环一旦跑起来,真正可怕的可能不是第一代 Jalape ñ o 有多快,而是 Gen 2 和 Gen 3 会以什么速度进化。
真正的竞争开始了
现在就说 Nvidia 要凉,肯定太早。
这些数据由 OpenAI 使用公共基准测试并自行公布,还没有经过大规模生产环境的长期验证。芯片的制造成本、良率、整机成本和真实部署规模也没有公开。
OpenAI 自己也明确表示,未来仍会广泛部署 Nvidia 和其他合作伙伴的加速器,用于训练和推理。
原因很现实。
OpenAI 缺的不是某一种芯片,而是所有能够买到的算力。自家厨房刚开始试营业,没必要当场注销外卖账号。
但 OpenAI 和 Nvidia 之间的关系已经变了。
过去,OpenAI 主要是 Nvidia 的大客户。模型越大、使用量越高,就得购买更多 GPU。
现在,它开始有能力把规模最大、使用最频繁、最消耗运营成本的推理任务,逐步迁移到自己的芯片上。
Nvidia 的优势依然巨大,但它最大的客户正在学习自己造一部分铲子。
Jalape ñ o 还没有掀翻桌子。
它只是第一次把手伸进 Nvidia 的饭碗,而且已经夹走了一块不小的肉。
当模型公司开始掌握芯片,芯片公司也在向云服务和模型扩张,未来真正的竞争可能不再是哪一块芯片跑得更快。
而是谁能把模型、软件、芯片、网络和数据中心,组成一台效率最高的完整机器。
到那时,OpenAI 究竟还是 Nvidia 的客户,还是已经成了它最危险的竞争对手?
资料来源:https://openai.com/index/jalapeno-first-results/


登录后才可以发布评论哦
打开小程序可以发布评论哦