
2026 年 5 月 31 日,英伟达(Nvidia)宣布一颗拥有 88 个定制核心的 CPU 已经进入全面量产。它叫 Vera,采用 Arm 指令集和英伟达自研的 Olympus 核心,既会进入 Vera Rubin 超级计算平台,也会被单独装进 CPU 服务器。戴尔、惠普、联想、超微以及多家服务器厂商,已经开始制造搭载 Vera 的系统。
英伟达把 Vera 称作 " 第一颗为 AI 智能体打造的 CPU"。Vera 会与 Rubin GPU 组成一套平台,也会被装进独立 CPU 服务器。时隔多年,卖 GPU 的英伟达,又开始单独卖 CPU 算力了,这件事听起来似乎并不寻常。

图丨 Nvdia Vera(来源:Nvdia)
过去三年,AI 产业的硬件焦虑几乎都围绕 GPU 展开。训练需要更多 GPU,推理需要更多 GPU,模型参数和用户数量增长后,答案仍然是增加 GPU。CPU 在这套系统里负责启动任务、搬运数据和管理服务器,很少成为投资者关心的主角。
直到 AI Agent 改变了任务的形态。
普通聊天机器人接收一段文字,运行一次模型,再生成一段文字。Agent 还要把模型的判断变成操作:读取文件、搜索网页、查询数据库、调用应用程序接口(API)、执行代码,再把结果送回模型。一次任务可能经历十几轮 " 推理—操作—观察 ",每一轮都要在 GPU 与 CPU 之间切换。
GPU 仍然负责最重的模型计算,而解析模型输出、判断工具类型、发起请求、运行程序、管理文件、收集结果和安排下一轮任务等工作,则通常由 CPU 处理。AMD 计算与企业 AI 副总裁 Madhu Rangarajan 称,在公司测试的一条真实智能体流水线中,8 个阶段有 7 个完全运行在 CPU 上。这个比例来自 AMD 自测,不一定代表所有系统,但也足以说明:模型推理只是智能体完成任务的一环,而在这一环之外的所有协调工作都压在 CPU 上。
单个 Agent 带来的开销可能还不算大,但在规模化以后这个数字就会相当恐怖。
一个智能体可以同时调用多个工具,也可以创建子智能体。企业把同一套系统部署给数万名员工后,并发任务可能迅速膨胀。每个智能体都在解析输出、执行代码和读写数据,原本零散的 CPU 开销开始积累成容量需求。CPU 处理得慢,GPU 就要等待下一轮推理所需的输入。
安全检查也在增加这部分负担。智能体拥有的权限越多,系统越需要检查它打开了什么文件、调用了哪个接口、是否触碰敏感数据。规则匹配、日志分析和小模型审核通常留在 CPU 上运行,因为任务分散、延迟敏感,单独调用 GPU 未必划算。于是,智能体越自主,需要检查的环节就越多,CPU 的负担就越重。
今年 7 月 OpenAI 的智能体在一次内部安全评估中意外突破沙箱、闯入 Hugging Face 生产系统的事件,足以说明这类安全机制的重要性,也说明了它们在实际部署中会带来多少额外的计算开销。
另一个容易被忽视的负担是分词。
大模型处理文本前,要先把文字转换成 Token。这个过程包含大量字符串处理和条件分支,不像矩阵运算那样适合 GPU。普通对话的输入很短,分词延迟通常没有存在感;智能体会不断积累工具返回结果、代码、日志和历史操作,输入可能增长到数万甚至数十万个 Token。
佐治亚理工学院博士生 Euijun Chung 在接受 IEEE Spectrum 采访时举例称,在一些实现中,已有 10 万个 Token 的上下文再加入 1,000 个 Token 的工具结果,分词器仍可能重新处理整段输入。前缀缓存和增量分词可以减少重复工作,所以这并非所有系统必然采用的方式;长文本带来的 CPU 压力仍然存在。
Chung 团队在最新论文中测试了 Llama 3.1 和 Qwen3 等模型。在长序列、大批量配置下,分词最高占到首个 Token 延迟的约 80%。当 CPU 核心数不足,分词线程还会与任务调度和 GPU 内核启动争抢资源,导致 CPU 满载、而 GPU 未能跑满。增加 CPU 核心后,不同配置的首个 Token 延迟改善了 1.47 — 5.15 倍,而无需增加 GPU。
产业数据已经开始回应这一变化。2026 年 1 月,KeyBanc 根据供应链调查判断,Intel 全年大部分服务器 CPU 产能已经售出,AMD 的服务器 CPU 供应也接近满载,两家公司因此拥有了提价空间。这是分析机构的渠道判断,并非厂商披露的订单数据。
Intel 随后的财务文件给出了部分印证。公司称,服务器 CPU 需求在 2026 年第一季度超过可供应数量,内部产能限制预计持续至年底。服务器产品平均售价同比提高 27%,出货量却下降了 5%;Intel 将价格上涨归因于高端产品占比提升、需求定价和成本增加。
AMD 同期的数据中心业务收入达到 58 亿美元,同比增长 57%,增长同时来自 EPYC 服务器 CPU 和 Instinct GPU。AMD 没有单独披露服务器 CPU 收入增速,因此无法把这 57% 全部归因于智能体需求。
公司对未来的判断更加激进。AMD 此前预计服务器 CPU 市场年增长约 18%;2026 年 5 月又将预期提高到 35% 以上,预计市场规模到 2030 年超过 1,200 亿美元。AMD 给出的理由是,智能体需要独立的 CPU 计算层来承担编排、数据处理、工具执行和安全检查。
数据中心过去常用一颗 CPU 管理 4 — 8 颗 GPU。AMD 观察到,智能体系统正把这一比例推向 1 ∶ 1,部分负载使用的 CPU 甚至更多。这仍是供应商根据客户需求作出的判断,工作负载不同,实际配置会有很大差异。比例变化的方向却很清楚:多配几颗 CPU 已经不够,云厂商开始考虑为智能体单独建设 CPU 机架。
Arm 也在 2026 年 3 月第一次从出售处理器设计方案走向直接出售数据中心 CPU。其 AGI 处理器最多拥有 136 个核心,由 Meta 参与开发。Arm 预计,同等功耗下,智能体数据中心需要的 CPU 容量可能达到现有数据中心的 4 倍以上。
高通随后发布拥有超过 250 个核心的 Dragonfly C1000,并与 Meta 签署多代服务器 CPU 合作协议。Intel、AMD、Arm、高通和 英伟达在几个月内把 " 智能体 CPU" 写进各自的产品路线,说明这轮竞争已经越过传统的 x86 市场,扩展到 Arm 服务器、自研核心和整机架设计。
英伟达在其中占据了一个特殊位置。它既销售造成 CPU 压力的 GPU,也销售缓解压力的 Vera;从处理器、网络到存储,整套设备都可以由 英伟达提供。Vera 因而不只是一次产品线扩张,它还要保护 GPU 的利用率。GPU 每减少一秒等待,都可能转化成更多 Token 和更高的机架收入。
不过,芯片厂商跟着钱走的时候,总有人要承担代价。和 GPU、存储芯片一样,这次产能的变化很可能又是由我们消费者来买单。
Intel 在 2025 年第四季度财报电话会上承认,公司正在尽量把内部晶圆供应转向数据中心,同时增加客户端产品的外部代工;管理层随后补充说,Intel 也不能完全退出客户端市场。到了 2026 年第一季度,Intel 客户端 CPU 的平均售价同比上涨 16%,销量下降 13%,公司预计供应限制至少持续至上半年。
客户端产品的变化不能全部算在智能体头上。Intel 自身的制程切换、内外部产能和内存供应同样影响了价格与出货。但在有限产能中,服务器芯片核心更多、售价更高,云厂商又愿意签订长期订单,生产资源自然也就开始向数据中心倾斜。
过去三年,普通消费者已经见识了 GPU 涨价和断货的滋味。接下来,同样的事可能发生在 CPU 上。
参考资料:
1.https://spectrum.ieee.org/ai-cpu-comeback
2.https://www.amd.com/en/blogs/2026/agentic-ai-changes-the-cpu-gpu-equation.html
3.https://arxiv.org/html/2603.22774v2
运营 / 排版:何晨龙
注:封面 / 首图由 AI 辅助生成


登录后才可以发布评论哦
打开小程序可以发布评论哦