雷锋网 23小时前
Token在暴增,利润为何「困」在英伟达?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

大厂的 Token 仪表盘上,数字正在疯狂跳动。

当下,仅豆包一家大模型的日均 Token 调用量就已突破 180 万亿;国家数据局的统计显示,全国日均调用量在今年 3 月已超过 140 万亿——无论从哪个口径衡量,这都是一条两年内从 " 近乎为零 " 飙涨超千倍的曲线。

这是一组足以让任何一个行业眼红的数字。AI 编程、Agent 工作流、多模态内容生成……越来越多场景被卷入这条消耗曲线,Token 经济正在以前所未有的速度膨胀。

但最先兑现这场繁荣的,并非模型厂商和 AI 应用。

" 几乎所有人都在亏钱,而所有的利润都流向了英伟达——或者说,流向了上游硬件。" 共绩科技的联合创始人黄力昂用一句话,给这场繁荣泼了一盆冷水。

这个判断并不夸张。

就在这个季度,英伟达交出了一份让整条产业链相形见绌的财报:2027 财年第一季度(即 2026 年 2 月至 4 月),公司营收达 816 亿美元,同比增长 85%,GAAP 毛利率高达 74.9%;

而几乎同一时期,OpenAI 第一季度的经营亏损高达 93 亿美元——调整后营业利润率约为 -122%,相当于每收入 1 美元,就要倒贴约 1.22 美元。

于是,一个略显荒诞的对照浮现出来:一边是消耗量呈指数级攀升、被寄予 " 新增长极 " 厚望的 Token 经济,上游 GPU、HBM 厂商持续刷新利润纪录;另一边,从模型厂商、Token 工厂,到算力中心和 AI 应用,大多数企业仍在增长中承受亏损,甚至陷入 " 越卖越亏 " 的困境。

不过,这或许只是 AI 产业发展的一个阶段。

回看互联网和云计算的发展史,几乎每一轮技术浪潮的早期,利润都先被上游基础设施层截获——光缆、服务器、交换机厂商最先赚钱,而做网站和应用的还在摸索商业模式。

今天,利润停留在距离物理瓶颈最近的 GPU 和 HBM;但随着算力供需逐渐缓和、Token 持续向应用渗透,利润也将沿着产业链重新分配。

真正值得追问的是:Token 经济的红利何时才流向下游?欢迎添加微信 EATINGNTAE ,一起追踪 Token 产业链的后续变化。

为什么暴涨的是 Token,暴利的却是 HBM 和 GPU?

要理解 Token 经济的价值流向,一条铁律足以概括:离物理瓶颈越近,话语权越重。算力芯片与存储芯片,卡住的正是这条产业链最窄的咽喉。

英伟达 816 亿美元营收、74.9% 毛利率,只是这场盛宴的开胃菜。更值得关注的是存储芯片——这个曾被视作周期性配角、跟随 PC 和手机兴衰沉浮的行业,如今正以近乎粗暴的方式证明自己的 " 主角时刻 "。

美光科技 2026 财年第三季度(截至 5 月底)财报显示,公司营收 414.6 亿美元,同比暴增 346%;净利润 282.4 亿美元,毛利率一路攀升至 84.9% ——这个数字甚至超过了英伟达。

GPU 的缺货已经持续了足够久,市场早有预期;HBM 的供给紧张却是最近才真正爆发。需求在一夜之间爆发,供给却只能以季度为单位缓慢释放,价格自然被推到极致。

在迈富时 CFO 马进看来,这并不意外:" 硬件环节目前由于供需极度不平衡,利润率处于‘暴利’水平。"

但为什么 " 贵 " 所产生的超额利润,几乎没有溢出到产业链的其他环节?

九章云极的判断指向了这个问题的核心:"AI 工业化初期,上游重资产的算力与能源是刚性瓶颈,具备强议价权。"

HBM 的产能就掌握在三四家公司手里,GPU 的先进制程几乎只有台积电能做。没有替代品,扩产又慢——客户没有议价的筹码,只能接受。

换句话说,在这个阶段,谁掌握着不可替代、又扩产缓慢的物理产能,谁就握有定价权——这恰恰是芯片厂商,尤其是存储芯片厂商目前所处的位置。

问题是,这样的盈利水平能持续多久?

短期来看,迈富时 CFO 马进认为,硬件产能扩张周期长达两到三年,供给紧张不会快速缓解,未来一两年硬件仍将处于景气上行期。

这与存储巨头们自己的判断基本一致——美光、SK 海力士、三星的管理层在财报电话会上不约而同地表示,供应紧张至少持续到 2027 年甚至 2028 年。

但把时间拉长,马进认为,随着上游产能逐步释放,以及国产芯片的替代比例逐步提升,供给不足的问题终将被解决。

这意味着,这场 " 暴利 " 很可能只是一个阶段性产物,而非能够长期维系的常态。

如果说上游硬件的暴利是全球性现象,那么就眼下而言,国产芯片能否分享这场盛宴,是另一个问题——这个答案并不乐观。

云天励飞的副总裁罗忆的判断颇为直接:国产芯片大部分仅能覆盖 100 TPS/ 用户(单位用户每秒生成 Token 数)以下的场景,与英伟达 Rubin 等最新一代产品相比,差距依然明显,在真正商业闭环的场景下对性能有更极致的追求,国产芯片目前还难以形成有效替代。

同时,英伟达的代际节奏几乎是每年一代,国产芯片追赶的参照系本身就在高速移动。

比技术差距更现实的,是商业门槛。

" 任何芯片要真正投入使用,都必须先经过第三方认证、积累典型客户案例,再在市场上经受各种模型、算子算法库和高负载任务的检验。" 某国产芯片销售小明说," 企业在招标时都有业绩门槛。一个新品牌要在芯片行业站稳脚跟,过程非常漫长。"

芯片行业人士王闻则从产业格局上点出了另一层困境——在他看来,国内互联网大厂在生态构建上拥有先天优势,而独立芯片厂商 " 本质上还是只是挣一份硬件钱 ",既缺乏对上层业务的深刻理解,又要同时面对 MaaS 层和 Agent 层两套生态的建立难度," 一口气打穿两层,比互联网大厂难得多 "。

你怎么看独立芯片厂商的出路?欢迎添加微信 EATINGNTAE 分享你的判断。

性能代差、商业门槛、生态壁垒——三重约束叠加之下,国产芯片即便身处一个 " 暴利 " 的上游周期,能够切到的蛋糕仍然有限。

不过,IO 资本赵占祥也指出了一个关键的时间窗口。

在他看来,正是因为算力极度紧缺,客户才对各种新的计算芯片架构持开放态度," 谁来了我都让你试 " ——只要你能供货,客户就愿意给你机会。

这恰恰是国产芯片目前最大的机会:在英伟达供不应求、交付周期不断拉长的窗口期里,客户没有挑三拣四的余地。但如果算力不再短缺,供应商格局已经稳定,新架构再想进入市场就会难得多。

这也带出一个更值得追问的问题:如果说上游的暴利源自 " 供需失衡 " ——需求太猛、产能太慢,价格自然上天——那么同样面对 Token 需求的爆发式增长,为什么到了中游的模型厂商这里,故事就完全翻了个面?

为什么 Token 卖得越多,反而亏得越快?

上游硬件商靠 " 卖铁 " 坐收暴利,但对模型厂商而言,这张入场券的代价,是将上游的暴利全额计入自己的成本。这是一个结构性的困局:前者的定价权越强,后者的成本刚性就越难以消解。

OpenAI 的财报,正是这套逻辑最残酷的注脚。

这个 " 越卖越亏 " 的公式,在中游几乎是普遍现象。

不过也有企业正在摆脱烧钱的引力。2026 年第一季度,Anthropic 营收 48 亿美元;据披露,第二季度营收预计将环比翻倍至约 109 亿美元,增速达 130%。更引人关注的是,公司预计将在第二季度首次实现单季度运营盈利,运营利润约 5.59 亿美元——这在当下几乎全员烧钱的模型层里,称得上是一个异数。

但需要说明的是,即便如此,Anthropic 自己也判断,全年层面的盈利可能要等到 2028 年才能实现——单季度的盈利拐点,与 " 长期赚钱 " 之间,仍隔着一段距离。

中游最好的样本,眼下也只是刚刚摸到盈亏平衡线,远谈不上像上游硬件商那样 " 暴利 "。

海外巨头尚且如此,国内模型厂商的处境更不轻松。以智谱为例,2025 年全年营收 7.24 亿元,同比增长 131.9%,但年内净亏损高达 47.18 亿元。

九章云极提醒,模型厂商对极致性能的追求,本身就被捆绑着一笔绕不开的溢价:只要还在用英伟达的卡,上游的定价权就会持续以采购成本的方式,反噬中游本已稀薄的利润空间。

成本端已经失血,收入端同样不容乐观。

在迈富时 CFO 马进看来,模型层长期壁垒只会越来越低,未来全球能够存活的大模型公司会越来越少,市场终将向头部大厂集中——即便今天还能维持一定议价权的厂商,也很难逃开最终被卷入价格战的宿命。

英伟达的定价权,压向的不只是模型厂商。同一张 GPU,落在算力运营商和云厂商手里,同样意味着高昂的采购成本,而他们的解法是:与其把卡按小时租出去赚一笔微薄的差价,不如把算力 " 加工 " 成更高附加值的产品—— Token ——直接卖给需要它的模型厂商和应用开发者。

2025 年黄仁勋就将数据中心重新定义为 " 生产 Token 的工厂 ",试图把行业的注意力从 " 算力 " 转向 "Token 产出效率 "。

某大厂程序员小张一句话点破了这套叙事背后的商业驱动力:相比按小时出租裸金属 GPU,卖 Token 能让云厂商拿到更好的利润率。

行业测算显示,传统 " 裸金属 " 算力租赁毛利率大致在 20% 至 30% 区间,而专注 Token 运营的厂商,毛利率普遍能做到 40% 至 50%,海外的 Together AI、Fireworks AI 等公司也大致维持在 47% 左右,明显高于单纯出租算力的同行。

但这门 " 更好的生意 ",在实际操作中远没有听起来那么轻松。Token 工厂的运营都有哪些坑?欢迎添加微信 EATINGNTAE 交流。

Token 价格的持续下降,正在加速淘汰一批玩家。

共绩科技的联合创始人黄力昂观察到,没有模型优化能力的算力持有方,单位算力的收入随 Token 单价下跌而直接缩水,成本端却没有同步改善的空间,利润被双向挤压——这批玩家正在被逐步淘汰。

而具备优化能力的企业,则通过提升单位算力的 Token 产出量,用 " 量 " 的增长覆盖了 " 价 " 的下跌,反而在降价周期中实现了单位收益的提升。

换言之,在 Token 工厂这门生意里,拥有 GPU 只是入场券,真正的盈利能力取决于优化能力——能否把每一张卡的算力榨取到极限,直接决定了利润的厚薄。

九章云极将这种能力拆解为三个层次:一是全栈软硬协同优化,从芯片驱动到计费系统全局调度;二是动态精细化的资源切分,将 GPU 的算力、显存、带宽进行毫秒级切分与重组;三是规模化的稳定交付,支撑日均万亿级 Token 调用而不宕机。这三项能力,缺一不可。

这对大量缺乏调度和优化能力、只会 " 囤卡 " 的算力中心而言,并不是一个好消息。

而这种分化之所以会发生,根源其实比 " 技术差距 " 更深一层。国产芯片销售小明指出,在此之前,整个行业的主要精力并没有真正放在提升算力运营能力上,一个直观的信号是:那些 " 算力综合运营服务商 " 的榜单上,几乎找不到世界 500 强级别的企业,也鲜有国资巨头的影子," 这充分说明,行业目前还处在一个非常初级的起步阶段。"

中游远未走完它的洗牌期,模型厂商在成本与价格战的夹缝里失血,Token 工厂在效率竞赛中优胜劣汰,少数赢家正在浮出水面,但更多人还在亏损中等待拐点。

Token 最终会流向哪里,利润就会流向哪里?

Claude Code 年化营收突破 25 亿美元、国内企业级 MaaSToken 调用量超千万亿——下游应用层不断刷新的消耗数据,正在重新点燃市场对 AI 商业化前景的想象。

在这股热潮中,太初元碁的首席产品官洪源判断,AI 编程是目前 Token 消耗增长最快的方向。

事实正在印证这个判断,以 Claude Code 为代表的 AI 编程 Agent,已经把处理单个任务的 Token 消耗量,从 Chatbot 时代的几千个,直接推高到 8 万至 15 万个;自 2026 年 1 月以来,Claude Code 的周活跃用户也已实现翻倍。

AI 编程正在从一个 " 效率工具 ",蜕变为真正意义上的工业级 Token 消耗场景。

但消耗量的膨胀,并不会自动兑换成利润。Claude Code 这种消耗与营收齐飞的故事,在当下的 AI 应用层并不多见,更多场景还卡在 " 只烧钱不赚钱 " 的关口。

云天励飞副总裁罗忆提供了一把理解下游的钥匙:Token 本身只是基础设施,类似电力或燃料,客户真正需要的,并不是 Token,而是基于 Token 的应用。

他的判断相当干脆:当前行业的现状更像是 " 每个人都在手搓电器 ",而未来真正应该崛起的,是 " 用电器 " 的产业。

具身智能就处在最典型的 " 手搓电器 " 阶段——各家卯足劲造机器人,能走、能抓取、能简单决策,但高度定制、难以复用。也因此,它成了一个略显矛盾的场景:一边是巨大的 Token 消耗,机器人在物理世界中持续感知、规划、执行,每一个动作都伴随着 Token 的流动;另一边,这些消耗换来的仍然是原型和 Demo,离商业闭环还很远。

罗忆的判断是,这类应用仍处于烧钱阶段—— Token 需要先转化为可以规模化部署、稳定创造价值的智能硬件或行业软件,才能真正兑现商业价值。

换句话说,即便大量 Token 被消耗在具身智能的训练和推理中,只要 " 电器 " 本身还没有跑出来,这部分投入就仍然只是成本,而非利润。

而更关键的挑战在于,即便 " 电器 " 真的造出来了,商业闭环也并非天然成立——烧出了产品,不等于烧出了生意。AI 视频生成领域的一起一落,就是最直观的注脚。

2026 年 3 月 24 日,OpenAI 正式宣布关停仅上线半年的 AI 视频应用 Sora。据外媒披露,Sora 每天支出高达约 1500 万美元,年化约 54 亿美元,但 App 累计收入仅 140 万美元,用户留存率接近于零。

几乎在同一时间,字节跳动的 Seedance 给出了另一种解法——它把 AI 视频生成能力嵌入抖音、剪映、即梦等已有的超级流量体系,将高昂的算力成本,转化为带货短视频、短剧引流等 " 内生需求 ",形成了一个能够自我造血的闭环。

字节的做法,是 " 靠一己之力把整个生态盘活了 " ——补贴创作者生成内容,再通过矩阵分发、广告分成和商城导流完成变现,投入与产出都在同一个体系内闭环运转。

一个折戟、一个跑通,两者的差距其实并不在技术本身:Sora 不缺技术,缺的是一个愿意持续付费的场景;Seedance 赢的也不是模型,而是它一出生就嵌在了一个能自我造血的体系里。

至于利润能否向下游转移,罗忆给出了两条可能的路径:要么像字节这样,靠自己把闭环做完;要么像 AI 编程领域那样,整个行业慢慢形成共识,跑出一套可复制的模式,而不是被一家垄断。

在罗忆看来,应用层是价值的主要承载者,随着越来越多场景跑通商业模式,利润最终会向下游移动。" 毕竟,Token 本身不创造价值,只有被转化为具体的生产力或消费体验时,才算真正变现。"

路径有了,但下游凭什么接住利润?

马进的回答直指核心:如果一个应用能为客户创造 10 倍的回报,即便上游成本翻倍,它也能通过提价把压力传导出去。真正解决了核心痛点的应用,一定会拥有更强的定价权和利润保障。

不过,这种乐观还需要一个前提:应用得先真正落地。黄力昂认为,利润向下的转移不会自动发生,需要等到 Agent 应用越来越落地,才会逐步向下游释放。

把时间拉长来看,英伟达赚走绝大部分利润,更像是产业早期供需极度失衡的阶段性产物,而非最终格局。

过去两年,最稀缺的是 GPU 和 HBM,利润就停在那里。当算力不再是最稀缺的资源,利润自然会沿着产业链继续移动。下一阶段的赢家,未必是今天造芯片的人,而是能把 Token 真正变成商业价值的人。

这篇文章只是我们观察 Token 产业链的一个起点,如果你也在关注这个领域,欢迎加微信 EATINGNTAE ,一起追踪 Token 经济的下一程。

雷峰网 ( 公众号:雷峰网 ) 雷峰网

雷峰网原创文章,未经授权禁止转载。详情见转载须知

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

英伟达 ai 产业链 gpu 存储芯片
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论