
2026 年以来,中国模型 API 调用量正以前所未有的速度攀升。截至今年 6 月,豆包大模型日均 Token 调用量突破 180 万亿,过去一年增长超过了 10 倍。
量在涨,价也在涨。据摩根士丹利统计,第二季度中国模型输出的 API 均价已经上涨至每百万 Token 21.9 元,同比涨幅超过 60%。
量价齐升,按常理所有 Token 厂商都应该能赚钱,但事实并非如此。
当前 Token 市场一共有三类玩家,但各自的毛利率走向截然不同。据爱分析统计,只有云大厂处于高毛利区间,模型厂商和独立厂商都在亏损或者盈亏平衡边缘挣扎。

图 1:三类 Token 厂商的毛利率分布
爱分析认为,Token 厂商能不能挣钱,不是由技术决定的,而是由五个变量决定的。在由这五个变量构建的利润公式中,谁能建立结构性优势,谁就能挣到钱。

图 2:Token 利润公式
简单解释下以上公式。Token 的利润,首先取决于 Token 加权单价,也就是输入、输出和缓存价格加权在一起的 Token 单价;二是 GPU 利用率,指 GPU 卡有多少时间处于空闲状态;三是 Token 吞吐量,指每月能跑多少个 Token。
这三个变量相乘,是 Token 收入。然后减掉两项成本,一项是 GPU 服务器的月租,另一项是模型的授权费用,开源模型已经开始针对大型 Token 服务商收费。
用这个利润公式,可以清晰看懂三类玩家的命运。
云大厂在这五项变量上,几乎全占优势:自研模型自主定价且无需支付授权费,通过长期协议锁定低成本的 GPU 月租价格,专职推理优化团队改善 Token 吞吐量。云大厂最大的优势就是 GPU 利用率,通过对内、对外同时提供 Token 服务,GPU 利用率常年维持高位。
相比之下,模型厂商的优势仅在定价权和模型抽成上,另外两项变量 GPU 利用率和服务器月租,均不占据优势,导致的结果是,毛利率区间相比云大厂大幅下滑。
比较惨的是独立厂商,这五项变量中,没有一项具备独立定价权,全部暴露于市场价格,没有任何竞争优势,这导致了必然的结构性亏损。
01
云大厂的壁垒不是技术,是 GPU 永远不会闲下来
云大厂 Token 业务的高毛利,虽然有点遮遮掩掩,不愿意过多表达,但很明显,云大厂是 Token 市场中唯一处于舒适区的玩家。
先看阿里。在财报电话会上,阿里明确提出 Token 业务毛利高,而且随着 Token 价格未来 1-2 年持续提升,毛利率还会继续上升。
高毛利背后的原因,吴泳铭讲得很直白," 我们的服务器内几乎没有一张卡是空的。" 云大厂的 GPU 不光接外面的 Token 订单,自家也有搜索、广告、推荐、办公等一大串业务排队等着用卡。任何一张卡刚闲下来,下一个内部任务立刻把它接走。所以阿里、火山这些云大厂,GPU 利用率轻松超过 85%。
再看火山。火山引擎虽然否认了 Seedance 毛利率达到 70%,但这一举动显然是此地无银三百两,业内普遍认为其毛利率至少超过 50%。
火山引擎 Token 业务的高毛利,常被市场归因为 GPU 服务器成本控制做得好。但从爱分析观察来看,并不是这么回事,火山引擎向润泽科技长租 GPU,而润泽算力租赁业务毛利率为 53%,说明火山付的租金并没有显著低于市场价格。
综上阿里、火山两家来看,云大厂高毛利的根源不在采购端,而在 GPU 利用率端。相比之下,模型厂商和独立厂商需要从市场上一单一单获客来填 GPU,其 GPU 利用率存在明显的天花板,很难超过 70%,存在大量闲置时间。
除了 GPU 利用率,云大厂还有第二层壁垒,即稀缺闭源模型的定价权。大语言模型、Coding 模型赛道已经拥挤不堪,但视频生成模型不一样,能打的就那么几家。Seedance 是其中的稀缺供给,价格一直坚挺。
据爱分析调研,Seedance 的渠道代理商也只能拿到 95 折的价格,优惠比例极低。同时,Seedance 含视频输入的价格,还从每百万 Token 28 元涨到了 42 元。
在 GPU 利用率、模型定价权这两重优势的加持下,云大厂的 Token 业务高毛利、高增长,成为 AI 业务的希望之星。
02
模型能不能跑国产卡,决定了 Token 业务赚不赚钱
模型厂商自己提供 Token 推理服务,能不能赚到钱,关键就一条:这个模型能不能跑在国产卡上。能跑国产卡,就多多少少有得赚,如果模型参数规模太大,只能跑英伟达的卡,尤其只能跑 B300,那基本只能赔钱了。
也就是说,在模型设计阶段,Token 推理服务的盈亏空间就已经被锁死了。Kimi、智谱,两家模型厂商恰好展示了截然不同的结果。
Kimi 的 K3 参数量 2.8 万亿,MXFP4 量化后权重文件高达 1.4TB。8 张 H200 的显存总容量仅 1.1TB,根本放不下,只能用 B300。
爱分析基于 Wafer 的基准测试,估算了 K3 在 B300 服务器上的月度盈亏情况。在 100%GPU 利用率、90% 缓存命中的前提下,Kimi 每月亏损 6.5 万元,毛利率为 -34%。如果 GPU 利用率按行业标准的 70% 左右估算,其亏损将更为严重。

图 3:K3 月度 Token 亏损
再反观智谱的 GLM-5.2。尽管 GLM-5.2 的输出价格显著低于 K3,但它可以跑在昇腾服务器上,同样跑满 1 个月,利润率可以做到 20%。
GLM-5.2 的参数量为 7,440 亿,仅是 K3 的 1/4,MXFP4 量化后权重文件也只有 200 多 G,完全可以跑在昇腾服务器上。而昇腾服务器的月租价格在 7-8 万,仅仅是 B300 的零头。
两家算下来,结果就是开头那句话,谁的模型能被塞进便宜的国产卡,谁就能赚钱。所以,GLM-5.2 和 K3 之间并不是技术实力有差距,而是技术路线各有选择。
K3 选择 B300,并不意味着完全挣不到利润。K3 在开放模型权重时,针对 MaaS 收入超过 2000 万美元的合作伙伴,会收取模型授权费。这种轻资产分成的方式,将是 K3 盈利的主要方式。
在这种模式下,Kimi 无需投入算力成本,所有收入都是纯利润,这也是模型厂商独有的结构性优势。爱分析预计,未来智谱、DeepSeek 都会考虑在开源的同时,针对大型 MaaS 服务商进行抽成。
03
独立厂商前途未卜,无论怎么优化也带不来利润
独立厂商是三类玩家里面最难的一类。
卖 Token,它没有模型定价权,因为跑的是开源模型,市场充分竞争,价格没有优势。它的服务器月租按市场价全额付,没有资本实力签长约锁定价格。GPU 利用率尽其所能做到 70%,虽然已是行业优秀水平,但对比云大厂有 10-20 个百分点的固定差距。此外,它还得给模型厂商交授权费。
这些变量,独立厂商一个都做不了主,全是别人定的价。
独立厂商手里唯一的牌,是推理加速技术。无问芯穹 CEO 夏立雪在 2026 年 7 月提出优化即利润的思路,团队实测通过架构优化,能把单个 Token 的成本降 37.5%。这个数字听起来不小,但把它放进 K3 在 B300 上那个月亏 6.5 万的账单里再看,事情就变了。

图 4:推理加速带来的毛利改善
这几项优化全部叠满,最好的结果也就是从一个月亏 6.5 万,变成亏 1 到 2 万。方向没变,还是亏。优化的真正价值不是让独立厂商赚钱,是让它少亏一点、多撑一阵。爱分析判断,独立厂商规模做得越大,亏得越多,这是一门算不过来账的生意。
不但如此,独立厂商的生存空间也正在双向收窄。一方面,开源模型的参数规模持续膨胀,能塞进国产芯片的模型越来越少。另一方面,英伟达 GPU 的月租金正在快速上涨,B300 从年初 12 万元涨到 7 月的 19 万元以上。
如果独立厂商坚持只做推理加速优化,唯一能盈利的路径是使用市场上的闲置算力。而以地方政府、央国企算力中心为代表的闲置算力持有方,将是独立厂商的重要合作伙伴。
对于这些政企类算力中心,已经完成 GPU 采购和部署,GPU 服务器是沉没成本,每一分的 Token 收入都很重要。由于缺乏使用场景,算力始终处于空置状态,独立厂商接入这些算力时成本极低。同样的 B300 服务器,独立厂商按市场价格月租 19 万元,接入政企闲置算力的成本比昇腾服务器还便宜。跑同样的 K3 模型,完全有可能实现正向的毛利率。
但是这条路的窗口期有限,政企的闲置 GPU 摊销周期有限,再过两年,这些 GPU 将被市场淘汰,无法用于 Token 推理服务。
04
运营商即将入场,竞争将更加惨烈
当前的 Token 市场由三类玩家主导,但第四个角色已在酝酿。运营商将以批发转零售的分销模式加入市场竞争,从模型厂商集采 Token,再零售给政企客户。其中,中国电信已启动百亿级 Token 工厂集采,中国移动上线 Token 通用服务。
对于运营商来讲,这个业务绝对是舒适区,手握消费者、政企两个核心销售渠道,把 Token 做成和话费包、流量包并列的产品,上线只是时间问题。而且,批发转零售这种资源转售业务,本就是运营商最为擅长的。
因此,运营商的入场,将挤压部分市场玩家的空间,缺乏市场话语权和竞争优势的玩家,尤其是独立厂商,生存压力将受到更大的考验。
说到底,Token 厂商每一种能持续盈利的模式,本质上都绑定了一个别人无法复制的成本结构。云大厂绑定的是内部业务生态带来的确定性 GPU 利用率,模型厂商绑定的是自有模型和匹配的芯片选择,运营商绑定的是分销商角色,唯有独立厂商尚未找到自身的专属优势。


登录后才可以发布评论哦
打开小程序可以发布评论哦