爱分析 昨天
2026 爱分析·Token市场海外对标研究报告
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

大模型普及带动推理需求快速爆发,Token 推理服务商业价值持续凸显,第三方服务商已然成为 AI 算力生态的重要组成部分。

海内外产业发展形成显著落差:海外市场已沉淀出经过验证的商业化实践,国内行业却深陷算力内卷、价格厮杀、毛利率持续承压的发展困局。不少本土服务商在客户选择、业务路线、是否布局自研芯片等关键战略决策上,缺少可借鉴的行业参照。

基于上述背景,爱分析正式发布《2026 爱分析・Token 市场海外对标研究报告》。报告跳出国内市场的局部视角,以海外成熟产业实践为对标样本,剖析不同商业模式的得失,为国内 Token 服务商研判赛道、制定战略提供务实参考。

01

综述

Token 服务正在成为 AI 产业链价值分配的核心环节。向上,Token 服务支撑 AI 应用;向下,Token 服务调用模型与算力资源。

根据爱分析预测,2026 年全球 Token 市场规模将达到 1350 亿美元。迅速崛起的 Token 产业与开源模型生态,使得模型原厂提供的 Token 服务已经无法满足市场需求,从而催生了众多第三方 Token 服务商。

过去两年,第三方 Token 服务在海外跑出了一个相对成熟的格局,市场清晰地分化出两条发展路线。一条路线提供 MaaS 服务,做算力调度和推理性能优化;一条路线自研推理芯片,重新定义推理服务的成本结构。

而中国市场,当前正在重走这个过程,路途中荆棘遍地。为此,爱分析这份报告通过海外市场的对标研究,回答两个核心问题:第一,Token 服务的毛利率未来将会如何变化;第二,第三方 Token 服务商做芯片,这个命题是否成立。

我们的核心判断有三层。

第一层,Token 服务包含两门生意,服务终端企业和服务模型厂商。两者看起来都在卖算力和推理能力,但财务模型完全不同。服务企业,能自主定价、毛利高,且自持算力资产较轻,对于现金流压力小;服务模型厂商,缺少话语权、毛利被集采压到个位数,而且需要自持的资产比例也更高,现金流岌岌可危。

第二层,国内的 Token 服务商过于偏向服务模型,未来应当逐步重视服务终端企业这条路。当前,国内诸多的 Token 工厂、算力运营商,都扎堆在服务模型这条路上,反观服务企业这条路,由于收入起量慢,少有人走。但是在海外,服务企业才是主流趋势,这是国内 Token 行业最大的认知偏差。

第三层,Token 服务向上游芯片延伸,方向是对的,但当下不是好时机,投入产出比低。未来,如果模型大厂率先跑通自研芯片加 Token 服务的闭环,第三方服务商入局芯片的机会将进一步收窄。

本报告后续内容分三部分展开:第二章研究海外 Token 市场的格局,剖析 MaaS 和芯片两条路线如何分化与演进;第三章分析 Token 服务商未来的毛利率变化趋势;第四章回答芯片路线是否适合中国的 Token 服务商。

02

海外 Token 市场

全球 Token 市场规模今年迎来了爆炸式增长。爱分析测算,包含模型原厂提供的 Token 服务在内,全球 Token 市场规模从 2025 年的 240 亿美元迅速攀升到 2026 年的 1350 亿美元,增速超过 460%。此前,Gartner 曾预测 2030 年 GenAI Models 的市场规模为 1390 亿美元,未曾想这个数字 2026 年就已经实现。

图 1:全球 Token 市场规模

伴随市场爆发,第三方 Token 服务商在海外也已经跑出了领先的第一梯队。这个梯队玩家的发展逻辑并不相同,逐步分化成了 MaaS 和芯片两条路线,彼此的技术壁垒与商业模式也差别很大。

2.1 MaaS 路线

第一条是 MaaS 路线,代表厂商是 Fireworks。这类厂商多出自于模型厂商的 AI Infra 团队,擅长在英伟达 GPU 上做模型推理的调度与优化。比如,Fireworks 创始团队来自 Meta PyTorch 的整建制班底,在 GPU 优化和高并发架构方面拥有极深的积淀。

MaaS 路线厂商的核心工作是两件事,把开源模型的推理成本压下来,以及把弹性算力调度做稳。这条路线上,海外已经跑出了多家规模化公司,ARR 在从 10 亿美元向 20 亿美元冲刺。

表 1:海外 Token 市场 MaaS 路线代表厂商

上述四家 Token 服务商里面,OpenRouter 知名度固然最高,但模式上最轻,不碰算力、不碰推理加速,只做路由和计费,从 Token 分发中抽佣 5-5.5%。相比之下,另外三家代表厂商真实承担 GPU 成本,更代表这条路线的未来发展趋势。

Fireworks 目前处于阶段性领先地位,其最核心的优势在于自研推理引擎 FireAttention。根据公开评测,FireAttention 在 FP8 精度下的 Token 吞吐比开源方案 vLLM 高出 5.6 倍,连续批处理情境下,可以将 GPU 利用率从 40% 拉到 85%。

除了技术能力,Fireworks 业务模式同样具有独特之处。

第一,它使用多云算力调度,而且不买卡、不建 Token 工厂。Fireworks 算力池连接了 AWS、Azure 在内 8 家以上算力供应商,并且与 NVIDIA、AMD 等芯片厂商认证的 AI 原生推理云深度合作,直接获取最新的算力资源。

第二,它的 Token 量构成特殊,绝大部分来自企业客户专用的定制模型,而非开源模型的旗舰版本或者 Flash 版本。根据公开披露的数据,Fireworks 今年 7 月份每日处理 Token 量超过 40 万亿,其中 95% 来自定制模型。定制模型的推理加速需要额外研发适配成本,因此企业客户替换 Fireworks 的成本高,长期客户黏性强。

第三,它提供的生产级系统工程,包含多租户调度、稳定性、合规等企业级要求,都是开源模型及生态无法提供的,这进一步加强了客户粘性。

基于上述分析可以看到,MaaS 路线的竞争在于推理加速技术,但并非仅仅针对全尺寸的开源模型做推理加速。由于开源社区技术迭代速度快,自研推理引擎的优化效果会随着时间拉伸被开源生态追平。但如果是基于客户专用的定制模型推理加速,需要深度绑定客户模型,这才是真正的壁垒所在。

MaaS 路线里的另外两家,Baseten 和 Together AI,做的事情与 Fireworks 大同小异,侧重点稍有差异。Baseten 更偏向为企业 AI 应用做模型部署和弹性伸缩,通过将 GPU 池化成一个弹性池,为超 100 家企业客户提供波峰波谷不同时段的弹性算力服务。Together AI 业务模式和国内的 Token 工厂更为接近,基于覆盖推理、训练的 GPU 集群,聚合 200 多个开源模型,并且正在从租赁 GPU 走向自建 AIDC。

这三家毛利率总体处在 50% 左右,自建算力的 Together AI 稍低 5 个百分点。自建算力的 GPU 利用率在早期比较低,预计这是影响当前 Together AI 毛利率的主要原因。

2.2 芯片路线

另一类公司为了极致优化推理效果,选择了自研芯片的路线。同时,自研芯片可以改善成本结构,进而重塑 Token 服务的财务模型。这条路线上有三家代表公司,Groq、SambaNova 和 Cerebras。

表 2:海外 Token 市场芯片路线代表厂商

三家创业公司都完成了芯片从零开始的研发与生产,这说明推理芯片的研发门槛确实下降了,但三家厂商目前的发展情况差异很大。

Groq 的芯片业务于 2025 年 12 月被英伟达以 200 亿美元收购,包括芯片的技术授权和团队收编,其 LPU 芯片已经进入英伟达新一代 Vera Rubin 平台,成为生态里的一个组件。

SambaNova 则绑定了英特尔,2026 年 7 月完成 10 亿美元融资,年收入规模维持在亿美元级别,尚未快速起量。

Cerebras 是三家里唯一走到 IPO 的,2026 年 5 月在纳斯达克上市,IPO 发行价 185 美元,目前价格略高于发行价,市值在 500 亿美元附近徘徊。

鉴于 Cerebras 是唯一未被芯片大厂锁定的独立厂商,爱分析选择其作为芯片路线的标杆进行研究。

Cerebras 的芯片是晶圆级引擎(WSE,Wafer-Scale Engine),就是将整片晶圆做成一颗芯片。传统芯片制造过程,是将一片晶圆切割成上百个独立的小芯片,再通过电路板把它们连接起来。而 WSE 不进行切割,把完整晶圆作为一个超级大芯片来设计和使用。

如此设计的优势有三点。第一,海量核心,单一芯片可以集成几十万个专门用于 AI 计算的核心。第二,超高带宽,拥有超大容量的片上存储,数据读写速度极快。第三,延迟降低,所有计算核心都在同一片硅片上通信,省去了不同芯片之间传输数据的延迟,大幅提升了 AI 的训练与推理速度。

基于上述三点,模型推理的速度得到极致增强。根据公开数据披露,同样参数的模型,Cerebras 的推理速度是英伟达 10x 以上。

在商业模式上,Cerebras 也有两个特点。第一,它既卖硬件芯片,也卖自建算力的 MaaS 云服务,目前收入中硬件收入约占七成,MaaS 服务约占三成。卖芯片收入起量快,在上一节的 MaaS 路线厂商还在讲 ARR 破 10 亿美元时,Cerebras 今年的营业收入就有望突破 10 亿美元。

第二,Cerebras 锁定了超大客户,从而保证其长期能够独立生存。2025 年收入中,Cerebras 前两大客户贡献占比 86%。今年 1 月,OpenAI 与 Cerebras 签署了超过 200 亿美元的长期协议,同时还提供 10 亿美元贷款,并且还拿到了行权后持股接近 10% 的认股权证,所以 OpenAI 同时是 Cerebras 的客户、债主和潜在股东。

这也是 Cerebras 发展比另外两家强的地方。在 IPO 之前,软银控股的 ARM 也曾计划收购 Cerebras,但正是由于 OpenAI 等超级大客户的充分认可与支持,Cerebras 得以独立发展。如果没有这些客户支持,Cerebras 也难免步 Groq 和 SambaNova 后尘,被芯片巨头收编。

2.3 两条路线对比

把 MaaS 和芯片这两条路线放在一起,最直观的差异在于毛利率。

MaaS 路线厂商毛利率在 45-50% 之间,芯片路线 Cerebras 却只有 39%,不仅只有英伟达一半的毛利率,更是低于不碰芯片的 Token 服务商。

细拆来看,Cerebras 芯片部分毛利率可提升空间并不大。2025 年至今,芯片业务毛利率始终维持在 40% 出头的水平,与收入规模增长的关联度不高。目前,Cerebras 的毛利率和英特尔处于同一水平线,长期看也很难追平 AMD 的 50%+ 毛利率水平。

表 3:Cerebras 毛利率变化情况

但是,Cerebras MaaS 服务毛利率非常值得期待。其毛利率在 2026 年发生质变,Q1 达到 53%,相比 2025 年几乎翻番。Q2 下滑至 41%,也是由于为了交付 OpenAI 的推理算力,不得不向已售客户溢价回租了算力资源,导致毛利率短期回落。

将芯片路线厂商的 MaaS 毛利率,与 MaaS 路线代表厂商进行对比可以发现,自研芯片的财务结构确实更为出色。Cerebras 官方预期其长期毛利率将超过 60%,因此 Cerebras 虽然起家于推理芯片,但未来更值得期待的无疑是 MaaS 服务。

Token 服务毛利率

海外 Token 服务商毛利率可以做到 50% 以上,那么这套模式搬到中国后,国内 Token 服务商能拿到多少毛利呢?

基于爱分析调研,国内的第三方 Token 服务商毛利率普遍在 20% 以下,甚至由于价格战、算力价格波动等影响,出现负毛利率现象。这个反差背后,主要原因在于中美 Token 服务商的服务对象不同,导致定价权差异极大。

3.1 定价权差异

根据爱分析研究,海外 MaaS 毛利率高,主要是因为服务企业客户,手握 Token 定价权。

首先,海外 MaaS 路线服务的核心客户是 AI 原生应用以及大型 SaaS 应用,模型厂商并不是它们的核心客户。

以 Fireworks 为例,其 AI 原生应用大客户包括 Cursor、Perplexity;SaaS 大客户如 Notion、Shopify 等。Baseten 的大客户同样包括 Cursor、Notion,此外还有医疗垂直领域的 AI 应用 Abridge、OpenEvidence 等。

其次,海外 Token 服务商将推理服务的定价标准,牢牢掌握在自身手中。

海外企业客户选择开源或者专属模型的主要原因,是闭源模型价格太贵,以及担心数据被闭源模型用于训练。

针对价格部分,由于开源模型与闭源模型能力差距并不大,只要不是高度复杂场景,两者效果近似。因此,Token 服务商的收费只要比闭源模型便宜,就对于企业客户极具吸引力。

针对数据主权部分,企业客户采购模型原厂提供的 Token 服务,会担心其数据被用于训练。而第三方 Token 服务商不自训模型,这是企业客户优选中立服务商,而非模型原厂的原因。

基于上述两点,海外 Token 服务商定价并不是锚定开源模型的刊例价,而是只要比闭源模型低即可。正是由于手握定价权,海外第一梯队 Token 服务商的毛利率基本都处于 50% 的级别。

国内的定价权机制则刚好相反。国内 Token 服务商的第一大客户往往是模型厂商,而非企业客户。模型厂商作为 Token 集采方,一般以刊例价 3-5 折的价格采购 Token 产能,再以 7-9 折批发或零售。而 Token 服务商的生产成本往往是刊例价的 4 折左右,因此毛利率极低,甚至出现倒挂现象。

在这种机制下,定价权握在模型厂商手中,Token 服务商没有自主定价的空间。根据爱分析调研,国内服务模型厂商集采的 Token 工厂,毛利率普遍只有 5-6%,是海外的 1/10。

通过对比国内外情况,可以看到 Token 定价权在终端企业和模型厂商之间滑动,Token 服务商能留下多少,取决于离哪一端更近。越靠近终端企业,定价权越强,毛利率越高。

3.2 国内 Token 服务商的选择

选择服务模型厂商的 Token 工厂模式,不但毛利率很低,而且要自持算力,那国内 Token 服务商为何不选择服务企业客户呢?

爱分析认为,核心原因是当前国内企业客户的需求尚未进入成熟期,需求尚未真正起量。

首先,国内推理算力供给不足,导致 Token 服务商和企业客户手中的算力规模并不大。

根据调研,这两类群体硬件资本开支并不高,头部的代表企业每年 CapEx 至多是十亿级别。企业客户如莲花味精,2023 年斥资 7 亿元采购英伟达 GPU 服务器。Token 服务商如并行科技,今年通过借款、与政府合资成立公司等形式购置 GPU 服务器,整体规模在 10-20 亿之间。

相比之下,为购入 GPU,字节跳动举债 296 亿美元、阿里募资 800 亿港元、智谱再融资 50 亿美元,其获取的算力规模远远超过其他类型企业。

算力资源分配的多寡不均,导致 Token 服务商如果选择服务企业客户,这几年注定默默无闻,收入增速远低于行业平均增速。

以上是针对新购置的算力资源,而国内早期地方政府建设的 AIDC 确实有闲置的存量算力资源,但这些算力卡质量不佳,把资源批量卖给模型厂商是地方政府最顺手的变现方式。

因此,企业客户手中算力不大,Token 服务商手中算力也很紧缺,导致 Token 服务商不得不倒向服务模型厂商。

其次,企业客户专属模型尚未起量,对于 Token 服务商需求不强。

海外企业客户更多会追求自身专属模型,一般是基于开源模型做微调,或者为了降低 Token 消耗训练契合自身业务使用的小模型。

但是国内企业客户使用模型呈现两个极端,要么追求旗舰模型,要上就必须是满血版 DeepSeek;要么追求极致低算力要求,只上 27B 或者 35B 的 Qwen 小尺寸模型。针对前者,无论哪家 Token 服务商提供 DeepSeek 服务,都是赔本赚吆喝,毛利率极低;针对后者,其本身算力水平就很低,Token 推理毫无用武之地。

当然,我们也看到,国内如 LibTV 等 AI 原生应用,已经开始训练自身使用的模型。待这些客户逐步成熟,Token 服务商的需求将会迎来第二次爆发。

当前,国内还是有一批 Token 服务商专注于服务企业客户,典型如传统私有云厂商青云科技,Token 工厂硅基流动未来也可能会更加倾向于服务私有化的企业客户。

这类 Token 服务商,手中缺少算力,收入体量都不大,但由于只提供推理加速服务、不提供算力,毛利率都较高。比如,硅基流动 2025 年本地化部署解决方案收入仅略超 2600 万元,毛利率超过 80%。青云科技旗下青云智算 2026 年上半年收入约 1879 万元,与去年同期持平,并未进入高速增长期。

3.3 海外毛利率的未来

展望未来,海外 Token 服务商 50% 的毛利也不是稳态,正在被模型厂商从两端挤压,毛利率将进入下行区间。

一方面,闭源模型降价的趋势不可避免,海外 Token 服务商的定价也将随之下调,从而压低毛利率。OpenAI 通过 GPT-5.6 Luna 将价格砍掉 8 成,Anthropic 通过 Claude Opus 5 将旗舰模价格砍掉一半。Token 服务商在和企业客户议价时,将面临这些低价闭源模型的强力竞争。

另一方面,开源模型厂商将逐步开始向海外 Token 服务商分层收费,进一步对毛利率造成影响。从 Kimi K3 开始,向 MaaS 服务商收费已成为一种趋势。公开协议中 Kimi 要求分成 30%,根据爱分析调研,目前实际分成在 10% 级别,但未来分成比例只会越来越高。

海外也有一些实测数据,显示 Together AI 的批处理推理价格已经贴近成本价,毛利率接近为 0。

综合上述分析,无论是海外还是中国,Token 服务商的毛利率都处于承压状态,预计当前 50% 的毛利率将是整个行业天花板,长期难以维持。

Token 服务的芯片路线

海外 Token 服务商做芯片这条路线已经有多年实践,并且跑出了三家创业公司。国内,无问芯穹从 2024 年开始就在研发端侧模型的专用推理处理器 LPU。那么,国内 Token 服务商是否应当涉足芯片领域呢?

我们认为,这个问题可以继续拆解为:推理芯片是否有技术壁垒?推理芯片的财务模型如何?应当何时介入芯片领域?

4.1 技术壁垒

无论是海外的三家创业公司,还是国内的 GPU 芯片厂商,都造出了芯片,这件事充分说明 GPU 推理芯片没有不可逾越的技术门槛。

因此,对于 Token 服务商而言,如果把 GPU 芯片看作长期的技术护城河,将是严重误判。更合理的判断是,自研芯片对于改善 Token 服务的财务模型效果显著。

首先,国内芯片业务本身的毛利率就很可观,超过海外平均水平。前文分析海外市场可以看到,海外芯片市场毛利率分为 3 个明显的梯队。第一梯队,英伟达毛利率超过 70%;第二梯队,AMD 毛利率介于 50-60% 之间;第三梯队英特尔、Cerebras 等毛利率介于 40-50% 之间。

而国内市场,芯片厂商毛利率普遍集中于 50-60% 之间,和 AMD 处于同一水平,相比国内 MaaS 不及 20% 的毛利率,芯片厂商这个毛利率水平更显得尤为可观。

其次,芯片业务对 MaaS 业务的毛利率也有改善效果。

在海外,Cerebras 的 MaaS 毛利率已经超过 50%,高于 Fireworks 等厂商。可以看到,自研芯片确实能够提高 MaaS 毛利率。因此,国内 Token 服务商若自研芯片,MaaS 毛利率可以超过 20% 的天花板。

4.2 竞争格局

那么,当前是 Token 服务商介入自研芯片的好时机吗?爱分析认为,无论当前还是未来,第三方 Token 服务商都很难在自研芯片的竞争中获得一席之地。

国产推理芯片目前确实正处于高速增长的阶段,阿里平头哥出货量 2026 年保守预计超过 100 万片,较 2025 年增长 3 倍以上。

但是,目前芯片增长背后驱动力是出口管制、替代英伟达的需求,芯片厂商的能否量产出货,比拼的并非是性能,而是谁能拿到更多中芯国际产能。因此,Token 服务商此时介入推理芯片研发与制造,毫无优势可言。

参考海外市场,芯片制造并不是产业瓶颈,只要能设计出高性能芯片,就能找到代工生产。因此,当国内突破芯片制造产能的限制,Token 服务商就可以开始考虑自研推理芯片的设计研发。

但届时,国内芯片这条路线将面临更大的竞争对手,即阿里、字节等大厂。大厂将是真正跑通芯片加 Token 服务闭环的先行者,这将导致第三方 Token 服务商自研芯片难度倍增。

阿里的真武 PPU 是典型样本。它先在阿里云内部消化产能,支撑 Qwen 的训练和推理。随着 Qwen 调用量增长,迅速完成 Token 服务的全闭环。当前,真武 PPU 尚处于万卡集群,而 2027 年末真武 PPU 将实现 50 万卡的算力集群,相当于 1GW。在如此规模的算力集群之上,Token 推理成本将大幅下降,届时第三方 Token 服务商追赶难度极大。

除了阿里,字节也在争夺 Token 调用量第一的座次,其自研推理芯片 SeedChip 也已排上日程,计划 2027 年进入量产阶段。百度昆仑芯的出货量,在 2025 年就已经追平寒武纪,达到国产前三的水平。昆仑芯拳头产品 M100 已经进入小规模出货阶段,将大幅提高 2026 年业绩。

这三家的共同点,是先有了确定性的内部负载做基础,在摊薄芯片研发和生产成本的同时,也大幅降低了 Token 推理成本。

相比之下,第三方 Token 服务商没有这个基础负载提供底仓支撑,自研芯片将面临严重的销售难题。一旦产能利用率上不去,反而会对原有的 MaaS 业务造成现金流挤压。

因此,对第三方 Token 服务商来说是,向上游芯片延伸的方向是对的,但这条路道阻且长,投入产出比不高,还会遭遇大厂自研芯片的强烈竞争。

结语

回到开篇的两个问题。

首先,中国第三方 Token 服务的毛利率未来会走向分化,服务终端企业的服务商能把毛利率维持在相对健康的水平,服务模型厂商的服务商则会被集采长期压在低位。

其次,Token 服务商做芯片,方向是对的,自研芯片确实能改善财务模型。但对第三方 Token 服务商而言,很难找到好的切入时机,短期没有能力获取芯片制造产能,长期缺乏与大厂 PK 的 Token 服务闭环的能力。

对中国的 Token 服务商来说,方向的选择比当下的努力更重要。服务模型厂商虽然能快速起量,但手中没有定价权,收入增长质量低、毛利率低。爱分析的建议是,把重心逐步转向服务终端企业,那里有自主定价的空间,有更轻的资产结构和更稳的现金流。

长期壁垒的最终落点,回到服务什么客户这个原点。谁能更早看清这一点,谁就能在这轮格局重排里先站稳脚跟、走得更远。

扫码获取《2026 爱分析 · Token 市场海外对标研究报告》

近期厂商征集

AI 数据服务市场研究项目征集

点击申报

截至时间:9 月 30 日

本体市场研究项目征集

点击申报

截至时间:10 月 31 日

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 芯片 产业链
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论