新浪财经 昨天
Token启示录(五):推理产业链深度-测算篇
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

推理需求高增叠加算力紧缺约束的背景下,大模型、云厂商、第三方服务商均需要追求更高的推理效率。在分析推理优化的原理的基础上,市场关注:不同技术对于推理优化的定量影响如何?推理优化有哪些参与者又如何看待各方参与者?本篇为推理产业链深度报告下篇——测算篇,我们将分析并解答上述问题。

推理产业链参与者众多。硬件厂商外,推理产业链的主要参与者包括:模型厂商、超大规模云厂商、新云、推理优化平台、异构算力管理平台、多模型 API 聚合平台等。我们认为各环节毛利率主要取决于推理优化能力、硬件利用率、硬件采购成本和产品定价权等,短期规模扩张可摊薄固定成本,中长期超额利润需将技术效率转化为更低的单位 Token 成本和更稳定的软件服务溢价。

推理优化能够带来多大幅度的成本下降?在硬件价格给定时,单位 Token 成本主要由单卡理论吞吐、算法增益、推理引擎工程达成率和集群利用率共同决定。模型架构与芯片能力设定理论成本边界,量化、投机解码等算法进一步提高有效吞吐,推理引擎和集群调度则决定理论收益的实际兑现程度。我们认为,单项优化较难形成持续的成本优势,覆盖模型、算法、引擎与硬件的 Co-design 能力更有可能形成持续的单位 Token 成本优势。

如何看待各方参与者?1)云厂商与新云:具有较强的算力采购、模型分发、企业渠道能力,可以用规模提升硬件利用率;在算力整体紧张时、模型智能水平差距缩窄,云厂商因其前期算力投入收入更具弹性;2)模型厂商:在算力紧张程度有缓解、模型智能水平差距扩大时,擅长 Co-design 的参与者更具备优势;3)第三方厂商服务敏捷、专注推理引擎提升有效吞吐,在模型厂商和硬件厂商尚未将推理优化作为核心投入方向的阶段,在产业链中抢占身位,长期来讲需要向硬件或者向模型靠拢。

技术迭代导致既有优化成果贬值风险;模型商业化模式变化风险;成本上升风险;推理优化技术演进风险。

一、推理优化市场格局、价值分成与经济效益

随着用户规模、调用频率和单次任务计算量的增加,推理需求快速增长。大模型由聊天工具向搜索、编程、客服及企业工作流渗透,调用主体从个人用户扩展至自动运行的软件和 Agent;长上下文、推理模型执行更长的推理过程增加推理需求。硅谷在 26 年年初短暂的兴起 Tokenmaxxing 的风潮,但是用户很快意识到成本控制的重要性,我们认为,推理需求的增长为推理优化平台创造了市场空间。

图表 1:中国 Token 供应市场规模快速扩张

注:该统计口径为中国词元市场的全年累计 Token 调用量 资料来源:弗洛斯特沙利文,中金公司研究部

市场格局:产业参与者众多、各参与方群雄逐鹿

推理优化平台百花齐放,主要包括:

► 模型厂商:掌握架构、权重、训练数据与评测反馈,能够把 MoE、注意力机制、投机解码和低精度设计等前移至模型研发阶段,具有模型与推理调优系统的 Co-design 优势。我们认为,当模型智能水平差异扩大时,模型能力能够支撑 API 定价分化;当开放模型能力趋同时,成本控制能力与渠道分发能力的重要性上升。

► 超大规模云厂商:掌握算力采购、网络存储、企业客户和应用生态的全栈式资源,推理优化的收益可通过提升集群利用率、带动云资源消费和增强客户粘性兑现。根据 IDC,2025 年中国公有云 MaaS 市场按调用量计算,火山引擎占据了接近一半的份额,其次是阿里云、百度智能云、硅基流动以及移动云。而私有化部署市场的集中度更低,传统政企客户出于数据安全、合规可控等考虑,仍然将私有化部署作为第一选择,因此私有部署市场仍有发展空间。

► 海外 Neo cloud、国内算力租赁厂商:通过 GPU 资源和快速交付切入。我们认为算力紧张阶段,高性能集群和长期容量合同有助于形成收入增长;随着算力供给在中长期释放,这类商业模式的核心竞争优势将会回归利用率、融资成本和软件附加值。

► 中立推理优化平台:主要优势来自跨模型、跨芯片和客户专用负载的管理。我们认为其长期价值取决于能否向上参与模型适配、向下深入 Kernel 和硬件,并把无服务器推理服务流量转化为专属端点、预留容量、软件许可或私有部署收入。

► 国内异构算力平台:受益于多类芯片并存和私有部署需求,因此芯片适配、资源池化与跨集群调度具备明确商业价值。随着新增模型和芯片的适配周期缩短、单项目投入人数下降、软件订阅及运维收入占比提高,我们认为平台有望形成软件型毛利。

► 多模型 API 聚合平台:主要控制模型分发、统一计费和请求路由,商业价值更多来自降低接入成本与提高调用便利度。

► 芯片厂商:通过硬件销售、软件生态和开发者锁定承接推理优化价值。低精度计算、显存带宽、互联和专用算子决定芯片的理论上限,编译器、Kernel 库和主流框架支持决定客户能够使用多少性能。

► 应用厂商:是推理效率改善的重要价值承接方。成本下降能够支持更高调用频率、更长上下文和更复杂的 Agent 工作流,交互性提升也可能打开实时语音、代码生成和自动执行等新产品形态。

图表 2:公有云竞争格局头部集中

注:2025 年中国 MaaS 市场份额(按 Tokens 计)资料来源:IDC 中国,中金公司研究部

图表 3:私有部署竞争格局较为分散

注:2025 年中国大模型平台私有化市场份额(按营收计)资料来源:IDC 中国,中金公司研究部

我们认为推理优化能力可以理解为四层模型与系统级优化能力 + 底层硬件作用。1)模型架构设定计算、显存与通信的先天边界;2)量化、投机解码等优化算法压缩数据搬运和串行生成轮次;3)推理引擎负责请求调度、KV Cache、Kernel 及跨卡执行;4)异构调度完成芯片适配、资源池化、放置与路由;5)硬件决定可用精度、显存带宽和互联上限。上述产业参与者与技术的大致对应关系如下。

图表 4:推理优化技术全景图

资料来源:各公司官网,中金公司研究部

价值分成:不同推理服务模式下,产业链价值分层略有差异

不同推理服务模式下,产业链价值分层略有差异。1)海外闭源模型厂商开始形成一定模型溢价,国内模型毛利处于爬坡期;2)国内 Token 工厂商业模式面临较重的折旧或者算力成本压力;海外推理优化平台专属推理端点相较纯 GPU 集群租赁定价更高,托管引擎、容量保障和运维等服务具备一定技术溢价;3)新云依靠 GPU 资源获取和高性能集群交付切入市场,短期受益于算力紧缺和价格上涨;4)大型云厂商凭借成熟客户结构、较高资源利用率及云平台交叉销售,相关业务毛利率通常处于较高水平。

我们认为,各环节毛利率取决于推理优化能力、硬件利用率、硬件采购成本和产品定价权等多个因素,短期规模扩张可以摊薄固定成本,中长期超额利润仍需将技术效率转化为更低的单位 Token 成本和更稳定的软件服务溢价。

图表 5:推理优化参与方成本分析

注:1)时间口径:Microsoft 是 FY26(对应自然年 2H25-1H26)的数据,MiniMax 的企业级服务以及 AI 原生产品是 1Q25-3Q25 的数据,其他公司为 CY25 的数据。2)除 MiniMax 与智谱外,其他均为综合业务毛利率。3)CRWV 和 NBIS 的营业成本主要包括数据中心租金、公用设施成本、员工成本,不包括基础设施相关折旧和产品研发成本,其折旧占收入比值为 44.8%、74.9%。4)AWS 在此表中为营业利润率。5)Together AI 体现为 H100 的裸 GPU 集群租赁价格和提供推理服务的专属实例价格。

经济效益衡量:单位 Token 成本、单位任务成本

《Token 启示录(二):单位经济模型探讨》中我们进行了单 Token 成本的分析,其中一个受到较多关注的假设为每秒单位 GPU 的 token 吐出量,该指标受到模型、芯片、推理框架等多方面的影响。SemiAnalysis 推出的开源、厂商中立的基准测试工具 InferenceX 数据具有一定的参考性,该平台持续测量不同芯片和软件栈的人工智能推理性能。每当配置发生变化时,基准测试就会重新运行,因此随着模型和框架的不断发展,测试结果也能保持时效性。我们根据近期 2478 条测试数据,统计了不同硬件、不同模型下的 token 吐出量及成本。

图表 6:InferenceX 开源模型推理性能测试结果统计

资料来源:InferenceX,中金公司研究部

即便固定模型与芯片,单卡 Token 吐出量的离散度仍高达两个数量级。以样本量最大的模型 D 为例,其在 B200 上的每卡吐出量区间为 152 token/s 到 14,949 token/s;对应的每百万 Token 成本区间为 0.04~3.3 美元。模型 A 在 GB200 上同样呈现 339~12,116 token/s 的宽幅分布。我们认为这一方面得益于推理优化;一方面源于高并发、长输出、宽松时延要求下吞吐逼近上限,而低并发或严苛 TTFT/TPOT 约束下吐出量迅速回落。

算力采购快速向新代际集中,芯片代际跃迁带来的效率改善超过其成本增幅,单位 Token 成本的竞争力不仅来自技术优化,也取决于算力采购能力。模型 D 的每卡吐出量均值由 H100 的 850 token/s、H200 的 1,233 token/s,提升至 B200 的 3,916 token/s 与 GB200 的 4,586 token/s,提升幅度约 3~5 倍。对应着的,价格提升幅度低于 token 吐出效率提升幅度,带来每百万 token 成本的下降。此外,同一类硬件在云厂商、新云、租赁、自建等不同获取形式下成本差异较大,也是单位 Token 成本较大的影响因素。

图表 7:InferenceX 测试内容

资料来源:SemiAnalysis,中金公司研究部

对于实际任务成本,降低 Token 消耗重要性不低于降低单位 Token 成本。归根结底,人们希望购买的是智能,不是 Token。InferenceX 等推理测试平台可以用于分析——单卡每秒能产出多少 Token、每百万 Token 成本是多少。但是,完成一项任务需要消耗多少 Token 同样关键。Artificial Analysis 分析了不同模型、不同优化厂商作用下的单位任务完成成本,为了降低单位任务成本:方式一是通过推理优化将单位 Token 成本降低;方式二是降低完成任务所需要的 Token。当前市场对前者的关注远多于后者,但从 Artificial Analysis 数据来看,后者对单任务成本的作用也较为明显。

图表 8:Artificial Analysis API 提供商排行榜 - 单任务成本

注:统计时点为 2026 年 7 月,单位为美元 资料来源:Artificial Analysis,中金公司研究部

二、推理成本优化幅度测算:单卡理论吞吐 x 算法增益 x 推理引擎效用 x 利用率

模型架构、算法、推理引擎、集群利用率共同决定了推理框架的成本优化能力。我们在技术篇中对影响推理优化效率的因素进行了讨论:模型架构首先决定单卡在理想状态下能够达到的理论吞吐上限(Roofline 边界);推理优化算法通过减少实际计算量、访存量等,在既定硬件条件下进一步放大有效吞吐;推理引擎优化决定理论能力能够被实际系统兑现多少,即提升系统相对于 Roofline 的工程达成率 η;集群利用率 U 决定 GPU 运行时间中有多少能够真正转化为有效 Token 产出。我们认为,来自模型架构、推理算法优化、推理引擎优化和集群利用率的贡献共同决定最终成本,单项技术领先较难独立形成持续的成本优势,而覆盖模型、算法、引擎与调度的 Co-design 能够持续释放各层优化效果,系统性扩大成本优势。

图表 9:Token 成本核心参数及定义

资料来源:Roofline: An Insightful Visual Performance Model for Floating-Point Programs and Multicore Architectures | EECS at UC Berkeley,Efficient Memory Management for Large Language Model Serving with PagedAttention,Nvidia 官网,中金公司研究部

我们测算显示,在经过逐层优化后,混合实际成本可达约 0.039 美元 / 百万 Token,较基准情况下(稠密架构 400B、MHA、FP8、Prefill 全注意力、推理引擎工程达成率 10%、集群利用效率 30%)约 44.46 美元 / 百万 Token 的推理成本大幅下降。

图表 10:四层优化能力成本瀑布

注:1)本图为递进式成本瀑布,体现混合实际成本。整个推理优化过程假设单次请求 32768 个输入 Token、1000 个输出 Token;混合理论成本=(32768 × 输入 Token 成本+1000 × 输出 Token 成本)÷ 33768;混合实际成本=混合理论成本 ÷(η× U)。2)柱状图上方的百分比为相比上一级的相对降幅、非累计降幅。3)起点假设为稠密 400B 模型、MHA 注意力、Prefill 全注意力、权重 FP8、KV Cache FP16,η=10%、U=35%。

资料来源:GitHub - deepseek-ai/DeepSeek-V3 · GitHub,Nvidia 官网,GMI Cloud 官网,中金公司研究部

三、推理优化参与方百舸争流

推理框架原生公司:从开源推理引擎走向商业化

推理框架原生公司正由开源引擎走向商业化基础设施。随着 vLLM、SGLang 等开源推理引擎逐步成为大模型部署的底座,其核心团队开始设立独立公司承接持续研发、企业交付与生态扩张:Inferact 以 vLLM 为基础,重点向跨模型、跨硬件和多节点部署的通用推理层演进;RadixArk 则以 SGLang 为核心,并向强化学习、后训练与大规模生产部署延伸。我们认为,这类公司的商业化是通过开源引擎 + 商业公司模式,将底层性能优化、硬件适配、调度与可靠性能力进一步产品化,价值边界也由单一推理引擎逐步扩展至覆盖推理、后训练和生产基础设施的更完整 AI Infra 层。

第三方推理优化平台与 Token 工厂:价值取决于成本、敏捷度、容量利用率

商业模式:把算力转化为稳定的 Token 产能

推理优化平台将底层算力转化为按 Token、GPU 时间或确定性容量购买的生产服务。推理平台的主要优化指标包括吞吐量、时延和 GPU 利用率等,服务于下游客户的生产服务等级目标(SLO)和预算。从产业链看,推理优化平台不同于纯算力租赁,也不同于仅提供模型权重或 API 的模型厂商,其价值在于用软件工程提高每单位算力的有效 Token 产出,并把复杂的模型适配、调度、监控和版本治理封装为服务。由于推理优化处于模型与硬件之间,其能力建设必须同时贴近模型架构演进和芯片特性变化。

图表 19:推理优化平台整合算力资源、大模型提供服务

资料来源:硅基流动招股书,中金公司研究部

目前主流推理优化平台主要提供公有云服务和私有部署服务。其中,公有云是由服务商统一建设和运营、客户按需调用的服务,包括无服务器推理服务和专属实例;私有部署则是将模型及推理系统部署到客户自有环境中。推理优化平台可通过无服务器推理服务,帮助企业在不同模型与硬件之间试用切换,降低迁移成本;也可通过专属实例和私有部署体系,在模型持续迭代和大模型厂商流量波动的背景下微调适配模型并保证稳定供给,满足客户 SLO 要求并履行 SLA 承诺需求。

► 无服务器推理服务:面向多客户提供共享算力池,按照 Token 输入量和输出量进行收费,是灵活且具有成本效益的接入方式,适合弹性调度方式,客户主要为 AI 开发者和中小企业客户。无服务器推理服务主要围绕主流模型开展通用优化,其核心作用是降低模型接入与试用门槛,客户可先通过按 Token 计费的方式测试不同模型的效果、时延和成本,再根据实际负载与 SLO 需求,迁移至专属实例。

► 专属实例:为特定客户在公有云上预留算力,通常按照 GPU 使用时长或 Token 用量计费,其相对于无服务器推理服务具有更优化的性能和稳定性,主要保障用户容量。专属实例为用户保留公有云上的专属算力,同时适配企业微调部署的大模型,有助于实现供需匹配和锁定收入。

► 私有部署:将算力成本转移至客户侧,基于用户自有算力进行定制优化和适配,采用订阅费或永久许可加维护费的形式,主要服务大型客户。私有部署基于客户自有算力,满足客户对于数据安全、国产芯片适配和本地运维要求。

图表 20:推理优化平台三种主要服务方式

国内外推理优化平台差异:技术架构与服务方式偏好不同

海外平台技术重点在于升级软件栈,国内平台更加重视异构适配。海外市场的主流推理硬件和软件生态相对集中,推理优化平台通常可以在成熟软硬件栈上直接开展吞吐、时延及集群利用率优化,将性能优势转化为云服务。国内市场则同时存在海外 GPU 和多种国产 AI 芯片,不同芯片在编译器、算子库和模型支持程度上差异明显。因此,国内平台除提升推理效率外,还需承担芯片适配、多芯片调度及本地化交付的工作,异构适配成为推理优化的技术重点。

海外平台偏向公有云服务,国内平台更依赖私有化和定制交付。海外推理优化平台的核心客户更多是 AI 原生公司和软件公司,这些客户的产品本身运行在云端,业务流量变化较快,更希望通过公有云快速获取推理服务。例如,Fireworks AI 为 Cursor 和 Notion 等客户提供稳定的专属推理资源,并围绕具体模型和业务负载开展性能适配 [ 1 ] [ 2 ] 。相比之下,国内中立平台服务的大客户往往自有算力资源,更关注数据安全,因此更倾向于采用私有部署的形式。以硅基流动为例,2025 年前五大客户合计贡献 45.0% 的收入,其中四家采购本地部署解决方案,一家采购专属实例 [ 3 ] 。在私有部署场景下,异构适配既构成技术壁垒,也可能成为规模化负担。我们认为,异构适配的长期壁垒在于适配能力能否沉淀为可复用能力,使新增模型和芯片的边际适配成本持续下降。

模型厂商:在架构层内化推理能力,加速探索商业化变现路径

大模型厂商逐步将推理效率内化为模型竞争力。DeepSeek 全栈化能力突出,通过多头潜在注意力(MLA)压缩 KV Cache、DeepSeekMoE 激活部分专家降低计算量;同时推出 DSpark 投机解码方式,通过并行草稿生成、顺序依赖恢复和动态验证长度提升单用户生成速度。阶跃星辰参与并行树投机解码(JetSpec)研究,提升低并发、单用户场景的 Token 生成速度;Kimi 以 Mooncake 为核心,以 3 ∶ 1 比例混合 KDA 与 Gated MLA,KDA 以固定大小递归状态降低长上下文缓存开销,周期性的 Gated MLA 层保留全局注意力能力;MiniMax 采用 MSA 稀疏注意力降低推理成本;智谱则通过收购中科加禾,向下整合异构算力软件栈,加强推理引擎与国产 AI 芯片适配能力。

开源模型厂商正加速探索商业化路径。2026 年 7 月 20 日,月之暗面与中国软件国际达成深度合作,前者提供大模型技术底座、模型微调及定制化训练服务,与后者联合打造行业专属智能体与一体化数智解决方案。合作中,中软国际自建的行业算力中心将优先保障月之暗面的算力需求,且双方将基于 Token 消耗量及衍生收入进行收益分成 [ 4 ] 。7 月 27 日,月之暗面为 K3 模型设定了商业化授权门槛:若企业及其关联方的 MaaS 业务连续 12 个月收入超过 2000 万美元,须在商用前另行签署协议;使用 K3 的商业产品月活超过 1 亿,或月收入超过 2000 万美元,需要在产品界面显著展示 "Kimi K3" [ 5 ] 。8 月 2 日,MiniMax 也同样为 H3 模型设定了商业化授权门槛:使用 H3 的商业产品或服务年收入超过 2000 万美元时,需要事先取得书面授权;使用 H3 或 H3 Works 的商业产品或服务 UI 必须显著展示 "MiniMax H3" [ 6 ] 。我们认为商业化授权和产业协同进展意味着开源模型厂商在追求扩大模型的影响力的同时,也在积极探索模型能力的变现路径。

云厂商:全栈式产品发挥规模效应

云厂商将算力规模转化为经营效率和产品竞争力。云厂商依托较大的数据中心、GPU 及自研 AI 芯片资源,可以将分散算力汇集为共享资源池,并通过推理优化,提高单位算力的有效 Token 产出。在商业模式上,云厂商既可以将底层算力封装为按 Token 计费的标准化 MaaS 服务,也可以针对稳定、高并发需求,提供预留吞吐、专属实例及 GPU 租赁服务。

云厂商拥有天然的客户和产品协同优势。云厂商通常已将数据、存储、数据库、安全及应用系统部署在特定云平台,在同一环境中调用模型能够减少数据迁移、系统集成和合规改造成本,并可直接复用原有的身份认证、监控、计费和采购体系。云厂商还可以将模型 API 与数据平台、Agent 开发工具及行业解决方案交叉销售,将既有云客户逐步转化为稳定的 AI 生产负载。

规模化需求形成流量与优化的正向循环。云厂商聚合大量开发者和企业请求后,可以提高异构算力调度效率,并通过负载预测降低容量冗余。更高的资源利用率使其具备降低 Token 价格或提高服务毛利的空间,而更具竞争力的价格与服务质量又能够吸引更多流量,进一步扩大资源池和优化样本。我们认为,云厂商的核心优势在于具备将 GPU 资源转化为持续下降的单位 Token 成本的能力。

投资建议:关注具备 Co-design 能力、已建立数据反馈平台的厂商

不同参与方禀赋各异

主要参与方包括中立推理优化平台、云厂商和大模型厂商三类,我们认为推理优化参与方禀赋优势各不相同。其中,中立推理优化平台以技术中立与客户联合优化为核心优势;云厂商全栈资源、客户基础和交付体系优势突出;大模型厂商对于模型系统协同优化能力较强。

► 推理优化平台与 Token 工厂:目标聚焦于单位算力 Token 产出、延迟和资源利用率,能围绕客户的模型结构、硬件环境、流量特征及 SLO 进行针对性适配。尽管 vLLM、SGLang 等开源框架已普及多项通用优化技术,但不同企业的算力资源和性能要求存在差异,推理优化平台的壁垒在于针对目标企业的 SLO 约束和生命周期管理的能力。我们认为,在算力紧缺背景下,中立推理优化平台在异构算力调度上的实践积累,有望成为在产业链卡位的独特竞争力。

► 大模型厂商:掌握模型架构、训练过程、权重及评测体系,能够从模型层直接开展推理适配,并根据模型版本迭代同步调整推理策略,因此在自有模型的模型 - 系统协同优化方面具有天然优势。

► 云厂商:具备全栈化能力,能够将模型调用与 GPU 算力、网络、存储、数据库、安全、监控及 Agent 开发平台整合,在 Token 需求增长的情况下,可以将自有云业务适配大模型后以 Token 服务售卖。云厂商本身具有较大基础设施规模,可以将 GPU 或自研芯片汇集为共享资源池,通过推理优化将算力封装为标准化 Token 服务或通过与企业需求适配出租 GPU 使用时长,有望将算力规模转化为 Token 经营优势。

Co-design 是维持推理优化能力与时俱进的核心方式

Co-design 的核心是把推理优化前移至模型或芯片设计阶段,并通过联合适配缩短新技术进入生产的周期。推理优化平台需要跨越模型、引擎、调度和硬件,并用真实生产流量形成反馈闭环。在模型不断进步的过程中,阶段性的领先优势通常难以长期维持,随着 AI 智能的持续提升,我们认为各个层级之间的 Co-design 基础是维持推理优化能力与时俱进的核心。

技术迭代导致既有优化成果贬值风险。大模型架构、推理算法和开源框架仍处于快速迭代阶段,新模型可能采用不同的注意力机制、专家结构、并行策略或算子设计,vLLM、SGLang 等开源框架也在持续吸收行业优化成果。若厂商既有技术对特定模型或硬件依赖较强,相关研发投入可能因模型换代、能力开源或行业标准变化而加速贬值,进而影响技术壁垒、客户黏性及研发投入回报。

模型商业化模式变化风险。本文相关分析主要基于 API 调用及按 Token 计费仍为大模型核心创收方式的假设,并据此判断模型厂商、推理服务商与算力供应商之间的价值分配。若未来订阅制、广告、交易佣金、按任务结果付费、软硬件一体化或垂直应用服务等模式快速发展,模型调用量、定价方式、成本归集及产业链议价关系均可能发生变化。

成本上升风险。推理服务成本受 GPU 采购价格、云算力租赁价格、电力成本、数据中心租金及网络费用等因素影响。若高端 GPU 供给持续紧张,或电力、存储和网络成本上升,而 Token 价格因市场竞争继续下降,推理服务商可能难以及时向客户转嫁新增成本,造成单位 Token 成本上升、毛利率承压及资本开支回收周期延长。

推理优化技术演进风险。低精度量化、投机解码、模型压缩等技术能够降低推理成本、提高生成速度,但其优化效果受到模型结构、任务类型、上下文长度和硬件支持程度影响。若压缩比例或推测策略设置不当,可能引发输出精度下降、拒绝率上升、长文本稳定性减弱等问题,进而影响客户体验和商业化部署,并增加模型评测、参数调优及故障回退成本。

[ 1 ] How Cresta drives millions of real-time, AI-powered contact center interactions with Fireworks

[ 2 ] How Cursor built Fast Apply using the Speculative Decoding API

[ 3 ] sehk26063002927_c.pdf

[ 5 ] Kimi-K3/LICENSE at main · MoonshotAI/Kimi-K3 · GitHub

[ 6 ] LICENSE · MiniMaxAI/MiniMax-H3 at main

本文摘自:2026 年 8 月 24 日已经发布的《Token 启示录(五):推理产业链深度 - 测算篇》

车姝韵 分析员 SAC 执证编号:S0080523050005 SFC CE Ref:BTM272

李铭姌 分析员 SAC 执证编号:S0080524070025 SFC CE Ref:BTQ513

于钟海 分析员 SAC 执证编号:S0080518070011 SFC CE Ref:BOP246

童思艺 分析员 SAC 执证编号:S0080524060015 SFC CE Ref:BVD355

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

张可 产业链 芯片 经济效益 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论