" 下一个风口,卖 Token。" 这句印在展商海报上的醒目标语,道出了本届 WAIC(世界人工智能大会)的商业预言。
Token(词元)原本是 AI 模型消耗和产出的最小计量单位。从 WAIC 2026 看,Token 正演变为衡量 AI 生产力的核心单位。
随着产业重心逐渐从集中训练向规模化推理延伸,算力服务也开始从按卡时出租,向按 Token 交付演进。作为连接底层算力与上层应用的 AI 生产层,Token 工厂正在超越单纯算力租赁的范畴,成为大模型时代新的商业形态。
" 大厂的 Token 只支持他们的模型,无法通用。" 有 Token 工厂展商告诉 21 世纪经济报道记者,一方面,用户在 Token 工厂通过单一 API 接口即可调用国内外所有主流大模型,根据任务匹配最优模型;另一方面,工厂能屏蔽市场算力波动风险,为用户提供更稳定、成本更优的兜底服务体验。

图片来源:IC photo
走进 WAIC 展厅,几乎每一家算力厂商的展台都有一面 "Token 工厂 " 的主题墙。但各家打法和定位并不相同。
软通动力在 WAIC 上展出了北京壹号 Token 工厂,一期规划每日 Token 产能达 1.4 万亿,由软通智算承建的粤港澳大湾区公共算力服务平台及韶关 Token 工厂与北京壹号 Token 工厂形成战略协同。
九章云极目前在全球计划部署覆盖 10 余个智算中心,平台总算力规模约 30 EFLOPS,日产超过 500 亿 Token。其 "AI 工厂 " 构建了 " 训练工厂 " 与 "Token 工厂 " 双引擎闭环,前者以强化学习为底座解决 " 造模型难 ",后者将大模型封装为标准化 Token 服务,将 AI 生产从依赖个别专家的研发模式,推向可复制的标准化流水线。
也有厂商通过回收 GPU 算力卡,实现 Token 的规模化生产。天罡智算展台工作人员介绍道,该公司整合已退役但仍有利用价值的冗余算力,为客户提供低成本算力。" 针对老化显卡算力产出衰减的问题,我们通过算力调优技术提升其性能——例如将原仅剩 20% 性能的显卡恢复至 40% 甚至 60%。"
相较于建数据中心、回收算力卡这样的重资产(IaaS/ 硬基建派)模式,还有厂商选择了轻资产(MaaS/ 软服务派)模式。
硅基流动展台工作人员告诉记者,其 Token 供应平台从上游租赁算力,生产 Token 卖给下游。其已累计支持超 170 个主流 AI 模型,兼容英伟达、华为昇腾、沐曦与摩尔线程等多元算力,日均 Token 吞吐量超万亿。
调度闲时算力也是 Token 工厂的秘密武器。厂商通过算力调度系统,深夜连接到处于负载低谷期的超算中心。当企业用户在北京时间凌晨两点发送大批量文档处理请求时,Token 工厂并不会启动自家的昂贵机组,而是将任务以极低价格交由此时闲置的算力资源处理。
无论是自建、回收还是租赁,Token 工厂的最终出口只有一个:将算力通过统一的标准接口,封装成明码标价的 Token,卖给企业和应用开发者。
曾经,用户被锁定在模型各自的 Token 套餐中,不得不应对参差不齐的定价和各有侧重的模型能力。
而 Token 工厂改变了游戏规则:它聚合了 GLM、DeepSeek 等开源大模型,也提供 OpenAI、Anthropic 兼容接口。这使得用户能够通过单一 API 入口使用多家大模型,按需切换、按量付费。
在 WAIC 上,有 Token 工厂旗帜鲜明地喊出:" 比云厂商更便宜,比 OpenAI 更通用。"
所谓 " 便宜 ",源于 Token 工厂对算力供给侧的极致压缩。不同于云厂商通用化的标准化服务,Token 工厂往往自建或深度运营低成本算力中心。它们通过大规模回收高性能显卡、调度 " 闲时 " 算力资源,将原本高昂的推理边际成本压缩了数倍。没有了云厂商的中间商差价和品牌溢价,Token 工厂得以以低于市场的价格输出 Token。
中邮证券表示,传统算力租赁商业模式下,服务商收益存在刚性天花板。Token 工厂通过平台级调度、算力软硬件融合与模型推理优化,将其核心指标从单纯的算力规模转向每瓦 Token 吞吐量和能效比;在 Token 工厂模式下,企业有望获得远超传统租赁模式的净利率。
而 " 通用 ",则归功于多源聚合。Token 工厂构建了一个开放的 " 模型超市 ",通过标准化兼容接口,打破了不同厂商间的技术壁垒。
这能够实现从 " 人找模型 " 到 " 任务找模型 " 的转变。天罡智算展台工作人员告诉记者,该公司即将推出 " 智能路由 " 产品:面对需要同时生成文本、图片、视频的综合需求,由于不同模型在各领域表现各异,传统方式需人工切换调度。智能路由可以自动拆解任务,精准匹配最优模型,如将文本需求指向 DeepSeek,图片生成则调用豆包,实现多模型协同作业。
开源证券研报认为,当前节点 "Token= 算力 = 营收 " 逻辑已得到充分验证,算力需求侧持续旺盛,供给侧国产自主突破算力卡瓶颈,政策规划前景明朗。对 AIDC 公司而言,Token 工厂 / 分发平台的落地意味着算力利用率和计费效率提升,利好具备核心城市指标、绿电配套和上架率提升的第三方 IDC 及智算中心运营商,商业模式有望向 " 算力运营 +Token 变现 " 升级。
由于 Token 吞吐量直接决定了 Token 工厂的收入能力和资本回报率(ROI),如何高效利用有限资源、最大化单位 GPU 和单位功耗所产生的 Token 数量,正在成为竞争焦点。
是石科技在 WAIC 上展出了 " 国产 Token 优化工厂 "。展台工作人员告诉记者,Token 优化工厂通过优化算子与模型性能,提升 Token 生产速度——例如将单位时间产出 Token 从 30 个提升至 35、40 甚至 50 个。
长江证券研报指出,GPU 性能决定了 Token 工厂的理论生产能力上限,而真正决定既定的算力资源能够释放多少价值的,则是包括调度平台、推理引擎、编译器和模型优化在内的 AI 系统软件栈。
硅基流动展台工作人员也告诉记者,该公司自研了推理加速引擎,对模型推理过程进行深度优化,在相同硬件条件下显著提升单位 GPU 的 Token 产出效率。
九章云极则根据 Token 的能力层级,将 Token 分为消费级、专业级和前沿级三类:消费级 Token 适合大众场景,量大管饱;专业级 Token 封装了行业知识与业务逻辑,适合金融、制造等高要求场景;前沿级 Token 面向复杂任务自动化与科研探索,适合需要深度推理、多步规划的高端场景。其 Token 工厂将大模型封装为消费级、专业级、前沿级三类标准化 Token 服务,分别定价。
随着 Token 工厂模式的兴起,行业目前仍面临一个核心痛点——标准的缺失。
在计量层面,九章云极提出了度算力(DCU)这一计量单位。展台工作人员告诉记者,1 DCU=312 TFLOPS × 1 小时,把英伟达、昇腾、海光等不同芯片的算力统一折算到了同一把尺子上。算力投入用 DCU 度量,智能产出用 Token 计量——中间的差值,就是 AI 工厂 " 变魔术 " 创造价值的地方。
在评测层面,软通动力则聚焦于算力集群的真实服务能力,发布了 " 软通动力 Token 工厂性能基准 "。这是全球首个面向智能体长时运行、以混沌负载刻画为核心、包含三类测试方法和分领域数据集的完整算力评测体系。
一个更深层的共识逐渐浮现:竞争逻辑正从 " 拥有多少 GPU" 转向 " 如何让 GPU 生产更多 Token" 以及 " 谁能把 Token 转化为真正的生产力 "。


登录后才可以发布评论哦
打开小程序可以发布评论哦