大模型开始算 ROI。
过去两周,AI 行业像被按下了快进键。
9 月 1 日到 9 月 11 日,海内外 7 家头部模型厂商迭代了新模型。过去,大模型的升级周期以年计算,后来缩短到几个月,如今已经开始以周为单位。模型的更新速度,甚至快过了开发者完成一轮工作流评估的速度。
新一轮迭代之后,从榜单看全球大模型当前的竞争格局,呈现出两个不同的切面。在衡量模型能力的智能指数榜单上,排在前五的仍然是海外的模型,前十里只有智谱和 kimi。
而在 API 聚合平台 OpenRouter 上,中国大模型的周调用量已经连续 20 周超过美国,在公开可见的调用量前十榜单中,中国模型占据至少 7 席,合计调用量占比超 70%。一年前,OpenRouter 调用量前十中只有 2 个中国模型,一年后局面几乎完全翻转。
中国模型并没有在技术能力上领先,但却成为越来越多开发者 " 用脚投票 " 的选择。在这背后,瑞银观察到,在 AI 大规模落地的过程中,企业与用户的关注点逐渐从能力转向更高的投入产出比,"Token ROI"(衡量 AI 投入产出比的指标)成为讨论的关键词。
Github 开源项目 xiaobei 的开发者今年初还在用 Claude 作为核心工作调用模型,但他对第一财经记者表示,5 月开始他的工作流就已经全部切换为国内模型了," 大多数应用层的工作,国内模型已经能胜任,用不上最顶尖的海外旗舰模型。" 除非是复杂的底层任务,否则没有必要为顶尖模型支付数十倍的成本。
一年完成反转,中国模型赢下调用量
从 9 月 1 日到 9 月 11 日,不到两周的时间,海内外 7 家模型厂商迭代了新模型,全球 AI 头部公司又将竞争往前推了一步。
9 月 1 日,Anthropic 宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1;随后 9 月 2 日,谷歌宣布推出 Gemini 3.8 Flash,同一天,沉寂许久的 Meta 推出新模型 Muse Spark 1.3;9 月 3 日,OpenAI 跟进发布旗舰模型 GPT-6 Astra,OpenAI 总裁称 Astra 可能是 "AGI 时代的开始 "。
国内厂商也在同步提速。9 月 2 日,千问大模型宣布 Qwen3.8-Max 升级到 0902 版本;9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型;9 月 11 日,Kimi 发布 K 2.8 Preview,官方称综合性能接近旗舰 K3。
密集更新之后,从榜单来看,模型能力的第一梯队仍主要由海外厂商占据,而中国模型还在追赶中。
根据 AI 基准测试机构 Artificial Analysis 的最新数据,在智能指数榜单上,前五名均为海外模型。Anthropic 最新发布的 Claude Fable 5.1 排名第 1,OpenAI 的 GPT-6 Astra 位列第 2,Meta 的 Muse Spark 1.3 排名第 4,马斯克旗下的 Grok 4.6 位列第 8。
中国模型正在缩小差距,但还未取得绝对领先。智谱 GLM-5.3 以 45 分排名第 7,与第一名 Fable 5.1 相差 8 分,是目前排名最高的国产模型;月之暗面 7 月发布的 Kimi K3 位列第 9。Qwen3.8、DeepSeek V4.1 Flash 和 MiniMax M3 则分别排在第 13、第 14 和第 19 位。
如果只看能力榜,全球大模型的竞争格局似乎没有发生根本变化。但把视角切换到实际调用量,情况就不同了。
AI 模型 API 聚合平台 OpenRouter 近期公布了上周平台上的调用量数据。9 月 7 日至 13 日这一周,全球 AI 大模型总调用量达到 127 万亿 token,环比增长 10.4%。其中中国大模型周调用量近 61.2 万亿 token、环比增长 7.9%;美国大模型周调用量 21.8 万亿 token、环比增长 31.6%。
这是中国大模型周调用量连续二十周超过美国,居全球首位。在可见的调用量前十榜单里,中国模型占据 7 席以上,合计占比超 70%。其中,腾讯混元 Hy4 Preview 周调用量位列第 2,智谱 GLM-5.3 Flash 排名第 3,DeepSeek V4 Flash 位居第 4。
刚刚发布的 DeepSeek V4.1 Flash 也迅速进入榜单,周调用量排名第 6。这款模型直到 9 月 10 日才正式发布。OpenRouter 称,V4.1 Flash 上线后 24 小时内处理了约 1 万亿 Token,其发布 48 小时内的调用量有望达到 2.8 万亿 Token,可能创下平台模型发布 48 小时内调用量的新高。
" 这很有趣,AI 领域的用户似乎在几个小时内、而非几天,就将(DeepSeek)新模型切换到他们的工作流程和应用中。" 有开发者评价道。
即时迁移背后首先是价格。OpenRouter 披露,V4.1 Flash 约 90% 的调用量来自缓存读取,按市场定价计算,成本约为每百万 Token 0.006 美元,比 GLM-5.3 Flash 等相近模型低约 80%。
经历一轮涨价与降价之后,DeepSeek 依然扮演着大模型市场 " 价格屠夫 " 的角色。
当然,OpenRouter 并不是全球大模型市场调用量的全部。其数据只统计经由平台路由的流量,厂商自有 API、云平台、私有化部署以及直接面向消费者的应用和网页产品均未纳入。因此,这些数据不能直接等同于全球市场份额。
但抛开数据规模,如果拉长时间,增长和变化的趋势仍然足够明显。
OpenRouter 每周处理的 Token 量,从 2025 年 9 月中旬的 4.92 万亿增长至 2026 年 9 月中旬的 127 万亿,一年增长接近 25 倍。伴随市场整体扩张,流量也在持续向中国模型迁移。
2025 年 9 月 22 日当周,OpenRouter 调用量排名第一的厂商还是谷歌,份额约 39%,OpenAI 和 xAI 紧随其后,美国厂商合计占据约 80% 的份额,中国厂商占比不足 20%。
到了今年 9 月,DeepSeek 已经以 25.4% 的份额升至第一。中国厂商在 OpenRouter 上的整体份额超过 45%,美国厂商约为 43%。
在这个开发者可以自由选择模型的开放市场里,中国模型已经成了流量分配的主力,市场格局被逐步改写。
能力之外,大模型开始拼 ROI
市场的调用量从海外模型转向中国模型,一个核心原因是模型开始大规模落地,AI 从测试进入业务流程中时,成本和性价比就会成为重要的衡量因素。
在近日的一场交流中,瑞银证券中国互联网行业分析师熊玮对记者表示,2026 年下半年,"Token ROI" 正在成为行业讨论的关键词。在使用 AI 大模型的过程中,企业与用户此前的关注点单纯是能力,但今年逐渐向追求更高的投入产出比过渡。
今年上半年一个很流行的词是 "token-maxxing",当时不少大厂鼓励员工尽可能多地使用 AI,加快企业内部的 AI 采用。" 但进行了一个阶段,发现这不一定是最优的策略,因为这一方面会造成 AI 账单居高不下,另外很难衡量这些 token 用量能带来的经济价值。" 熊玮观察到。
从年中开始,模型的使用方,包括企业、开发者、用户等开始强调 "token optimization",即平衡性能领先和性价比,对 AI 账单也有了更严格的投入产出要求。
这一变化正在推动模型市场走向分层。
对于高价值、高风险或者对质量要求最高的任务,企业仍然愿意使用全球最顶尖的模型。但在真实工作环境中,还存在大量价值和风险相对较低的工作,这些任务不需要每次都调用最强模型,却对价格、速度和稳定性更敏感。这恰好是中国模型更容易切入的市场。
熊玮提到,在与海外投资者交流时,发现一些全球领先的 IT 企业已经开始考虑将中国开源模型纳入实际工作流。尤其在今年 5 月至 6 月,这一趋势明显加快,越来越多企业和开发者开始使用中国开源模型搭建工作流或执行具体任务。
开发者的反馈也印证了这种迁移。
在今年初龙虾(OpenClaw)爆火时,第一财经记者和开源项目 xiaobei 的开发者交流,他曾提到,自己在用 Claude Code 构建 AI 智能体的核心团队,只有简单的任务交给国产模型。但近期交流时,他表示,自己已经在 5 月开始将工作流全部切换为国产模型了,主力是智谱的 GLM 5.3、阿里千问的 Qwen 3.8 Max 以及 DeepSeek 的 V4.1Flash。
"99.99% 的编程任务对于现在 GLM 5.3 这一档的模型来说,都称不上是较难的任务。" 上述开发者认为,对于包括他在内的绝大多数用户,日常工作中已经很少遇到国产模型无法胜任的任务。
他也承认,一部分开发者仍然优先使用 Claude 和 OpenAI 的旗舰模型。这既可能来自长期形成的使用习惯,也可能是因为他们需要处理更复杂的底层任务,例如渲染引擎、新的操作系统内核,或者非常复杂的工业软件核心等。
纵观当前模型市场,真实情况是,国产模型并未在所有任务上替代海外模型,但已经吃下了越来越多 " 不必使用最强模型 " 的工作。成本是其中最直接的推动力。以公开 API 价格计算,国内主流模型的平均定价大约只有国际同行的 10% 至 20%。
AI 评测机构 Arena.ai 近日表示,DeepSeek 最新的 V4.1 Flash 在 Agent Arena 中位列开源模型第三。其每项任务的成本中位数仅为 0.07 美元,重新划定了性能与成本的帕累托前沿(最优权衡)。
与 Fable 5 等更强模型相比,V4.1 Flash 在成本降低 97% 至 99% 的情况下,仍保留了对方 35% 至 54% 的净改进效果。部分顶级模型完成同一项任务的成本,是其 37 倍至 76 倍。
" 对于初创公司构建智能体工作流来说,超过 90% 的成本降低是唯一能在不烧光风投资金的情况下实现规模化的方法。" 有海外用户评论道,DeepSeek" 真的抓住了要害 "。
值得注意的是,根据瑞银的调研,虽然中国模型厂商性价比较高,但并不是贴钱来扩大模型的采纳率。他们发现,中国模型厂商的 API 业务毛利率大多处于 20% 至 40% 区间。也就是说,厂商是通过模型架构创新、优化训练和推理效率来改进盈利并保持性价比的。
当然,低价本身并不是护城河,中国厂商还不能宣布赢下这场 AI 竞赛。能力榜的头部位置仍由海外模型占据,但在更广阔的应用市场里,中国模型已经通过成本优势抢到了座位,并正在争夺默认入口。


登录后才可以发布评论哦
打开小程序可以发布评论哦