8 月 10 日,Anthropic 取消了 Claude Sonnet 5 原定于 9 月生效的 50% 涨价计划。
Sonnet 5 在 6 月底发布时,API 首发价为每百万 Token 输入 2 美元、输出 10 美元,原计划 9 月 1 日起恢复至 3 美元和 15 美元。最新更新显示,这一涨价安排已取消,2 美元 /10 美元将继续作为长期价格。
此前,7 月 30 日,OpenAI 大幅下调 GPT-5.6 Luna 和 Terra 价格,其中 Luna 降价 80%,Sol 价格不变。与此同时,OpenAI 还通过减少 Codex、ChatGPT Work 的额度消耗,以及多次重置付费用户额度,提高同等订阅价格下的可用计算量。换句话说,API 和订阅两端都在变相降价。
但是,中国大模型的价格走势却完全相反。
8 月 11 日前后,DeepSeek 已在官方 API 定价页预告近期将整体涨价,并称 " 预计涨幅较大 "。
DeepSeek 目前仍处于全球前沿模型的最低价区间。V4-Flash 每百万 Token 输入 0.14 美元、输出 0.28 美元,根据 Artificial Analysis 测算,它完成一组 benchmark 的平均成本约 3 美分,远低于 GPT-5.6 Sol 的 1.86 美元。
7 月 16 日,月之暗面发布 Kimi K3 时,就把这款面向长程编程和复杂知识工作的旗舰模型放在了更高价格带:每百万 Token 普通输入 20 元、输出 100 元。连续两年不断向下的大模型价格曲线,出现了一次罕见的分叉。
美国头部模型开始压低价格,中国最新最强的一批模型却开始尝试提高单位价格。为什么?

图片由 AI 生成
OpenAI 和 Anthropic 的竞争
美国大模型这轮降价最表面的原因,依然是 OpenAI 与 Anthropic 之间越来越激烈的竞争。
6 月 11 日,在 OpenAI 正式降价之前,已有外媒消息称 OpenAI 内部正在讨论大幅削减 Token 价格,目的就是从 Anthropic 手里争夺用户。
到了 7 月 30 日,讨论变成现实。OpenAI 精准砍向承担大量 Agent 执行工作的 Terra 和 Luna。外媒在报道这次降价时直接指出,这会进一步向 Anthropic 施压:Claude 在企业和开发者市场占据重要位置,价格却处于市场较高一端。
Claude Code 和 Codex 争夺的是同一批开发者和企业工作负载。更大的使用规模除了带来收入,也会扩大真实任务和失败反馈的覆盖面。需要注意的是,OpenAI 已明确表示,Business、Enterprise 和 API 数据默认不用于训练,因此企业用户增长不能直接等同于训练数据增长。
更准确地说,模型厂商争夺的是工作负载反馈:更多真实任务会暴露 Agent 在哪些环节失败、重试或调用工具,从而反哺评测、产品和推理策略迭代。
Agent 市场开始形成一条新的竞争链条:
降低使用门槛→更多真实任务运行→暴露更多失败模式→改进 Agent →再争取更多工作负载
这也能解释 Anthropic 为何取消 Sonnet 5 原定 50% 的涨价。对于 Agent 主力模型来说,价格会直接影响调用频率;而在 Agent 场景中,更少步骤完成同样任务,本身就意味着更低成本。
但 OpenAI 和 Anthropic 之间的价格竞争,只解释了其中一部分。另一股越来越重要的压力,来自中国开放权重模型正在迅速扩大可替代的任务范围。
DeepSeek、Qwen、Kimi、GLM 等中国开放权重模型已经成为企业可以实际调用和部署的另一组选项。它们未必在所有任务上追平最强的 Claude 和 GPT,但正在快速占领一个更有战略价值的区域:哪些工作已经不再需要最贵的模型。
Citi 数据显示,OpenRouter 上开放模型处理的 Token 占比从 1 月的 34% 升至 6 月的 65%;当时平台最受欢迎的四个模型全部来自中国。这个数据只代表 OpenRouter 平台,虽然不能当做全球份额,但可以观察出多模型开发者的选择正在发生变化。
Palo Alto Networks CEO Nikesh Arora 当时直接向模型公司喊话:如果想赢得企业客户,就应该按照未来更低的 Token 价格提前定价。
Coinbase CEO Brian Armstrong 预计,未来 18 个月大约 80% 的 AI 工作负载会迁往成本低约 99% 的模型;旗舰模型仍然适合规划等复杂任务,大量执行工作并不需要如此昂贵的能力。
这里才是中国开放权重模型对 OpenAI、Anthropic 价格体系真正的压力。
规划和复杂推理交给 Claude 或 GPT,分类、信息抽取、简单代码修改、格式转换等大量步骤交给 DeepSeek、Qwen 或者其他便宜模型。过去一个任务 100% 的 Token 都流向某一家旗舰模型,现在其中大部分可能被 Router 分走。
中国模型压缩了美国旗舰模型能够收取高溢价的任务范围。
所以 OpenAI 这次保住 Sol 的 30 美元输出价,同时把 Luna 砍掉 80%,其实很有代表性。
守住最强模型的能力溢价,但也很不情愿把海量普通 Agent 工作白白让给更低价格的模型。

企业已经开始把模型当成可替换零件
斯坦福 Digital Economy Lab 今年 4 月发布的《Enterprise AI Playbook》,提供了一组很有意思的现实证据。
研究团队调查了 41 家机构、9 个行业、7 个国家的 51 个已经成功部署的企业 AI 项目。需要强调的是,这个样本专门研究成功案例,因此不能用来推导所有 AI 项目的平均 ROI。
其中一个结果非常值得模型公司警惕:42% 的项目认为底层模型完全可以替换。
在常规、规则明确的任务中,这一比例达到 71%;到了需要复杂推理、专业知识或高风险决策的高级任务,只有 18% 认为模型可以随意替换,35% 认为模型仍然是关键差异。
一位被斯坦福研究团队采访的科技公司运营负责人已经自己建立了 "multi-LLM gateway"。他给出的原则很简单:每一个请求,都在成本、准确率、相关性和延迟之间重新判断," 这个任务真的需要 deep search 吗?还是 mini 模型已经足够?"
另一家公司的负责人也有同样的思路,自己的平台搭好之后,可以随时在模型之间切换," 谁变得更好或者更便宜,就转向谁 "。
这恰恰是 OpenAI 和 Anthropic 现在面对的新市场环境。客户还在,但模型忠诚度正在下降。
" 完成一件工作多少钱 "
企业之所以越来越愿意切模型,还有一个原因:Agent 让 Token 成本被迅速放大。
聊天时代,一个问题对应一次或者几次模型调用。Coding Agent 接到一个任务之后,会读文件、制定计划、调用终端、修改代码、运行测试、查看错误,然后再循环。一次用户指令背后可能出现几十甚至上百次调用。
真正的成本越来越接近:任务成本 = Token 价格 × Token 数量 × Agent 步骤 × 重试次数。
对于 Agent,多出来的额度会直接变成更多工作。
DRadar 是一个由开发者社区维护的 Coding Agent 实测项目,它让 Codex、DeepSeek 等模型持续处理真实开源仓库里的软件工程任务,并由独立环境重新验证结果,同时记录成功率、耗时和成本。它的价值不在于给模型排一个绝对能力榜,而是把 " 能力提升要付出多少成本 " 放在同一套任务里比较。
当前结果显示,高推理档位通常能获得更高任务表现,但成本会更快上升;DeepSeek V4 Flash 这类低价模型虽然绝对能力略低,却能以低得多的成本完成相当一部分任务。对企业来说,这类测试更接近真实 Agent 经济学:并非每一步工作都值得调用最强、最贵的模型。

图:开源任务 DRadar 对真实软件工程任务的实测显示,模型能力提升伴随着明显的边际成本递增:高推理档位可以获得更高 IQ,但成本往往以数倍甚至数十倍增长;DeepSeek V4 Flash 等低价模型则落在 " 能力略低、成本大幅降低 " 的区域。数据来自开发者社区 DRadar,并非官方 Benchmark。
所以 OpenAI 频繁重置 Codex 额度,与 API 降价道理相同,就是降低每单位真实工作负载的获取成本。
这也让每百万 Token 多少钱开始失去一部分解释力。
企业真正关心的指标逐渐变成:Cost per successful task。
一个 0.5 美元的模型如果需要试 40 次,可能比 5 美元但 8 步完成任务的模型更贵。
斯坦福的企业研究也发现,高自主度系统已经出现明显的生产率优势。在 AI 自主完成 80% 以上任务、人类主要处理异常情况的 "Escalation" 模式下,中位生产率提升达到 71%;每个输出都需要人工审批,以及人与 AI 持续协作的两种模式,中位提升均为 30%。研究者同时提醒,这与任务选择有关——高频、结果可验证、错误可恢复的工作更适合高自动化。
Agent 已经改变了模型经济学的计量单位。
DeepSeek 和 Kimi,两条不同的 " 涨价 " 路线
理解这一点以后,再看中国模型涨价,会发现 DeepSeek 和 Kimi 其实代表两种完全不同的商业选择。
DeepSeek 最大的资产,是过去一年用极低价格建立起来的巨大使用规模和开放生态。
它现在仍然便宜得惊人。Artificial Analysis 测算 V4-Flash 跑完其 benchmark 平均只需约 3 美分。即便价格翻几倍,它和美国旗舰之间仍然存在足够宽的价格带。
所以 DeepSeek 目前还无法证明自己已经拥有很强的定价权,但它已经开始拥有测试定价权的资格。
如果价格上涨两三倍,调用基本留下来了,说明 DeepSeek 的全球采用已经超出了 " 因为便宜所以用 ";如果大量任务迅速迁移到 Qwen、Kimi、GLM 或者其他模型,极低价格在此前采用中的作用就比想象中更大。
Kimi K3 这里,月之暗面从一开始就在尝试给一款长程 Coding、Agent 和知识工作旗舰更高的价格。K3 开放权重,同时 API 输出价格达到 100 元 / 百万 Token。
关于定价逻辑,接近 Kimi 的人提到:" 定价主要是看模型成本。在同一个使用场景的竞品都会综合看一下,算一下自己的成本,给出一个价格。原则还是要赚钱的。但是 deepseek 不在考虑范围内,场景不一样。"
K3 的需求至少出现了一个早期信号。模型发布仅数日后,由于需求超过计算能力,Moonshot 一度暂停新的 Kimi 订阅,把容量优先留给现有付费用户。
虽然这还是不足以证明 K3 已经获得成熟定价权,但它说明中国开放权重模型进入全球市场,不再只有 " 价格做到美国模型十分之一 " 这一种打法。
Token 的单价,已经越来越不重要
价格变化只是表层。判断一个模型的商业位置,更重要的是看它是否形成了稳定、持续并能够转化为收入的真实使用。
但目前并不存在覆盖全球模型使用量的完整统计。OpenRouter 只能反映部分第三方调用,Hugging Face 更偏向开放权重生态,云平台披露的数据也各有边界,任何单一指标都很难还原模型的实际采用情况。
因此,我们尝试做一个简单的模型采用度指数(Model Adoption Index,MAI),作为观察市场的参考,综合真实调用、生产部署、分发渠道、开发者生态、商业变现和持续使用六个维度进行打分;Benchmark、媒体热度和搜索指数不纳入,因为它们更多反映模型能力或市场关注度。

MAI 基于目前能够获得的公开信息进行分析性评分,并非行业统计标准。对于刚发布的模型,生产部署和持续使用数据还没有充分形成,也还需要结合证据完整度和上线时间理解分数,不能简单作为模型排名。

这张表真正值得关注的地方,不在于 Claude 是 91 分、DeepSeek 是 81 分,而在于这些分数背后的 " 采用结构 " 已经明显分化。
Claude 的优势集中在企业生产部署和分发渠道;DeepSeek 更像是靠低价和开放生态把使用规模做大,现在要验证这些调用能不能承受更高价格;Kimi 从一开始就在尝试另一条路,开放权重负责扩大分发,高价 API 和商业合作负责承接更高价值的需求。
这也提醒我们,Token 调用量和 Token 的绝对定价越来越难直接代表商业价值。一个模型调用很多,可能只是因为便宜;一个模型价格很高,也不等于真正有定价权。
所以再看今天这场价格分叉,美国模型降价、中国模型涨价,背后其实有三股力量同时发生。
OpenAI 和 Anthropic 正在正面争夺 Agent 入口。中国开放权重模型又不断扩大廉价模型可以完成的任务范围。Agent 和多模型 Router 则让企业第一次能够真正把每一步工作分配给性价比最高的模型。
价格因此开始向两边挤压。
美国高端旗舰模型过去享有的溢价正在向下压;中国开放权重模型长期依靠的巨大价格优势开始向上收缩。
最终的市场可能既不会出现所有 Token 无限趋近于零,也不会允许最强模型一直维持几十倍溢价。
真正被重新定价的是 Task 本身,每天到底有多少真实工作,愿意持续运行在某个模型或某个模型组合上。
(转载自:腾讯科技)


登录后才可以发布评论哦
打开小程序可以发布评论哦