字母AI 5小时前
AI大厂,打起了“Token 奶茶大战”
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

模型越来越 " 像 ",得留存者得天下

过去两个月,AI 公司突然开始集体 " 发券 "。

北京时间 7 月 31 日,OpenAI 宣布将 GPT-5.6 Luna 的 API 价格下调 80%,Terra 降价 20%,Codex 和 ChatGPT Work 中调用这两款模型消耗的额度也随之减少。

一时间,Token 有了优惠券的既视感。它既可以是新品试喝券,也可以是系统故障后的补偿券。既能被装进会员套餐,也能做成 " 中杯、大杯、超大杯 ",额度用完以后再续一杯。

这很像刚刚外卖界的 " 奶茶大战 ":平台争相发券,看起来是在让用户占便宜,实际上争的是用户的消费习惯。

过去,AI 公司的竞争主要发生在参数、榜单和模型发布会上。但随着 Agent 用户暴增、模型差距缩小、迁移成本下降,技术能力则变成了一张入场券。

如今,AI 公司需要面对一个更直接的问题——当用户可以随时在不同 AI 工具之间切换,怎么让他留下来?

AI 公司开始 " 发券 " 了

这轮 Token 促销中,一个标志性的信号出现在 5 月 20 日左右。

当时,OpenAI 向 YC 创业公司提出,每家公司最高可以获得 200 万美元的 Token,条件是拿出一部分股权。

OpenAI 相当于用自家的算力参与投资,既押注这些创业公司,也希望它们从一开始就使用 OpenAI 的模型,日后继续成为付费客户。

6 月,Token 的用途更像电商优惠券了。Codex 因系统异常多扣额度后,OpenAI 两次统一重置用户额度,还额外赠送一次可留待以后使用的重置机会。

系统出了问题,OpenAI 就用额度来补偿用户,相当于送了一张 " 续杯券 "。

Anthropic 走的是另一条路。

Fable 5 最初只免费一周,但活动连续延期两次,Claude Code 周额度增加 50% 的活动也同步延长。7 月 20 日起,Fable 5 正式被纳入高阶套餐,原本用于新品推广的免费体验,最终变成了一项长期会员权益。

DeepSeek 的动作则更加直接。

V4-Pro 先永久降价 75%,用低价把开发者拉进来;6 月底又提出将采用峰谷定价,用分时价格控制使用量。MiniMax 则把 Token 打包成 20 美元、50 美元和 120 美元三档套餐,对应不同用量,像极了奶茶店菜单里的中杯、大杯和超大杯。

如今 OpenAI 也直接加入了降价行列。就在 7 月的最后一天,OpenAI 宣布 GPT-5.6 Luna 的 API 输入和输出价格均下调 80%,目前每百万 Token 分别为 0.2 美元和 1.2 美元;Terra 下调 20%,分别降至 2 美元和 12 美元。Codex 和 ChatGPT Work 的订阅价格及额度总量没有变化,但使用 Luna 和 Terra 时会少扣额度。旗舰模型 Sol 则维持原价。

这场 "Token 奶茶大战 " 不只发生在会员套餐里,对高价值企业客户,厂商送得更加直接。据《华尔街日报》报道,AI 客服平台 Pylon 的 CEO 透露,今年以来,公司从一家模型供应商处获得了价值约 160 万美元的免费 Token,另外两家也分别送出数万美元额度,甚至还有厂商提供数月无限量免费使用权。

模型降价和赠送额度并不新鲜。

但是在过去,这类活动通常集中在新品发布期,或者作为开发者扶持手段,热闹一阵便会结束。但最近两个月,送 Token 的方式层出不穷,Token 不仅开始承担类似优惠券的作用,被系统性地用于拉新、留存和补偿,也成了争抢企业客户的投标筹码。

无论厂商如何包装这一行为,都在说明同一件事,那就是 AI 公司已不满足于按量计价,而开始用更 " 互联网 " 的方式争夺用户。

这背后是单一订阅制越来越难覆盖差异巨大的使用强度。

轻度用户看中低门槛,重度用户则在执行长任务时患上额度焦虑。于是,会员档位、流量包、Credits 和峰谷定价一起出现。AI 公司不再只是卖模型,也开始研究消费巨头们熟稔的生意 —— 怎么让用户第一次下单,之后又该用什么方式让 TA 多买一杯,以及喝完以后给 TA 个什么理由回来。

AI 公司的战场没有离开技术竞赛,却明显多了一层商业化较量。

或者用更互联网一点的话来说,得留存者得天下。

模型越来越像,用户越来越花心

厂商突然在 Token 上加码,背后有两个变化。Agent 用户迅速增加,单个用户消耗的额度越来越高;头部模型在不少常用任务上的差距也在缩小,用户换平台比以前容易。价格、额度和会员权益,因此成了争夺使用习惯的工具。

首先,AI 用户仍在快速涌入。

截止 6 月初,Codex 每周活跃用户已经超过 500 万,是 2 月桌面应用推出时的 6 倍以上。

更值得注意的是,在这其中非开发者约占 20%,增速超过开发者的 3 倍。编程 Agent 的用途已经超出写代码,整理资料、写文档和分析数据也成了常见用法,有些人甚至会把任务全流程交给它完成。

用户消耗 Token 的方式也变了。根据 OpenAI 官方数据,到今年 5 月,80.6% 的 Codex 个人用户至少提交过一次相当于人类工作 30 分钟以上的任务,25.6% 提交过相当于 8 小时以上的任务,超过 10% 的用户每周同时管理过 3 个以上 Agent。

过去,用户向聊天机器人问一个问题再得到答案,流程简单且 Token 消耗量相对较小。现在,Agent 一项任务可能持续数小时。Token 的消耗从 "2G 时代 " 突然迈向了 "5G 时代 ",从前的额度显然不够看了。

Anthropic 对约 40 万次 Claude Code 会话的分析也显示,用户平均每周使用约 20 小时。2025 年 10 月至 2026 年 4 月,用它写文档和分析数据的会话占比从约 10% 翻到 20%,平均任务价值提高 27%。

随着 Agent 从偶尔尝鲜到进入工作流程,额度从附赠福利变成了刚需。

厂商开始争夺那些使用频率高、付费周期长的用户。截止今年 2 月,Claude Code 年化收入已经超过 25 亿美元,较年初翻倍,企业订阅数量增长 4 倍,企业客户贡献了超过一半收入。

谁能让这批用户更频繁地使用 Agent,谁就可能获得持续增长的 Token 收入。

问题是,这些用户并不忠诚。

AI 客服平台 Pylon 的 CEO 对此说得很直接:" 我完全看不到任何忠诚度。"

过去购买传统软件选定一家并持续付费的时代已经过去,企业现在通常会同时接入几家模型,具体任务交给哪一家,主要看效果和价格。

Cursor 的产品本身就是 " 与模型无关 " 的,用户可以在 OpenAI、Anthropic、Google 和开源模型之间切换。其负责人称,过去一项任务的最佳模型可能几个月才变化一次,现在每周都可能更换好几次。

这也解释了厂商为什么急着多送一些 Token。

Agent 用户正在快速增长,但多数人的使用习惯尚未定型,企业也没有决定最终把哪家模型接进业务。厂商争的是谁先成为个人用户的常用工具,以及企业工作流里的默认模型。

2026 年,的里雅斯特大学、伦敦国王学院和伦敦大学学院的研究者分析了 7156 个由编程 Agent 生成的 GitHub 拉取请求,结果显示没有任何一个工具能在所有任务中领先。很多时候,任务类型带来的差距,比工具之间的差距还大。

对用户来说,最好的模型越来越像一道动态选择题。

迁移也越来越容易。

DeepSeek 同时提供 OpenAI 和 Anthropic 兼容接口,MiniMax 的 Token 套餐可以直接接入 Claude Code、Cline 和 OpenClaw。

开发者甚至不必改变原来的工作界面,只要更换底层模型,就能把任务转走。

AI 公司愿意进行 Token 补贴,争夺的是用户的长期工作流。模型一旦进入企业系统,更换成本就会迅速提高,AI 产品的护城河就此建立,因此早期补贴具有明显的入口争夺意义。

模型能力负责把人吸引过来,补贴则负责给用户一个 " 先别走 " 的理由。

技术只是入场券,

AI 公司开始补商业课

但 Token 优惠和 " 奶茶券 " 有一个根本区别:奶茶多送一杯,成本相对清晰可控。但 Token 多送一亿,最后会转化成多少算力支出很难提前算清。

而算力在当下,依然非常、非常珍贵。

于是,有意思的景象出现了—— AI 公司一边发券,一边限流。

5 月 6 日,Anthropic 宣布与 SpaceX 达成算力合作,Claude Code 的 5 小时额度才得以翻倍,高峰期也不再下调限额。Fable 5 恢复后,最多只能占付费用户周额度的 50%,超出部分需要购买 Credits。免费体验从一开始就画好了成本边界。

MiniMax 的大额套餐同样不是无限使用。它同时设置 5 小时额度、周额度、Agent 并发上限和高峰期限流,并建议生产环境使用按量付费。

OpenAI 此次降价同样保留着清晰的成本边界。ChatGPT 和 Codex 的订阅价格及额度总量没有变化,只是使用 Luna 和 Terra 时扣除的额度减少。旗舰模型 Sol 价格未动,API 新推出的 Fast 模式则以两倍标准价格换取最高 2.5 倍的速度。

OpenAI 的多款 Agent 产品仍然共用额度池,复杂任务消耗更多。额度用完后,用户只能购买 Credits、重置额度、升级套餐,或者等下一周期恢复。

Token 不能无限发,用户又随时可能迁移,厂商只能把适用的人群、模型和时间切得越来越细。

Anthropic 用 Pro、Max 等档位区分额度,Max 内部又分为 5 倍和 20 倍用量,达到上限后还能继续购买 Credits。DeepSeek 把 V4 拆成 Flash 和 Pro 两档,对缓存命中、普通输入和输出分别收费,高峰时段价格还会翻倍。

模型厂商开始分层定价,企业也开始分层使用。

更棘手的是补贴能带来拉新,却很难买来忠诚。

厂商希望用免费 Token 换来长期调用,但企业也在迅速学会 " 薅完就走 "。Pylon 一边从多家供应商手里领取免费额度,一边明确表示看不到任何忠诚度。Cursor、Zoom 和 Hex 则把多个模型同时接入工作流,随时根据价格和效果重新分配任务。

厂商想把用户锁进一个生态,企业却在努力不被任何一家锁定。

微软对数万名工程师的研究发现,编程 Agent 的第一次使用往往由同事带动,但后续是否持续使用,主要取决于工程师是否真的有足够的编程需求,持续使用者合并的 PR 数量提高约 24%。真正能留下用户的,仍然是产品能否进入日常工作。

换句话说,优惠券只能把奶茶送到用户手里,不能保证他从此每天都喝。

AI 公司接下来要同时做两门生意:一边像消费平台一样用补贴做拉新和留存。一边像云厂商一样调配算力并守住毛利。

既怕用户跑,又怕用户用得太多,实在是一种别扭的处境。

Token 越送越多,用户却未必留下。用户真留下来,算力账单又会跟着上涨。最棘手的是,调用量和成本可以一起增长,收入却未必跟得上。

优惠总会结束。等到各家不再靠送额度拉人,还能留住用户并把这门生意做下去的,究竟是谁?

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论