邬话不说 5小时前
AI价格屠夫涨价,免费时代终结?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

邬话不说 | 2026 年 8 月 10 日

8 月 6 日,DeepSeek 发了一条不足 50 个字的公告,内容简单粗暴:「计划近期整体上调 DeepSeek API 服务定价,预计涨幅较大。」

就这么一句话,开发者社区炸了。

要知道,DeepSeek 在过去两年里扮演的角色叫「价格屠夫」。2024 年 4 月,它把 API 价格拉到输入 1 元 / 百万 Token、输出 2 元 / 百万 Token 的行业地板价,去年 9 月又降了 50%。整个行业被它带着一路往下卷,卷到不少创业公司怀疑人生:这钱到底怎么赚?

现在,价格屠夫突然说不玩了。

不是不想卷,是卷不动了。OpenCode 平台数据显示,仅 8 月 1 日一天,DeepSeek-V4-Flash 的 Token 处理量就冲到 8 万亿,其中 5 万亿来自免费试用额度。 OpenRouter 当周数据更夸张:DeepSeek-V4-Flash 新旧版本合计调用量 11.31 万亿 Token。

调用量爆炸的背后是智能体大规模落地。单次 Agent 任务的算力消耗能达到普通对话的 100 倍。用户越多,烧钱越快。说白了,这不是涨价,是算力被吃干抹净之后的应激反应。

而就在 DeepSeek 宣布涨价的前后,中国 AI 行业正在上演另一场更疯狂的戏码——8 周内连发 5 款旗舰大模型,硅谷企业排队来中国「进货」。

这篇文章,我们拆开来看三件事:DeepSeek 涨价背后的行业真相、中国大模型「八周五连发」的技术暗线、以及这场变局对每一个人的真实影响。

一、价格屠夫不装了:从「白送」到「涨价」,发生了什么?

DeepSeek 这一路的价格轨迹,放在任何行业都堪称魔幻。

2024 年 4 月,率先把 API 价格打到「1 元 /2 元」级别,行业震惊。2024 年 9 月,再降 50%,几乎等于白送。2026 年初,DeepSeek-V4-Pro 推出 2.5 折限时优惠,一个月后直接转为永久价格。然后 6 月底,峰谷计费上线,工作日高峰价格翻倍。再到 8 月 6 日,正式预告「较大幅度涨价」。

从疯狂补贴到逐步收紧再到全面涨价,这条路走了两年,但趋势拐点其实在 2026 年上半年就出现了。

智谱在年内已经连续三次上调 API 价格。 月之暗面 7 月中旬发布 Kimi K3 时,新一代 API 定价直接比上代涨了 3 到 4 倍。腾讯混元、阿里云、百度智能云的 AI 算力相关产品价格也全线调涨。

整个行业的补贴周期,正在同步关闭。

为什么关?两个数字解释一切。

第一个数字:8 万亿。这是 DeepSeek-V4-Flash 在 OpenCode 平台上的单日 Token 处理量,其中超过 60% 是免费额度。换算成算力成本,这个数字能让任何一家公司的 CFO 睡不着觉。

第二个数字:100 倍。Agent 任务的算力消耗是普通对话的 100 倍。以前大家调用大模型是「问一句答一句」,消耗可控。现在 Agent 模式是「让模型自主规划、多步推理、调用工具、循环执行」,一次任务跑完可能已经调用了上百次 API。

智能体越强,烧钱越快。这是一个无解的物理规律。

有意思的是,DeepSeek 选择在涨价前把 V3.2 正式版发了出来。8 月 7 日上线的 V3.2,在 Chatbot Arena 上拿到 ELO 1425 分,SWE-bench Verified 的 Agent 评测达到 52.5% ——在编程和自主任务执行这两个核心场景,已经跟国际一线平起平坐。

先亮肌肉,再谈价格。这招聪明。

开发者群体对涨价的反应其实比预想中平静。核心原因很简单:太便宜了,涨完还是便宜。同等业务负载下,国产模型的调用成本依然是美国闭源产品的 1/50 到 1/100。 Claude 收 25 美元的工作量,DeepSeek 只要 0.18 美元。涨完价之后哪怕翻倍,依然是 0.36 美元对 25 美元—— 68 倍的差距。

真正受冲击的,是那些完全依赖超低价 API 撑毛利的小型 AI 应用。过去两年,大量团队用近乎免费的 API 包装一个前端就上线,赚的是「模型成本红利」的钱。现在红利退潮,裸泳的人该上岸了。

二、八周五连发:中国大模型的「闪电战」是怎么打的?

如果说 DeepSeek 涨价是供给端的信号,那「八周五连发」就是需求端的底气。

从 6 月初到 8 月 5 日,短短 8 周内:

阿里 Qwen3.8-Max(8 月 3 日):2.4 万亿参数,千问系列最强旗舰,编程和专业办公能力大幅跃升

月之暗面 Kimi K3(7 月中旬):长文本理解和数据解析能力被海外开发者广泛验证

DeepSeek-V4-Flash & V3.2(7 月 31 日 /8 月 7 日):Agent 能力大幅增强,运行成本全球最低

智谱 GLM-5.2(7 月):SWE-bench Pro 编程基准突破,代码能力进入全球第一梯队

字节 Seedance 2.5(8 月初):视频生成单次时长翻倍至 30 秒,支持多轮延长

五款模型,款款对标全球前沿。放在两年前,出一款就得吹半年。现在两个月出五款,行业已经麻了。

这轮密集迭代背后,有三条技术暗线值得注意。

第一条暗线:MoE 架构全面普及。 混合专家模型不再是实验室玩具。国产厂商把 MoE 玩出了花——用更少的激活参数达到更大的等效模型规模,推理成本不升反降。DeepSeek-V4-Flash 之所以能在 Agent 场景做到全球最低成本,核心就是把 MoE 的路由效率和推理侧的 KV 缓存优化做透了。

MoE 的精妙之处在于「按需激活」。传统稠密模型每次推理都要调用全部参数,哪怕你只是问个「今天天气怎么样」。MoE 把模型拆成若干个「专家」子网络,每次推理只激活其中几个。DeepSeek 的工程团队在这一块做到了极致——激活参数占比、路由延迟、负载均衡三个维度同时优化,这在工程上是出了名的难。

第二条暗线:开源权重成了标准配置。 这五款模型几乎全部提供开放权重版本。海外开发者可以直接下载权重部署在自有服务器上,完成微调和二次开发。跟美国闭源厂商「只给 API 不给模型」的模式相比,这是降维打击。

别忘了,就在 DeepSeek-V4-Flash 发布前,阿里还官宣了 Qwen3.8-27B 的开放权重计划—— 8 月 10 日当周正式放出。27B 参数这个尺寸特别有意思:对复杂推理任务够用,又能在单节点 GPU 上跑起来。说白了就是企业私有化部署的甜点区——不需要建机房,不需要天价显卡,一台高性能工作站就能把大模型跑在自己公司里。

第三条暗线:工程优化的含金量不输基础研究。 国内模型这次冲上来的不是靠堆卡,而是靠架构创新和推理侧优化。单卡效率、通信调度、量化精度,这些「脏活累活」才是真正拉开成本差距的地方。

以 DeepSeek-V4-Flash 的定价为例。在 Agent 场景下,它的推理成本之所以能做到全球最低,靠的就是把推理链路上的每一个环节都拆开重新做了——从 Prompt 压缩到 KV 缓存复用,从投机解码到动态批处理,每个环节省一点,积少成多就是百倍差距。

斯坦福《2026 人工智能指数报告》给出的结论:中美顶尖前沿模型的综合性能差距已经缩小。 这个数字被多家媒体引用过,但真正震撼的是它背后的含义——美国每年数百亿美元的 AI 投资,没有换来决定性的技术代差。

而且,这差距正在以肉眼可见的速度消失。智谱 GLM-5.2 的编程能力在 SWE-bench Pro 基准上跻身全球第一梯队。Kimi K3 的长文本处理和多文档分析被海外开发者社区反复验证。Qwen3.8-Max 在多项评测指标上直接对标 Anthropic 旗舰。用 21 世纪经济报道的话说:「当性能已经能满足绝大多数企业的日常需求,极致的成本和灵活的部署方式,就成了选型的决定性因素。」

还有一个容易被忽略的细节:迭代节奏本身的差距。 OpenAI、Anthropic 的旗舰产品更新周期以年计—— GPT-4 到 GPT-4o 隔了 14 个月,Claude 3 到 Claude 3.5 也差不多。而国产厂商在 8 周内连发 5 款前沿模型。高频迭代带来的竞争压强,根本不是单款模型跑分能衡量的。

三、硅谷反水:美国企业为什么排队来「进货」?

趋势最狠的佐证来自对手的阵营。

OpenRouter 平台的数据显示了一个让人意外的趋势:47% 的用户是美国开发者,中国用户只占 6%。 美国企业调用中国大模型的 Token 占比,从 2025 年上半年的 4.5%,飙升到 2026 年 2 月后的稳定超过 30%,峰值一度冲到 46%。

这不是几个极客在玩票。这是实打实的商业迁移。

6 月底,加密货币交易所 Coinbase 的 CEO 布莱恩 · 阿姆斯特朗公开确认,公司已将月之暗面 Kimi 和智谱 GLM 设为全体工程师的默认大模型。内部调研显示,91% 的工程师日常工作并不需要 GPT 或 Claude 的极限性能。

7 月初,外卖巨头 DoorDash 联合创始人方安迪透露,公司在内部测试了 Kimi K2.6,计划将客服和基础编码任务切过去。

更早行动的 Airbnb,CEO 切斯基 2025 年 10 月就公开表示公司大量使用阿里通义千问系列。

最激进的是 AI 创业公司 Lindy,6 月宣布已将 100% 业务流量从 Anthropic Claude 迁移至 DeepSeek-V4,推理成本直接下降约 90%。

你看,企业做这种决策的逻辑很简单:性能够用,成本暴降。

Coinbase 的调研结论非常有代表性—— 90% 以上的业务场景不需要最高性能模型。Claude 的很多「极限能力」在日常工作中根本用不上。既然用不上,为什么花 100 倍的价格?

这里面还有一个深层逻辑:部署自由度。 美国闭源模型只给 API 接口,企业没有底层模型权限。接口涨价你就只能被动接受,限流你就只能排队。而中国开源模型可以直接下载权重,部署在自有服务器上,数据不出内网,版本迭代自主可控。

对于金融、医疗、政企等对数据安全极度敏感的行业来说,这个差异是选型的决定性因素。

当然,美国监管层的态度跟市场选择形成了鲜明反差。一边是硅谷企业出于降本增效自发选中国模型,另一边是监管机构试图用政策手段干预。不少美国初创公司公开表态:如果强制封禁中国开源模型,大量中小 AI 项目直接面临生存危机。

市场逻辑和政策逻辑的拉锯,会是未来一两年最值得关注的变量。

四、OpenAI 的反击:最大预训练模型 Doug 曝光

这边中国大模型在商业市场高歌猛进,那边 OpenAI 也没闲着。

8 月 9 日,长期跟踪 OpenAI 的 X 用户 ChrisGPT 爆料说,OpenAI 正在推进一个代号「Doug」的新一轮大型预训练模型——这将是 OpenAI 迄今规模最大的一次预训练项目,与 GPT-6 不是同一个模型。按他的说法,GPT-6 很可能就是前一天因安全问题被紧急暂缓发布的 Astra,而 Doug 最迟可能在 11 月前推出。

更早之前,7 月 9 日,半导体研究机构 SemiAnalysis 在一份机构客户备忘录中写道:「OpenAI 已经克服了预训练方面的问题,一个代号为 Doug、规模大得多的模型正在积极推进。」

如果信息准确,这意味着一个非常重要的技术拐点。

自 2024 年 5 月 GPT-4o 发布以来,OpenAI 接近两年没有完成一轮能够被广泛部署为下一代主力模型的全规模预训练。o1、o3 乃至 GPT-5 系列的能力增长,主要靠的是大规模强化学习和推理时计算,底座模型本身并没有发生同等级别的世代跃迁。

用 SemiAnalysis 的分析来说:GPT-5 并不是一个全新一代的基底模型,它是一套由快速模型、深度推理模型和路由系统组成的统一架构——但在底座上,它依然建立在 GPT-4o 时代的基础之上。

这条路能走多远?坦率讲,边际收益已经开始递减了。靠强化学飞的数据飞轮总有上限,pretraining Scaling 的范式虽然被很多人唱衰,但真要撑起下一代能力跃迁,基底模型的代际升级依然是绕不开的。

Google 在 2025 年 11 月发布 Gemini 3 之后,这种差距被快速放大。Gemini 3 在多项基准上对当时 OpenAI 的旗舰形成了压力。十天后,SemiAnalysis 公开发表了那个引发广泛讨论的判断:OpenAI 自 GPT-4o 以来没有完成一轮成功的全规模预训练。紧接着 12 月 1 日,Sam Altman 在内部宣布「Code Red」,要求团队优先提升 ChatGPT 并重新配置资源。隔天,《The Information》就曝出了代号「Garlic」的新预训练模型。

有意思的是,从 Garlic 到 Doug,OpenAI 内部似乎是两条线在跑。Garlic 更像是在修复之前训练过程中发现的 bug 并重新验证预训练流程的可行性,Doug 才是真正的王炸——规模更大的正式版本。

Doug 的出现,说明 OpenAI 终于重新启动了基础模型换代。上一轮靠 RL 和推理侧「续命」的红利正在见顶,再不换底座,跟中国厂商的性能差距就不只是 2.7% 的问题了。

不过话说回来,就算 OpenAI 把 Doug 训出来了,商业化的老问题依然摆在那:训练成本数亿美元级别的旗舰模型,API 定价能低到哪去?而中国厂商靠开源 + 工程优化的路线,已经在成本端建立了结构性优势。

百倍价差不是靠一款新模型就能抹平的。 这是技术路线选择带来的结构性差异,不是某个单点突破能解决的。OpenAI 需要在性能上拉开足够大的差距,才能让企业心甘情愿付 100 倍的溢价——在当前的技术竞争态势下,这越来越难了。

五、这轮变局,跟你有几毛钱关系?

聊完产业,回到个人。AI 行业的风吹草动,最终会以你想象不到的方式传导到你的日常。

先说最直接的影响:你用的 AI 产品要涨价了,或者已经在涨了。 DeepSeek 的公告只是捅破窗户纸的那一下。整个行业的补贴周期正在关闭,智谱涨了 3 次,Kimi 涨了 3 到 4 倍,腾讯阿里百度全在调。过去两年靠资本烧出来的「AI 白菜价」,本质上是融资补贴,不是商业常态。

免费薅 AI 羊毛的日子,且用且珍惜。

但这不一定全是坏事。涨价意味着行业从「烧钱抢用户」切换到「靠产品赚钱」。过去两年,大量 AI 产品的质量一言难尽——套壳模型、功能堆砌、体验稀碎的产品满大街都是。成本回归合理水平之后,能活下来的大概率是真有两把刷子的。对普通用户来说,短期可能多花点钱,长期能用上更好的产品。

对职场人来说,一个关键变化正在发生:模型选择策略比模型本身更重要。 不是所有任务都需要最强模型。你在工作中遇到的绝大多数文本任务——写邮件、做摘要、信息提取、格式转换——用轻量模型完全够用。把有限的预算留给真正需要深度推理的任务:复杂数据分析、多步逻辑推理、代码审查。

未来 AI 应用的核心竞争力不取决于你「接入了哪个大模型」,而取决于你「会不会用最合适的模型组合完成任务」。模型分层、动态路由、缓存复用——这些词听起来很技术,但落实到日常工作中就是一句话:别用大炮打蚊子。

对创业者来说,机会窗口正在重新打开,只是换了一种打开方式。

底层模型成本上涨,会逼着应用层团队去做真正有壁垒的创新。过去两年的「套壳 AI」模式——拿个开源模型包装个前端就上线卖订阅——基本走到头了。成本红利退潮之后,活下来的只能是那些在数据飞轮、行业 know-how、用户粘性上建立了真正护城河的产品。

我在最近几个项目的尽调里明显感觉到,VC 对 AI 应用的投资逻辑正在变:以前是「你用的哪个模型,GPT 还是 Claude」,现在是「你的数据壁垒在哪,用户为什么离不开你」。前一个问题只需要一个 API Key 就能回答,后一个问题才是真正值钱的地方。

对企业决策者来说,部署自由度正在成为选型的第一优先级。 Coinbase、DoorDash、Airbnb、Lindy 的选择已经给出了清晰的示范:本地私有化部署的国产开源模型,在数据安全和成本控制两个维度同时给出了答案。你不需要把数据发给第三方 API 厂商,不需要担心接口涨价或被限流,不需要受制于别人的版本迭代节奏。

对于中小型企业来说,阿里的 Qwen3.8-27B 这类模型的出现尤其值得注意。27B 参数刚好踩在私有化部署的甜点区——单节点 GPU 就能跑,不需要建机房,不需要集群调度,IT 部门配一台高性能工作站就能把大模型跑在自家内网里。这对金融、医疗、法律等对数据安全极度敏感的行业,是实打实的降门槛。

有意思的是,这一轮 AI 变局跟之前的互联网泡沫有本质不同。互联网泡沫时大家都在烧钱做用户,商业模式不清晰。这一轮 AI 行业至少在收入端已经跑通了—— Agent 落地带来的是真实的商业价值,涨价也有实际的成本逻辑支撑。从理性乐观派的角度看,这是行业走向成熟的必经阶段。

换个角度想:十年前云计算刚起步的时候,AWS 也经历过类似的涨价周期。当时也是骂声一片,但回头看,行业的健康度恰恰是在定价回归理性之后建立起来的。免费不可持续,合理定价才是商业正循环的起点。

2026 年 8 月的 AI 行业,正在经历一个微妙的转折。

一边是中国大模型用「八周五连发」的速度重塑全球供给,硅谷企业排队来中国「进货」;另一边是价格屠夫 DeepSeek 率先涨价,宣告 AI 免费补贴时代进入倒计时。

一边是 OpenAI 紧急重启最大规模预训练以应对中国挑战;另一边是国产 GPU 厂商在市场份额上对英伟达形成结构性替代。

说白了,这是一个行业从「军备竞赛」切换到「商业正循环」的临界点。

你怎么看这轮大模型涨价?是行业理性的回归,还是又一轮割韭菜?如果 AI 产品的价格翻倍,你还会继续用吗?

话题标签: #AI 涨价 #DeepSeek # 大模型 # 国产大模型 #AIGC # 科技前沿 #OpenAI

中国经济网《涨价是国产大模型走向成熟的必答题》(2026-08-10),谢若琳

21 世纪经济报道《中国大模型八周五连发,硅谷企业悄悄换底座》(2026-08-05),石恩泽

36 氪 / 机器之心《刚刚,OpenAI 最大预训练模型 Doug 曝光》(2026-08-10)

斯坦福大学《2026 人工智能指数报告》

OpenRouter 平台调用量数据(2026 年 8 月 3 日 -7 日)

OpenCode 平台 Token 消耗数据(2026 年 8 月 1 日)

SemiAnalysis 机构客户备忘录(2026 年 7 月 9 日)

The Information 关于 OpenAI Garlic 模型报道(2025 年 12 月 2 日)

中国青年网 /CCTV4《中国模型集体出击》(2026-08-05)

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论