第一新声 22小时前
GPT-5.6大降价:Luna输入价比DeepSeek还便宜,DeepSeek V4正式版紧跟上线
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

分析师/会磊

校对/贾玥

策划/Eason

7月31日,AI行业在同一天迎来了两记重拳。

一边是OpenAI突然宣布大降价,最便宜的一款模型输入价格直接从1美元砍到0.2美元,砍掉了80%——这个价格甚至比国内以"性价比"出名的DeepSeek还要低。另一边,DeepSeek也没闲着,当天就上线了新版本,声称在写代码、修Bug这类复杂任务上的能力大幅提升。

两家公司明明走的是不同路线:OpenAI想用低价普及顶级能力,DeepSeek则用极致性价比抢占市场。但它们偏偏选在同一天出手,这绝不是巧合,而是一场关于 "AI到底应该卖多贵" 的正面交锋。

不过,热闹背后有三个问题更值得琢磨:

第一,OpenAI发布才三周就急着降价八成,到底是被谁逼的?第二,国产模型一直靠"便宜"当护城河,现在对手比自己还便宜,这招还管用吗?第三,价格战打到这个份上,谁会最先扛不住?

Luna打骨折,Sol提速不加价

这次调价覆盖了GPT-5.6三款模型,但力度完全不同。

Luna是此次降价的绝对主角。输入从1美元降到0.2美元,输出从6美元降到1.2美元,一口气砍掉八成。Terra调整幅度相对温和,输入从2.5美元降到2美元,输出从15美元降到12美元,降了20%。旗舰Sol价格纹丝不动,输入保持5美元、输出30美元,但API里多了一个Fast模式开关。

Fast模式的设计挺有意思——速度拉满到标准版的2.5倍,收费翻倍,但智能水平一点不打折。它取代了之前的Priority Processing服务,原先打了priority标签的请求会自动切过来。说白了就是把"速度"单独拎出来卖,嫌慢就加钱,丰俭由人。

降价的红利也传导到了订阅端。ChatGPT和Codex的月费没变,额度总量也没变,但调用Luna和Terra时消耗的积分变少了。同样是20美元月费,现在能干的活更多了。

OpenAI还顺手把ChatGPT和Codex CLI里的Auto-review模型从GPT-5.4换成了Luna。这个功能负责在后台检查代码和修改结果,属于典型的高频Agent任务。换模型叠加降价,官方预计成本能降到原来的十分之一左右。

降价之后,Luna的输入价格已经和上一代GPT-5.4 nano持平,输出甚至还便宜了0.05美元。但两款模型的能力压根不在一个水平线上——nano主要做分类、信息抽取这类简单杂活,而Luna可以调用工具、处理长上下文、执行多步工作流。OpenAI正在把支撑Agent干活的模型,卖到过去小模型的价位。

三款模型的分工现在很清晰:大规模高频任务走Luna,日常工作用Terra,硬骨头留给Sol,嫌慢就开Fast模式加钱提速。

AI自己给自己打工,Sol亲手改写运行代码

降价80%,底气从哪来?

OpenAI前一天刚披露了一个关键信息——Sol通过Codex接进了生产推理栈,自己动手把运行自己的那套系统优化了一遍。具体来说,Sol在人类工程师主导下干了四件事。

第一,重写GPU内核。模型在GPU上执行计算任务需要底层程序支撑,程序写得越高效,同一块GPU就能越快完成计算。Sol用Triton和Gluon这两种语言自主重写了部分生产内核,配合更广泛的内核优化,端到端服务成本被压低了20%。

第二,改进推测解码。这项技术简单说就是让一个小模型先"猜"接下来可能出现哪些Token,主模型并行验证,猜对了就能一次多输出几个Token。Sol针对这个环节设计并跑了数百次架构实验,主动监控训练过程,遇到硬件故障和训练不稳定就自己介入。Token生成效率因此提升了超过15%。

第三,优化负载均衡。OpenAI的请求按地域、容量、加速器类型分发,集群内部再按负载和上下文长度分配。Sol分析了生产流量数据,发现了工程师之前没注意到的不均衡问题,测试了新的路由策略。

第四,调优KV缓存配置。最优配置高度依赖实际负载,配置空间大到工程师基本靠经验来调。Sol分析生产负载后,自动生成并评估了候选配置,把过去调不动的东西推到了极致。

Codex负责人Tibo把这套打法总结成两步:先训出足够强的模型,再用这个模型去优化包括基础设施和内核在内的一切环节。不过需要说明的是,Sol写的代码不能直接上线——OpenAI会用工具逐项核查结构和数据流,确认没问题才放行。整个过程仍然由人类把控方向,模型负责执行。

但这些优化加在一起,也解释不了80%的降幅。20%的服务成本优化加上15%的生成效率提升,跟Luna的"脚踝斩"之间还有不小的缺口。

剩下那部分,得看市场上谁在逼OpenAI出牌。

价格PK:Luna性价比超DeepSeek V4 Pro

OpenAI选择在这个时间点降价,压力来自哪里?

中国大模型厂商是绕不开的答案。

先看一组数据。OpenRouter统计显示,2026年4月下旬以来,中国模型的Token调用量已经连续十三周超过美国模型。7月20日至26日这一周,中国模型处理了约38.6万亿Token,占全平台的66.5%。另据CNBC调查,自2月8日以来,美国公司通过OpenRouter平台在中国AI模型上使用的代币比例每周都超过30%,这一数字最高达46%。量在涨,价更狠。

DeepSeek V4 Pro的定价是输入每百万Token 0.435美元、输出0.87美元,享受75%永久折扣,缓存命中时输入更是低到0.003625美元/百万Token。Kimi K3输入3美元、输出15美元。GLM-5.2输入1.4美元、输出4.4美元。

横向对比一下就很直观了:

Luna在输入端已经把DeepSeek V4 Pro甩在了身后,输出端虽然还略高,但考虑智能水平后,第三方机构Artificial Analysis的数据显示,Luna的综合性价比已经反超。

在Agents Last Exam评测中,Luna甚至压过了Anthropic旗舰Fable 5,单任务成本只有对方的1%左右。

Sam Altman随后发推说要在"每一个模型层级都提供最好的价格与智能比"。说白了就是:别跟我比性价比。

企业客户对AI成本越来越敏感也是重要推手。

据CNBC报道,算不清投入产出账的情况下,企业越来越不愿意部署昂贵模型。谷歌这个月连推三款高性价比模型,微软CEO纳德拉在财报会上专门强调性价比。四面楚歌之下,OpenAI必须拿出硬招。Luna这张牌打得尤其刁钻——用0.2美元的输入价把Agent干活的门槛打到地板,让过去因为算力太贵不敢频繁跑的审查、验证、监控任务,变成工作流里的常规操作。

用不起的人,先出局

但要理解这场降价的真正分量,得先看一个真实场景。

一位开发者每天用AI抓取、清洗、标注上万条新闻。结构化、数据清洗、预筛、标注、实体提取、原子事件分离、聚类、语义合并……绝大多数环节都需要AI介入,有些流程复杂到Agent要自己调用工具、检查结果、决定下一步。一万条新闻乘上一大串处理链路,最后是一个极其恐怖的调用量。

按照他的调用规模,每月API消耗大概1000多块人民币,换成顶级模型至少翻十倍以上。

这就是DeepSeek V4 Flash的生存空间——智能水平在中上等,却便宜得离谱。WorkBuddy里也一样,真正难上天的任务大家接K3,但绝大多数日常任务,Flash已经完全能处理,单次只消耗0.06积分。

但OpenAI这次降价的真正大招,恰好打在了这个逻辑上。

Luna不是只能做分类抽取的"小模型",它能调用工具、执行多步任务,是一个正儿八经的Agent模型。而它的输入价格,只有0.2美元。这意味着,DeepSeek V4 Flash赖以生存的"量大管饱"场景,现在多了一个强劲的对手——而且这个对手的智能水平更高。

当Luna把Agent干活的价格打到过去小模型的水平线,大批量调用的成本几乎可以忽略不计。过去因为算力太贵不敢频繁执行的审查、验证、监控任务,现在可以变成工作流里的常规步骤。

行业当然需要那些一次跑通世界级难题的顶级模型。可这个世界上更多的真实需求,是每天重复一万次、十万次、上百万次的普通任务。

当智能贵得像奢侈品时,大家只能偶尔体验。当智能便宜到像水电一样时,它才能真正流进每一家公司、每一条流水线和每一个普通人的生活里。

这才是真正的智能平权。而这场竞赛,远未到终局。

同时,GPT-5.6降价消息出来当天,开发者社区炸了锅。有人说自己的API额度终于能喘口气了,也有人直接喊话Anthropic:"轮到你出牌了。"

可见这轮降价的真正意义,不在于省了几块钱,而在于一个清晰的信号:大模型的廉价化正在加速。当模型开始自己给自己降本,当效率提升直接变成价格下调,当"智能便宜到不用算账"不再是一句口号——整个AI产业的成本曲线,正在被重新画一遍。

对于开发者来说,这是最好的时候。API成本压到几乎可以忽略,AI Agent可以7×24小时跑,过去因为算力太贵不敢想的场景,现在都能放手去试。

对于国产大模型来说,这是最头疼的时候。价格护城河正在被填平,性能差距还要追赶,商业化路径得重新想。OpenAI已经把价格拍到了地板上,DeepSeek则把"够用且便宜"的标签贴得死死的。

免费的狂欢渐行渐远,但廉价的智能才刚刚开始。

转载、采访报道:Tina(微信:beijingyh1992)

榜单、市场合作:小新(微信:dyxsmxx)

内容合作:Kim(微信:beijingkim2020)

会员合作:Sherry(微信:sherry_199909)

视频合作:Rita(微信:qyqx20220202)

更多内容

【人工智能】3.45亿 VS 1.66亿:豆包逼急阿里,千问携40亿淘宝商品库打响"AI购物第一枪" |一觉醒来,马斯克亲手解散xAI!22万张GPU全给Claude,AI战局一夜改写|68元起,豆包迈向收费第一步:免费的"代价",终于兜不住了|Anthropic"连坐"封号、Cursor 9秒删库:AI反噬企业的惨痛一课,代价太贵了|阿里"快乐小马"开启灰度测试:用原生音画定义AI视频的下半场 |每秒10米、无头无手、重心贴地:宇树H1如何让机器人"飞"起来? | 腾讯扔出一只浏览器"龙虾",浏览器赛道迎来最强搅局者"太危险了,不敢公开发布":Claude Mythos为何让硅谷巨头集体恐慌字节、阿里、腾讯的AI工业化暗战:谁在建造AI时代的"工厂"?从工具到生态:银联APOP框架发布,勾勒智能体支付新蓝图日均120万亿Token,中国大模型终于跑出一个"全球第三"Claude Code"被开源":一场51万行代码的意外漂流,正在加速AI开发者的竞赛|没等来V4,等来大升级?Deepseek宕机一夜,是重大事故还是偷偷变强|从偏科生到"人形第一股":王兴兴的十年逆袭|亲手砍掉Sora,奥特曼在下一盘什么棋?|龙抬头,向AI"抬头":一部AI短剧如何"捅破"传统广告的天花板|Token经济:谁在瓜分"小龙虾"带来的万亿红利?|谷歌AI Studio深夜放大招:全栈Vibe编码体验上线,一句话开发原生应用

【行业深度】具身智能"爆发",谁将是背后的"投资之王"? | AI会革了百度的命吗? | 真假混战:Agent元年,如何拨开概念迷雾?没找到刚需:人形机器人是个好生意吗 | 用得起来 还有"人样" 2025世界机器人大会人满为患 | 2025年WAIC:一票难求,800厂商从"概念"走向"落地" | AI浪潮下,数据库如何"进化"?AI Agent是中国SaaS的解药 | 央国企的AI征途:抢跑还是稳行?出走大厂的95后CEO们,已在AI赛道融资数亿这波AI风口,让青年投资人踩中了深圳实验创投"群英谱":一所中小学的"硬核"造星之路

【人物周刊】中台化架构+场景化落地:迈富时如何用AI-Agentforce构建企业"智能业务闭环"?|行业困于"伪智能",原力无限以VLA与世界模型双线破局|从技术先锋到生态构建者,贝锐CEO讲述19年"连接革命"与"软硬一体"突围之路 一群清华人,与具身智能的四十年 | 用AI Agent征战海外市场Agent让营销从"人找货"变"货追人" | 专访白惠源:撕掉"阿里副总裁"标签,数亿资金押注"下一代AI"姚期智和他的"姚班":人生只为一大事而来 | 朱啸虎:萧条时代下的迷途猎手雷军和他的"小米哲学":把风口玩到next level

【行业研究】《2025年中国企业级AI Agent应用实践研究报告》 《2025年中国金融业数据库国产替代能力评估报告》《大模型时代 2025年央国企数智化转型新实践与新范式》《2025年中国IT后市场发展研究报告》《2024年央国企RPA市场研究报告》《2024年中国AI大模型产业发展与应用研究报告》《2024年中国银行业数据库市场研究报告》《2024年中国CRM市场研究报告》《2024年中国智能客服市场研究报告》《2024年中国网络靶场市场研究报告》《2024年中国交通运输行业数字孪生市场研究报告》

关注「第一新声」并设置星标,第一时间GET行业信息

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论