作者 | 汤安迪
编辑 | 周欢
DeepSeek V4 的正式版终于来了。
可惜,来的还是 DeepSeek-V4-Flash,V4 Pro 正式版还得继续等。
但即便是 " 半个 " 正式版,这一天在国内国外炸出的动静,都足够大。
现在梁文锋,在外国人眼里,长这个样。
只重做了一遍后训练
然后强了特别多
先说这次更新有多 " 反常 "。
DeepSeek-V4-Flash-0731,模型结构和参数规模跟 4 月的预览版完全一致,284B 总参数、13B 激活、100 万 token 上下文,一个数字都没动。
DeepSeek 只做了一件事:把后训练(post-training)重新做了一遍。
然后成绩就变成了这样:
Terminal Bench 2.1:61.8 → 82.7
DeepSWE(长程软件工程基准):7.3 → 54.4
DSBench-FullStack(内部全栈开发测试集):37.0 → 68.7
官方列出的九项 Agent 测试,V4 Flash 正式版全部超过了 V4 Pro Preview。
注意,是全部,不是大部分。
这就魔幻:Flash,是 DeepSeek 产品线里的 " 轻量档 ";Pro Preview,是 " 旗舰预览 "。
两者参数规模差着一个数量级。
现在,轻量档把旗舰预览版按在地上打。而且不是险胜,是一大片的碾压。
这个成绩要是放在别家公司,早就改名叫 "V4.5 Ultra" 然后涨价 50% 了。
DeepSeek 还是老一套,名字不改,价格不变,输入还是约 0.09 美元 / 百万 token 的级别。
开始挖 OpenAI 的墙角了
比跑分更值得注意的,是接口层的一个动作。
V4 Flash 正式版原生支持了 OpenAI 的 Responses API 格式,并专门针对 Codex 做了适配。
一次配置,Codex CLI、ChatGPT 桌面端、VS Code 插件全部直连,base_url 不用换,模型名切到 deepseek-v4-flash 就能跑。
DeepSeek 不满足于卖模型了,它开始往 OpenAI 的 Agent 生态里直接插管子。
你惯用 Codex 的工作流?不用改习惯,把后端换成 DeepSeek 就行。
逼近
吹完了,说下其他。
V4 Flash 正式版在最顶级的 Coding 和 Agent 任务里,跟 GPT-5.6 Sol、Claude Opus 5、Kimi K3 这些最强模型,依然有明显差距。
部分指标逼近 Claude Opus 4.8,但 " 逼近 " 不是 " 打平 "。
它的准确位置是:稳稳进入 " 国产模型第一梯队 ",但离 " 全球模型王座 " 还隔着一层。
同一天
OpenAI 降价 80%
7 月 31 日,同一天。
OpenAI 宣布 GPT-5.6 系列降价:
Luna 直降 80%:输入从 1 美元降到 0.20 美元 / 百万 token,输出从 6 美元降到 1.20 美元。
Terra 降 20%:输入 2 美元,输出 12 美元。
旗舰 Sol 价格不变,但加了最高 2.5 倍速的 Fast 模式,代价是价格翻倍,加速加价,童叟无欺。
OpenAI 降价理由是是 " 推理服务效率提升 ",甚至还讲了个 "GPT-5.6 Sol 自己帮自己省了钱 " 的故事。
但其实这已经 OpenAI 过去 18 个月里的第四次大降价。而且这次降价发生在 GPT-5.6 系列发布仅仅 21 天之后。
一个发布三周的产品砍掉 80% 的价格。
OpenAI 是不是对什么,有点应激反应了?
OpenAI 都得价格战了
降完价之后,Luna 的输入价(0.20 美元)确实打进了 DeepSeek V4 Pro 的定价区间(输入 0.435、输出 0.87 美元 / 百万 token),普通输入甚至比 DeepSeek 便宜一半。
但细看,Luna 的缓存读取仍然贵出 5.5 倍,长序列还有额外惩罚。
把缓存命中、长上下文、Agent 多轮循环这些真实生产负载全算上,综合任务成本下来,DeepSeek 依然是那个更难绕开的选项。
更何况,Luna 降价后要面对的真正对手根本不是 V4 Pro,是输入 0.09 美元级别的 V4 Flash。
OpenAI 发力的方向,是降价。而降价的对象,是 DeepSeek 们定义的价格带。
这就差不多类似,奔驰面对比亚迪等车企竞争,开启了价格战,这你敢信?
更多的使用
大模型真正进入生产环境以后,能力上限只是故事的一半。
还有一个经常被低估到离谱的指标,你到底用不用得起。
token 单价便宜是一回事,完成任务要花多少 token 是一回事,最终实际成本是多少,才是唯一重要的事。
而这恰恰是 V4 Flash 这种模型的主场,结构没变,参数没变,只是后训练重做了一遍,同样的预算,从今天起能完成的任务又多了一大截。
当智能贵得像奢侈品时,大家只能偶尔体验。
当智能便宜到像水电一样时,它才会真正流进每一家公司、每一条流水线、每一个普通人的生活里。
顶级模型决定的是人类智能的上限,便宜模型决定的是智能渗透的速度。
而上限,只有少数人在乎。速度,所有人都要买单。
•END •
欢迎点击奇偶工作室视频号,看最新视频 ~
↓↓↓
Question. Write.Narrate. Believe. Become a story. 易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:
↓↓↓


登录后才可以发布评论哦
打开小程序可以发布评论哦