
2026 年 7 月 31 日,DeepSeek 把 V4-Flash 正式版(0731)推上了公测。不到半天,一条新词「斩杀线」就被圈内人刷到了所有 AI 讨论区。
它不是营销词,是一张散点图勾勒出的现实。

DeepSeek 斩杀线 散点图
先看这张图:什么是「斩杀线」
第三方测评机构同日上线了 AI 模型性价比排行榜。散点图的横轴是单次任务美元成本,纵轴是智能指数,一共收进了 128 款主流模型。
DeepSeek V4-Flash(0731)的点位大致在 0.025 美元、50 分。它右侧紧挨着的,是 GPT-5.6 Luna,51 分;但 Luna 的成本是 Flash 的若干倍。再往右上扫一圈,Opus 4.8、Fable 5、GPT-5.5 它们都在 Flash 的右上方。
判定方法简单粗暴:
比 Flash 贵,并且不如 Flash 聪明的模型,统统划进右下方黄线区域,商业上再没有理由存在了,这就是「斩杀线」残酷的现实意义。

图:C-102 价格与智能对比

网友作出视频来表达对 DeepSeek 的敬意
在 Terminal-Bench 2.1 这种偏重命令行与工程实践的真机任务中,DeepSeek V4-Flash 甚至超越了 Anthropic 的主流模型 Sonnet 5。
架构层面,V4-Flash 没动,只靠后训练升级。
它同时原生支持 Responses API 与 Codex,官方报价是输入 0.14 美元 / 百万 token、输出 0.28 美元 / 百万 token,缓存命中低至 0.0028 美元。
这个缓存折扣力度约 98%,远远高过业内普遍的 90%。
下图红柱为 DeepSeek V4-Flash

图:C-103 Agent 基准对比
更关键的是 Agent 维度的硬指标。
Terminal-Bench 2.1 上,DeepSeek 官方开启 Harness minimal 模式自报 82.7 分,超过 Claude Sonnet 5,逼近 Claude Opus 4.8 与 GLM-5.2;DSBench-Hard 上 Flash 比 Preview 又涨了 33.8 分,是后训练红利最显著的「长周期工具调用」分项。
把这些数字放在一起看,结论只有一个:
Flash 已经不再是轻量模型的代名词,而是用一线模型零头价格买到了准一线智能。


主流模型 API 输出价格对比备注:大模型的 " 缓存命中 " 与 " 缓存未命中 " 是推理优化中的核心概念,简单来说就是判断新请求能否复用之前已经计算好的中间结果,从而避免重复劳动
价格才是主菜。
V4-Flash 输出 2 元每百万 token,缓存未命中输入 1 元,缓存命中输入仅 0.02 元。横向对比:Claude Opus 4.8 输出价约是它的 90 倍;GPT-5.6 Luna 当天刚降价 80%,输出价仍是它的 4 倍左右。官方测算,2000 万 token 的 Agent 任务成本约 3.5 美元。
有开发者晒账单:
4 小时代码任务、1 亿 token、缓存高命中,结账不到一块钱。
注意一个细节:
缓存命中与未命中的输入价相差 50 倍。Agent 任务天然长上下文、多轮调用、前缀大量重复,命中率极高,这 50 倍就是留给懂行开发者的红利。官方还预告峰谷定价,每天 9 点到 12 点、14 点到 18 点价格翻倍,等于明说:批量任务挪到夜里跑,再省一半。

V4-Flash 缓存命中与未命中成本对比
大背景同样值得记住。Gartner 预计 2026 年推理支出 206 亿美元,首次超过训练支出,token 账单正变成企业要专门管理的成本项。Arena 综合榜前十已有 5 家中国厂商,性能差距收窄后,价格就是决定性变量。OpenAI 一天内 Luna 降价 80%、Terra 降价 20%,不是慷慨,是被逼的。
OpenAI 与 Anthropic 的路线,是堆 GPU、卖算力溢价,逻辑是「更聪明,更贵」。
DeepSeek V4-Flash 用工程与架构优化,在不靠烧 GPU 的前提下把智能推到准一线,把 Agent 多轮调用的成本门槛彻底打穿。
结果是行业 48 小时内集体改价:8 月 4 日 OpenAI 全线跟降 80%;硅谷不再争论 Flash 强不强,只争论还能不能托得住这个价。

国内大模型:斩杀线更狠

图:C-104 国产头部集中度
斩杀线对国产模型同样适用,只是杀伤力更大。
那些没有行业壁垒、纯靠卖 token 活着的厂商,商业路径瞬间收窄。外部信号已经接连亮起来:国家数据局 3 月 23 日披露,日均 token 调用量已达 140 万亿,较 2024 年初增长 1000 倍;阿里 ATH 事业群建立「千亿级 token 内部市场化」机制;字节披露 120 万亿 token 日消耗;腾讯内部对所有业务施加 1000 元 / 月隐性调用成本考核;钉钉放话「低质量软件日抛」。资本与人才加速向 2 到 3 家头部集中,长尾出清,已经在发生,不是预测。

产业判断
类比 4G 降本催生移动互联网。当 token 真正白菜价,C 端 AI 应用、B 端 Agent 渗透的速度,会被成本曲线强行抬起来。
三条曲线已经开始交汇:
单任务推理成本曲线(DeepSeek 把它打到 0.025 美元)、
Agent 综合能力曲线(V4-Flash 已达 Sonnet 5 水平)、
Agent 互通协议曲线(Harness、MCP、Handoff 协议之争,今年内会收敛)。
三件事任何一件单拎都不够,但同时落在 2026 下半年,叠加效应会出现。
V4 Pro 正式版与 DeepSeek Harness 同步发布的时间窗口在 8 月 10 至 20 日;估值约 4700 亿元的 DeepSeek 传出暂停融资谈判。
这两件事值得下半年持续盯。
留给国产二三线厂商的时间窗口,
按照目前的速度看,
可能只剩 18 个月。


登录后才可以发布评论哦
打开小程序可以发布评论哦