白鲸实验室one 1小时前
Flash模型大混战,DeepSeek抢先吃到红利
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

今年夏天,Flash 突然从开发者嘴里的 " 低配版模型 " 变成了刚需。

一位大模型研究员告诉《白鲸实验室》,一个交互 70 轮左右的工作流," 现在用 V4 Flash,几分钟就可以跑完。"

他已经很少会在工作中只使用一款最强的模型。"GPT6 Astra 出来了尝个鲜,还有 Agent 第一次上手新模型架构时,要用旗舰版模型,等到了后面改代码、训练、反馈结果这个过程,基本 Flash 就够了。" 这位研究员说,两者结合省时又省钱。

企业计算模型本地化部署的成本后,选择的倾向性更明显了。

"DeepSeek V4 Flash,百万 token 的成本基本在 2 块左右。做端侧模型,至少需要 8 张 H 卡,每个月大概 8 万成本,可以供 20 人使用,按照吞吐 token2000t/s,每月产出大概 50 亿 token。按照高峰定价,即便直接用 DeepSeek 的 api,一个月也就是 4.5 万。" 一位企业模型本地化部署的服务商表示,人均月支出不过几千元,远远低于使用最强模型的成本费用。

相比成本高昂的旗舰模型,越来越多的企业开始选择更便宜好用的 Flash 模型,尤其随着 AI 办公等应用赛道的火爆,普通用户群体开始使用 Agent,更助推了这个趋势。

国产模型厂商也纷纷抢注这波商业化潮流。7 月以来,DeepSeek、阿里和智谱密集把 Flash 模型推上牌桌,8 月 26 日,智谱发布 GLM-5.3-Flash,阿里随后推出 Qwen3.8-Flash。

在大模型变小的叙事中,DeepSeek 几乎是姿态最激进的。7 月 31 日,DeepSeek 发布 V4 Flash,一个多月后又更新 V4.1 Flash。根据官方信息,DeepSeek 一度计划在 9 月 14 日后把 V4 Pro 的 API 请求直接路由至 V4.1 Flash,理由是在其测试中,V4.1 Flash 在性能、成本、速度和总用时等指标上都已经超过 V4 Pro。

后来因为用户抗议,DeepSeek 又改变计划,决定保留 V4 Pro。"DeepSeek 最先证明了 Flash 不只是便宜,Flash 可以比 Pro 更适合 Agent,DeepSeek 大概是这一波真正吃到 Flash 模型红利的模型厂商了。" 上述服务商表示,DeepSeek 相当于再次教育了用户,日常需求根本不需要 Pro。

过去 Flash 通常是旗舰模型下面的低价版本,是开发者偶尔使用的替代模型。而现在随着 Agent 大爆发,国产模型厂商各显神通,开始厮杀起来,场面已经远非 " 斩杀线 " 一词可以概括了。

01

第一个真正吃到 Flash 红利的模型厂商

这波 Flash 模型的红利,DeepSeek 真正赚到了点子上。

今年 4 月,DeepSeek V4 发布的同一时间,Claude Code 快速成为开发者默认 Harness,Coding 成为大模型圈的年度热词。

DeepSeek V4 直接同步推出了 V4 Flash 和 V4 Pro,并明确针对 Claude Code、OpenCode、OpenClaw、CodeBuddy 等 Agent 框架做适配,同时支持 Anthropic API。

彼时,Claude Code 让 Coding Agent 第一次显得足够有用,也迅速放大了 token 消耗。过去用 Chatbot 写代码,一次调用通常只是让模型解释一段报错,但 Claude Code 可以主动读取代码库、检索文件、修改代码、执行测试,连续工作几十轮。

对于传统 SaaS 来说,每月 100 美元订阅费已经不算低,但在 Anthropic,Coding plan 被开发者买成了硬通货,200 美元 / 月的 Max 套餐都不够用,用户要经常需要额外购买 API。按照 token 收费后,重度消费每月更是冲高到上千美元。

令人血压上升的顶尖模型成本背后,也悄悄发生一些微妙的变化。今年 5 月,在海外开发者社群 reddit 上出现了一个热度很高的讨论," 如果 DeepSeek V4 5 美元就能做同样的 Coding 任务,为什么还要花 100 美元买 Claude Code?"

评论区里,不少用户表达 Claude Code 是真的好用,Anthropic 的 Harness,包括上下文管理、工具调用、计划执行、Terminal 交互让他们不想放弃的同时,他们也感慨需要一个 Claude 模型的替代品。

这种变化反映了市场一个重要窗口。或者说昂贵的 Claude 模型,反向验证了 Flash 模型加量不加价的价值。很明显,DeepSeek 看到了这一机会。

5 月 reddit 的讨论里,DeepSeek Flash 模型还能力不够,被用户指出只能堆代码。到 7、8 月,方向变了。有用户表示 " 我不用(Claude Code)Pro,就用 V4 Flash,虽然比不上 Opus/Sonnet,但够用了。"

reddit 的高赞帖是一名后端开发者发布的,他表示 V4 Flash 发布后,已经没有继续购买 Claude 和 ChatGPT 订阅的必要。

网友们甚至开始讨论,该给 V4 Flash 配什么 Harness,Claude Code、OpenCode 还是 Pi。有人用更强模型负责 Plan,再让 V4 Flash 执行整个计划。

也有人直接用 V4 Pro 解决核心问题,Flash 跑子 Agent 任务,Flash 已经不仅是省月费,在部分大型 debug 任务里,OpenAI 的顶级模型 GPT-6 Sol 会出现上下文问题卡住,DeepSeek 反而一次完成。

而 Flash 对模型厂商来说,也是一门比旗舰模型更好的生意。

超大模型随着参数、激活量继续增加,对 HBM 容量、显存带宽和 GPU 间互联的要求都会迅速上升。到了 2T 量级,H200 和 Blackwell 之间,存在的不仅是单卡计算能力差异,还包括显存速度和卡间互联。

Flash 模型对算力需求不高。从目前几款主流产品看,大量 Flash 模型将单次激活参数压在十几 B 附近,H100、H200 乃至更老一代的集群就能承载。模型厂商不用为它购买最昂贵的芯片,还能继续消化现有集群。同时,单次调用计算量更低,还能靠大规模 batch 继续摊薄成本。

" 以 DeepSeek 的 Flash 为例,百万 token 的成本在 2 块左右,能将 API 总调用费压到比企业自己部署还便宜一半,就是因为 batch 大。同时服务一万甚至十万用户,一个用户停止生成,另一个用户的请求马上可以补入,不同请求被拼进 batch,同一批 GPU 有更高的利用率。" 上述头部大模型研究员判断。

尽管目前还没有哪家模型厂商,把 Pro、Flash 两条产品线的毛利率分别公开。但是多位研究员告诉我们,Flash 模型已经成为当前模型厂商毛利最高,且赚钱的产品。

智谱的财报数据也能部分佐证这一点。2026 年智谱的半年报显示,智谱规模化使用国产芯片,单位 Token 推理成本较年初下降 80%。其中 glm-5.3 Flash 第一次实现超大规模在国产芯片上跑,实现了模型优化系统,系统承载模型的循环。Flash 通过压缩激活参数,适配国产芯片,同步实现推理成本的降低。这也让智谱 2026 年上半年 API 收入达 8.25 亿元,同比增长 2736%,毛利率由负转正至 24.6%。

02

Flash 发布各有节奏

DeepSeek 在 Flash 模型上的成功,也让各家模型厂商被迫应战。

比如早早押注 Coding 的智谱。DeepSeek 不仅打掉了 Claude Code 的 Coding plan 的溢价空间,作为国内最坚定走 Anthropic 来时路之一的模型厂商,智谱的高价 Coding 也更早进入 Flash 模型的射程。

智谱做 Flash 的方向也颇为明确。GLM-5.3-Flash 总参数 320B、激活 18B,智谱称其价格约为 GLM-5.3 的十分之一,并且从架构开始就围绕长上下文、Agent、Coding 和高效推理进行优化。智谱的 Flash 模型,始终围绕着 Coding 战场。

同时,智谱做 Flash 的心态也颇为矛盾。GLM-5.3 Flash 越成功,能让智谱从 Claude、OpenAI 那里分蛋糕,但也让智谱的 Coding 模型陷入价格战的泥潭。

公开市场上,GLM-5.3-Flash、DeepSeek V4 Flash、Qwen3.8-Flash 在相近的价格带里被频繁横向比较,不同第三方 API 甚至直接建议开发者同时接入多个模型,根据任务自动路由。

而这已经不是做国模 Coding 第一就可以解决的问题了。DeepSeek 如同一个 " 价格屠夫 " 站在智谱身后,它让六个月前需要旗舰模型完成的任务,半年后 Flash 也能做,以至于前沿能力不断贬值,过去只有高价 API 才能买到的能力,最终降到几块钱一百万 token。这恰恰是智谱不愿意看到的。

另一方面,如果只看能力储备,阿里可能是最适合卷小模型的公司。事实上,尽管阿里有最多的小模型,却没有一颗做出 " 爆款 Flash 模型 " 的心。

作为开源大厂,Qwen 长期以来就是国内尺寸最齐全的模型家族之一。从面向手机、PC、汽车和机器人等场景的小尺寸模型,到 Flash、Plus、Max,再到今年不断扩大的旗舰模型,阿里一直致力于推出模型全家桶。

到了 Qwen3.8-Flash,百万上下文、Function Calling、多模态和缓存已经成为标准配置,阿里云甚至在 8 月 27 日继续下调其 API 价格。

不过阿里云是一家云企业,客户需求更复杂,无论客户用什么模型它都能赚钱。客户用 Flash,阿里云挣钱,客户发现 Flash 不够,切 Qwen Max,阿里云仍然挣钱,就连企业想自己部署模型,需要 GPU、存储、数据库、推理服务,都要回到阿里云。

所以,阿里做小参数模型,更多的是求全。0.6B 有人需要,就做 0.6B,几十 B 适合企业私有化,就提供几十 B。Flash 适合高并发 Agent,就做 Flash,旗舰模型仍然决定技术品牌,就继续把 Max 往上顶。不管怎么定档,阿里云都能收钱。

其他模型玩家,各有差异。

MiniMax 最值得关注的是它把类似的成本逻辑做进了视频生成。7 月发布的 H3,2K 视频 API 是 $0.13/ 秒,768P 是 $0.08/ 秒,并成功切入了市场。在语言模型上,M2.7 就有了类似操作,MiniMax 将 API 分为标准版和高速版,不用 Flash/Pro 命名,但根据吞吐和优先级分档收费。

Kimi 更有意思,它其实没有跟随 Flash 路线。9 月 11 日,Kimi 推出综合性能接近 K3,价格要便宜的 K2.8preview(根据第三方路由测试)。从某种程度上看,K2.8preview 也可以看做往性价比路线的试探。

通过 Kimi 产品,也能看出 Kimi 开始强调日常任务上使用全面均衡的 K2.8 preview。K3 本身是 2.8T 总参数、1M 上下文,属于旗舰模型,主打更强的综合能力。

不过从定价体系上看,K2.8 preview 依然远远高于当前的 Flash 模型。 尽管 Kimi 未公布 K2.8 preview 的 token 价格,根据第三方路由测试的价格,K2.8 preview 每百万输入 token $1.00,每百万输出 token $4.00,也比 V4.1 Flash 版本贵数倍。

很明显,刚刚因为 K3 在海外收获不错口碑的 Kimi,想要战略更聚焦,重心放在更强模型的推进上。在商业化上,9 月 18 日,K3 官宣和亚马逊合作,开始海外云厂商收入参与分成。

虽然国内各家模型厂商开始都瞄准性价比路线的模型,但截至目前,模型厂商在 Flash 模型上节奏和侧重点,仍未统一。

03

靠 Flash 赚钱,越来越难

当 Flash 成为模型厂最赚钱的产品,大模型公司又陷入了新一轮的迷茫。

模型公司们不想参与,但又不得不参与。旗舰模型迭代快速,很难有一家模型公司可以凭借一款旗舰模型长期在市场保持优势。再加上 Flash 模型的冲击,旗舰模型或许会迎来历史上最快的 " 技术折旧 " 期。

过去,大模型公司最接近的标的是传统软件公司,按用户量或者 token 消耗来估值,但现在模型厂商都在讲 token 成本和效率,做得越来越像一门云生意。

OpenAI 把同一代 GPT-6 拆成 Astra、Sol 和 Luna,最高档和最低档之间,输出价格相差 100 倍。而且,OpenAI 开始像云厂商按照服务等级收费。同一个模型不再只有一个价格,而是区分 Standard、Batch、Flex 和 Fast mode。

甚至也不仅卖模型 API 了。9 月 10 日,OpenAI 推出 Agents API,把 Codex 背后的 Harness、上下文管理、工具调用、子 Agent 调度和长期运行环境直接作为云服务开放。

Anthropic 也在主动压缩旗舰模型和中档模型之间的差距。9 月 22 日发布的 Claude Opus 5.5 运行成本比上一代降低 40%,它的 API 定价也降至每百万输入 token 4 美元、输出 20 美元,比上一代 Opus 低约 20%。

传统的软件产品,能力越强,用户越依赖,企业应该越有能力保住定价权。但大模型似乎很难复制这条路径。

模型厂商们一边加速迭代新模型,一边不得不计较单位 token 成本,GPU 效率,优化缓存命中率,这已经越来越接近云计算的经营逻辑。模型成为基础设施和商品,价格成为市场上的关键因素。

目前,率先抢到 Flash 红利的 DeepSeek,已经不是价格最低的 Flash 模型。Qwen3.8-Flash 国际版公开价格约为每百万输入 token0.15 美元、输出 0.47 美元,中国部分区域价格还更低。GLM-5.3-Flash 公开定价也低于 DeepSeek V4.1 Flash 的峰值价格。

长期来看,这个价格还会继续下探。假设 DeepSeek 能做到 $1/M 输出,阿里可以做到 $0.2,下一家还能 $0.1,大模型公司需要找到新的商业化标的。

短期来看,Flash 模型至少会让模型公司的收入数据看起来好看。已经上市的智谱、MiniMax 的市销率,仍然高于海外的 Anthropic 和 OpenAI 很多倍。即将上市的 DeepSeek,以及在上市筹备的 Kimi,都需要更丰厚的商业化收入,撑高公司估值。

文|马舒叶

编辑|刘培

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

flash 阿里 ai astra 高峰
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论