投资界 3小时前
DeepSeek、智谱、阿里、腾讯,谁是大模型真正的斩杀线?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

原标题:DeepSeek、智谱、阿里、腾讯,谁是大模型真正的斩杀线? 来源:Tech 星球

最近,大模型厂商集体看向了 "Flash"。

变化可以从 7 月份的一个发布日开始追溯,7 月 21 日,Google DeepMind 一口气端出三款 Flash 模型,但旗舰 Gemini 3.5 Pro 缺席。

彼时,Gemini 3.6 Flash 的表现被吐槽不如中国一线开源模型,但国内大模型厂商们却一同捕捉到 Flash 背后的产业信号,纷纷跟进布局这一效率架构路线。

十天后,国内大模型市场,DeepSeekV4 Flash 正式版上线并开源,284B 总参数、每次推理只激活 13B。DeepSeek 还调整了卖模型的方式,涨价的同时,改成了峰谷分时的计费方式。

8 月 26 日到 28 日这三天,Flash 成了主战场。三天至少五款重量级模型落地,但 Flash 版本占到了多数。

智谱把匿名刷屏 " 牛来 "(Ox-Alpha)认领为 GLM-5.3-Flash,320B 总参数,每次只激活 18B;阿里在同一天连夜放出 Qwen3.8-Flash,总参数 125B,每个 token 只唤醒 6B 参与计算。9 月 1 日,腾讯发布了其最新一代旗舰模型预览版本 Hy4 preview 的轻量版模型。

上半年,大模型行业的叙事主线还停留在比拼更多数据、更多参数、更多算力,各家追求的是更大规模参数的模型。

但开源与低价的浪潮正在改写行业逻辑,过去 Flash 原本只是 Google 产品线上一个不起眼的档位,定位追求快、便宜、够用,如今新一代 Flash 已经进化为效率优先的架构版本,行业的比拼重心,也已经从 " 谁的参数更大 ",转向 " 谁成本更低、更具备落地价值 "。

Agent 需要 Flash:效率模型登上产业主舞台

如果只有三分之一的价格,已经能完成大部分日常任务,那你还会默认把所有工作交给最强模型吗?答案当然是否定的。这也是 2026 年下半年,DeepSeek、智谱、阿里通义扎堆推出 Flash 等轻量模型的现实动因。

在此之前,市场认知里的 Flash,只是旗舰模型的阉割减配版本。

厂商砍掉部分模型能力,换取更快的推理速度与更低调用成本,适合做简单对话,一旦遇到复杂推理、长链路任务,就会出现明显的能力断崖下滑。Flash 版本更多是作为旗舰产品的补充,承接边缘流量,很难走到业务舞台中央。

新一代 Flash 不是简单裁剪参数的减配思路,重点是架构层面的效率革新。依靠 MoE 稀疏路由机制,模型保留庞大的总参规模与完整知识底座,每一轮推理仅激活一小部分参数参与运算。

真正把 Flash 推到主流位置的,是 AI Agent 规模化的兴起。以阿里 Qwen3.8Flash 为例,模型发布的同时,千问办公 Agent 产品同步上线,模型与智能体业务的绑定趋势十分直观。

Agent 的业务特性带来两层现实约束:一方面,大量工作集中在意图路由、信息抽取、工具调用等任务,并不需要旗舰模型 * 的深度推理能力,但对推理延迟、并发承载力、调用成本高度敏感。

另一方面,完成一整套 Agent 业务闭环,往往需要数十次模型循环调用,倘若全部交由旗舰模型处理,成本会随调用轮次成倍膨胀,商业化规模化就无从谈起。

DeepSeek V4Flash、GLM5.3Flash、Qwen3.8Flash 这类国产 MoE 模型,就是瞄准这类场景痛点打造的。即便旗舰模型综合能力上限更高,但高昂的调用开销与更高时延,并不适配 Agent 高频次、大批量的运行需求。

一夜之间模型都变便宜了,谁才是新的斩杀线?

海外独立评测社区 Artificial Analysis 曾实测上百款大模型,并据此画出一张性能与价格对比图。DeepSeek-V4-Flash 在这张图里成了一道醒目的 " 斩杀线 " —— 意思是,在它的价格之下,性能比它差、价格还比它贵的模型,都不用看了。

DeepSeek 过去半年的用户增长,很大一部分就是踩着这条 " 斩杀线 " 走过来的。它不一定是同一时间段内 * 的模型,但价格却足够便宜。

换句话说,现在各家推出的 Flash 所做的,就是在尽可能接近旗舰效果的前提下,把价格做到 *。

所以 " 斩杀线 " 从来不会只属于一家公司。

就在 DeepSeek 宣布涨价的节点上,低价价格带腾出了空间。随后发布的 GLM-5.3-Flash 与 Qwen3.8-Flash 几乎同一时间把价格压到同一水位,新一轮 " 斩杀线 " 之争就此开场。

具体看三家的定价策略:

GLM-5.3-Flash 与 Qwen3.8-Flash 价格几乎持平:输入 0.8 元、输出约 2.7 – 2.8 元 / 百万 tokens,双双站上行业 * 档。

智谱更是叠加限时 5 折(至 9 月 9 日),折后输入 0.4 元、输出 1.4 元,进一步压低入场门槛。

DeepSeek 则坚持峰谷定价:高峰输入 3.0 元、输出 9.0 元,空闲时段半价。平均下来约为另外两家的 2 – 3 倍,但视觉能力不额外加价,仍保留一张差异化底牌。

标价之下还有第二层。三款都支持上下文缓存,缓存命中的输入价会大幅下探,Qwen 低至 0.1 元 / 百万 tokens;对系统提示长、上下文重复度高的场景,实际账单还能再砍一截。而 DeepSeek 的缓存命中价在闲时只有 0.05 元,仍是三者 *。

便宜没有换来能力的缩水。各家自测基准几乎不重合,目前最可比的第三方口径仍是 Artificial Analysis 智能指数:GLM-5.3-Flash 拿到 57 分;DeepSeek V4 Flash50 分,也就是说智谱用比 DeepSeek 更低的价格,拿到了高出 7 分的第三方评分,这一次被斩的反而是当初立线的那个。

如今,斩杀线的位置每隔几周就会往下挪一次,而每挪一次,能活下来的模型就少一批。

大模型下半场:卷性能落幕,拼的是算力与数据

上半年的叙事还是更多数据、更多参数、更多算力;到了下半年,DeepSeek、智谱、阿里、腾讯集体转身,把赌注压在 " 效率 " 两个字上。当各家 Flash 的权重几乎全部开源、MoE" 大总参、小激活 " 成为行业共识的基础架构,模型厂之间的区别,正在肉眼可见地变小。

架构不再是秘密,真正难复制的只剩两样:算力规模,和数据管线。

算力这一侧,效率模型表面上是把成本打了下来,背后却有一场更烧钱的军备竞赛。

智谱动用 10 万张国产芯片集群支撑 GLM-5.3-Flash 的线上推理;MiniMax 称自己是国内最早建成规模化、长期稳定基础设施体系的两家独立大模型公司之一;腾讯则罕见地公开承认 " 整体算力严重不足 ",拖慢了混元迭代。

同一场竞争里,Flash 恰恰是算力紧张时代的 * 解:320B 的 GLM-5.3-Flash 每次推理只唤醒 18B,770B 的 Hy4 只激活 49B,同样的卡能服务更多用户、摊薄更多成本。与其说厂商选择了效率路线,不如说是算力瓶颈让各家不得不去走效率路线。

但算力用钱能买到,数据却不能。

数据这一侧,预训练语料、后训练数据管线、对齐工程,才是各家真正拉开身位的地方。DeepSeek 靠强化学习与蒸馏,把推理能力压进 13B 激活的模型;Qwen 在多模态语料配比上押注;智谱在数据与对齐工程上积累。

更被寄予期待的是,数据如何形成飞轮?

各家都在押注 Agent,每一次 Agent 调用都是一次真实使用数据的回流,回流进训练,模型更强,便有更多 Agent 接入。谁先跑通 Agent 的规模化闭环,谁就同时拿到了算力之外最深的护城河。

这也是千问的 Flash 发布就在千问办公 Agent 同步上线、模型与业务绑定如此紧密的原因。

在过去卷性能的时代,大家比的是榜单。但卷效率的时代,比的是工程化的能力还有价格。如今价格战把模型压到成本线附近,模型层利润变薄,落到 Agent、端侧与云服务身上的压力变得更重。

接下来模型厂商要么靠规模稳坐头部,要么靠场景做出差异化。一时的便宜不是终局,谁能在成本、效率与数据之间跑通飞轮,谁才能划出下一道斩杀线。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

flash 阿里 腾讯 google 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论