分析师/会磊
校对/竹心
策划/Eason
就在八月中旬,DeepSeek实施了"峰谷分时计费"新规,工作日高峰时段API调用价格大幅上调,经第三方核算显示,输出价格最高涨至旧版的4.7倍。与此同时,OpenAI、谷歌、Anthropic也相继上调价格或收紧免费额度。
过去两年持续走低的模型调用价格曲线,在2026年夏天开始集体掉头。靠补贴维持的低价策略,在持续攀升的算力账单面前终是难以为继。
就在市场普遍认定"涨价已成定局"时,8月26日晚,阿里千问团队交出了一份完全相反的答卷。
新发布的Qwen3.8-Flash在多模态、编程、智能体等多项基准测试中超越了Claude Opus 4.6和DeepSeek-V4-Flash,API定价却压到了每百万Token输入1元、输出3元,最低仅为DeepSeek-V4-Flash高峰时段价格的三分之一。训练成本也比前代大幅压缩,仅需原先九分之一的资源即可完成。
这不是一次常规版本迭代。在整个行业试图用提价来消化算力压力的节点上,阿里给出了另一种解法——用架构效率的重构重新定义成本结构,把大模型商业化的竞赛拉入了一条全新的轨道。
1元/百万Tokens,
大模型的"斩杀线"被重新划定了
过去半年,大模型圈流行一个词叫"斩杀线"。它不是指单纯的低价,而是一道分水岭:当一款模型以远低于同行的成本提供相近甚至更强的能力时,竞品就会迅速失去商业存在感——因为切换底层模型的成本几乎为零。
DeepSeek之前被公认为这条线的划定者,原因不在于它绝对便宜,而在于它迫使所有人重新回答同一个问题:为同等水平的智能,你愿意付多少钱?
Qwen3.8-Flash把这个问题又往前推了一大步,直接给出了一个近乎不讲道理的答案。
先看价格。每百万Tokens输入1元、输出3元,这是什么概念?这是Claude Opus 4.6价格的3%,是DeepSeek-V4-Flash闲时价格的三分之二、忙时价格的三分之一。训练成本更是夸张,仅用了Qwen3.7-Plus九分之一的资源就完成了训练。
再看性能。这是一个多模态MoE模型,总参数125B,额外配备51B的N-gram Embedding,但每个Token只激活6B参数——也就是60亿参数干活,却要打出千亿级的效果。事实是,它确实做到了。
仅完成预训练的基座模型,在通用能力SuperGPQA、数学推理、编程SWEBench-Pretrain等基础评测上,就已经超过了3倍其大小的Qwen3.7-Plus基座。
经过后训练,性能跃迁更猛:智能体编程SWE-bench Pro领先Opus 4.6多达9.1分;长程专业任务CoWorkBench、真实工具调用Toolathlon Verified均超越DeepSeek-V4-Flash;多模态方面,AndroidWorld、ERQA、MathVision 等基准同样大幅领先。
旗舰级的能力,打到了"日常价"区间。这直接动摇了一个行业默认假设:那些昂贵的企业级模型,是否还天然拥有企业的"默认调用权"?答案正在变得清晰。默认调用权不会永远属于最贵的那个,而会属于"够用且足够便宜"的那个。
1/3的价格,凭什么敢卖这么便宜?
Qwen3.8-Flash真正让行业倒吸凉气的,不只是把Token单价打下来了,还迫使所有人重新思考:衡量大模型性价比的那把尺子,是不是该换了?
过去很简单,就看每百万Tokens多少钱。输入多少、输出多少,拉个表一比,谁便宜谁是王。但这个标准正在失效。因为一次真实任务的成本,远不止API调用费。过程中的等待时间、失败后的重复调用、多个Agent之间来回协同的轮次、最后人工接管、逐条修正结果都是成本。一个模型如果单价便宜但经常出错、需要反复重试,跑下来的真实成本可能反而更高。
大模型的斩杀线,正在从"每百万Token值多少钱",转向"每块钱最终能完成多少工作"。
Qwen3.8-Flash的价值在于同时压低了这些隐性成本。而它能做到这一点的关键,藏在一系列架构层面的改动里。
首先,在注意力机制方面,GDN与QSA形成配合。长上下文的麻烦在于标准注意力的计算量随序列长度呈平方级增长。行业解法大致分两派:线性注意力用常数级内存换掉平方增长,但精确回溯能力会打折扣;稀疏注意力只对关键区域精细计算,但找重点本身也要算力。Qwen把两者结合起来,更关键的是引入了自研的QSA,用一个轻量级indexer把序列聚合成块,在块级别判断重要性,把"找重点"的成本也一并削掉。在1M Token的超长上下文场景下,Prefill阶段加速最高达到7.6倍。
图源:千问大模型官方公众号
其次,将信息传递通道从一条扩成四条。传统Transformer各层共用一条残差流,网络越深早期特征越容易被稀释。新方案把单一通道扩展成4条并行分支,模型根据内容动态决定信息怎么传。实际训练中观察到,其中一条分支自然形成了连接第一层和大部分中后层的长距离通道——模型确实用出了不同的分工。
再者,将51B参数挪出了显存。模型额外引入了51B的N-gram Embedding参数,结合当前Token与前几个Token的局部上下文查表,为常见模式提供额外表示。由于查询位置可以提前确定,这51B参数直接存放在主机内存中,通过异步预取与计算重叠,不长期占用昂贵的GPU显存。相当于以极低成本外挂了一个大规模的"局部模式记忆库"。
最后,训练方式也做出相应调整。针对新结构重新拟合了Scaling Law,模型可以稳定使用更大的学习率和批量大小。一个有意思的发现是,过去常见的批量大小预热已经没有实际收益,反而要多跑近19%的优化步骤,干脆直接从目标批量开始训练。
这几处改动叠加的效果很直观:激活参数只有前代三分之一、训练开销仅九分之一的模型,在多数预训练评测上追平甚至超过了一个大三倍的前代。
Qwen4架构
"提前预览",阿里在下一盘什么棋?
这套费了这么大功夫做出来的新架构,为什么没有首发在旗舰版Qwen3.8-Max上,而是先给了主打性价比的Flash?
把8月份发布的几款模型放在一起看,脉络就很清晰了。月初亮相的Qwen3.8-Max是家族的旗舰担当,总参数2.4T、激活95B,主打能力上限,是向外界展示技术高度的门面。月中开源的Qwen3.8-27B面向的是本地部署和开发者生态,体量适中,方便企业拿去做私有化微调。而刚刚落地的Qwen3.8-Flash,补上的是第三个位置——高频调用、大规模量产、对成本和响应速度最敏感的真实生产场景。
这其实是一个完整的产品矩阵:旗舰秀肌肉,中型打生态,Flash拼效率。三者各司其职,覆盖了从能力标杆到规模化落地的全链路。
但最值得琢磨的一点是,前两款模型沿用的都是前代Qwen3.5架构迭代而来,只有Flash吃上了这套名为"Next"的全新架构。新架构没有先喂给旗舰,反而先给了最讲究性价比的那一款。
这个反常规的安排,细想之下其实很合理。
一方面,新架构要验证的不是"能不能更聪明",而是"能不能更省"。这套架构的核心目标是提升单位算力的产出效率,也就是在同等算力消耗下完成更多有效工作。而Flash这个产品线,面对的就是每天数以亿计的高频调用,对成本和速度的变化极其敏感。新架构到底能不能扛住真实场景的规模化考验,放在Flash上检验,得到的反馈最直接、也最有说服力。
另一方面,这不是阿里第一次用这种"先预览后铺开"的节奏来推新技术。2025年9月,Qwen3-Next就扮演过同样的角色——它提前释出了Gated DeltaNet混合架构,经过社区检验和打磨后,这套设计被一路沿用到了Qwen3.5和Qwen3.8系列。这次开源版本的名字里也带着"Next"这个后缀——它明确告诉社区,你看到的还不是最终形态,而是下一代架构的骨架预览。如果把这个逻辑再往深推一层,还能看到另一个信号:阿里对开源的态度正在从"开放成果"走向"开放过程"。
把尚在演进中的架构设计提前交给社区,意味着它愿意在技术路线尚未完全定型时就接受外部检验和反馈。这种做法的风险更高,但如果跑通了,社区积累的信任和对新架构的熟悉度,会在Qwen4正式发布时转化为生态上的先发优势。
把这一切串起来,阿里这步棋的意图就清晰了:先用效率优先的Flash承接规模化调用、验证新架构的可靠性,同时用开源的方式把检验工作交给社区,跑通之后,再把成熟的技术方案反哺给整个Qwen4家族。最终指向的,是一个覆盖从能力标杆到性价比之选的全链条、全尺寸的开源模型矩阵。
写在最后
Qwen3.8-Flash发布的真正价值,不在于阿里又打了一轮价格战,而在于它证明了另一条路走得通——用架构效率的重构来消化算力成本,而不是把压力转嫁给用户。当整个行业都在用"涨价"来回应算力焦虑时,阿里选择把"降本"的工作留给自己,把"降价"的成果交给市场。
此外,Qwen3.8-Flash-Next的开源版本已经释放,全球开发者可以提前在下一代架构上搭建应用。当30万个衍生模型已经在Qwen生态上生长,当全球下载量突破30亿次,阿里真正在做的,已经不只是卖一个模型,而是在卖一张通往AI生态的门票。
大模型的第一阶段竞争,看谁更聪明;第二阶段的竞争,看谁更便宜;而第三阶段的竞争,看谁能用最低的成本,让最多的人用起来。
阿里正在押注的,是第三阶段。
转载、采访报道:Tina(微信:beijingyh1992)
榜单、市场合作:小新(微信:dyxsmxx)
内容合作:Kim(微信:beijingkim2020)
会员合作:Sherry(微信:sherry_199909)
视频合作:Rita(微信:qyqx20220202)
更多内容
【人工智能】3.45亿 VS 1.66亿:豆包逼急阿里,千问携40亿淘宝商品库打响"AI购物第一枪" |一觉醒来,马斯克亲手解散xAI!22万张GPU全给Claude,AI战局一夜改写|68元起,豆包迈向收费第一步:免费的"代价",终于兜不住了|Anthropic"连坐"封号、Cursor 9秒删库:AI反噬企业的惨痛一课,代价太贵了|阿里"快乐小马"开启灰度测试:用原生音画定义AI视频的下半场 |每秒10米、无头无手、重心贴地:宇树H1如何让机器人"飞"起来? | 腾讯扔出一只浏览器"龙虾",浏览器赛道迎来最强搅局者| "太危险了,不敢公开发布":Claude Mythos为何让硅谷巨头集体恐慌| 字节、阿里、腾讯的AI工业化暗战:谁在建造AI时代的"工厂"?| 从工具到生态:银联APOP框架发布,勾勒智能体支付新蓝图| 日均120万亿Token,中国大模型终于跑出一个"全球第三"| Claude Code"被开源":一场51万行代码的意外漂流,正在加速AI开发者的竞赛|没等来V4,等来大升级?Deepseek宕机一夜,是重大事故还是偷偷变强|从偏科生到"人形第一股":王兴兴的十年逆袭|亲手砍掉Sora,奥特曼在下一盘什么棋?|龙抬头,向AI"抬头":一部AI短剧如何"捅破"传统广告的天花板|Token经济:谁在瓜分"小龙虾"带来的万亿红利?|谷歌AI Studio深夜放大招:全栈Vibe编码体验上线,一句话开发原生应用
【行业深度】具身智能"爆发",谁将是背后的"投资之王"? | AI会革了百度的命吗? | 真假混战:Agent元年,如何拨开概念迷雾?| 没找到刚需:人形机器人是个好生意吗 | 用得起来 还有"人样" 2025世界机器人大会人满为患 | 2025年WAIC:一票难求,800厂商从"概念"走向"落地" | AI浪潮下,数据库如何"进化"?| AI Agent是中国SaaS的解药 | 央国企的AI征途:抢跑还是稳行?|出走大厂的95后CEO们,已在AI赛道融资数亿|这波AI风口,让青年投资人踩中了|深圳实验创投"群英谱":一所中小学的"硬核"造星之路
【人物周刊】中台化架构+场景化落地:迈富时如何用AI-Agentforce构建企业"智能业务闭环"?|行业困于"伪智能",原力无限以VLA与世界模型双线破局|从技术先锋到生态构建者,贝锐CEO讲述19年"连接革命"与"软硬一体"突围之路 | 一群清华人,与具身智能的四十年 | 用AI Agent征战海外市场| Agent让营销从"人找货"变"货追人" | 专访白惠源:撕掉"阿里副总裁"标签,数亿资金押注"下一代AI"|姚期智和他的"姚班":人生只为一大事而来 | 朱啸虎:萧条时代下的迷途猎手|雷军和他的"小米哲学":把风口玩到next level
【行业研究】《2025年中国企业级AI Agent应用实践研究报告》 | 《2025年中国金融业数据库国产替代能力评估报告》| 《大模型时代 2025年央国企数智化转型新实践与新范式》|《2025年中国IT后市场发展研究报告》| 《2024年央国企RPA市场研究报告》|《2024年中国AI大模型产业发展与应用研究报告》|《2024年中国银行业数据库市场研究报告》|《2024年中国CRM市场研究报告》|《2024年中国智能客服市场研究报告》|《2024年中国网络靶场市场研究报告》| 《2024年中国交通运输行业数字孪生市场研究报告》
关注「第一新声」并设置星标,第一时间GET行业信息


登录后才可以发布评论哦
打开小程序可以发布评论哦