智东西 8小时前
千问智谱连夜开源,都比DeepSeek便宜,国产大模型价格猛卷
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

智东西(公众号:zhidxcom)

编译 | 程茜

编辑 | 云鹏

智东西 8 月 27 日报道,昨晚,阿里千问大模型团队开源多模态 MoE 模型 Qwen3.8-Flash-Next,该模型是基于下一代 Qwen4 架构构建的先导预览版。

Qwen3.8-Flash-Next 主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数,原生支持 262144 token 上下文,并可通过 YaRN 扩展至1 百万 token

相比于 Qwen3.7-Plus,Qwen3.8-Flash-Next 降低了训练与推理成本,训练开销仅约为前者的1/9,但在编程和办公任务上性能更强,且该模型在千问团队放出的基准测试中绝大多数都超过 DeepSeek-V4-Flash 正式版

在价格方面,Qwen3.8-Flash 即将上线千问 AI 平台,对外提供 API 服务,每百万 Tokens 输入1 元,输出3 元,相比空闲时段的 DeepSeek-V4-Flash 输入价格低33.33%,输出价格低33.33%

昨晚,智谱也开源了 GLM-5 系列首个原生多模态模型 GLM-5.3-Flash(320B-A18B),这也是此前在网上爆火的匿名模型 Ox-Alpha(" 牛来 " 模型),同样将价格打了下来。其新模型总参数 320B,在智谱自研 Z.ai Code Bench 体感评估中编程表现与 Claude Opus 4.8 相当,价格更是降到了 GLM-5.3 的 1/10,限时折扣内为 GLM-5.3 的 1/20,为 Opus 4.8 的 1/40。

▲ Qwen3.8-Flash-Next 与 DeepSeek-V4 系列模型价格对比(智东西制图)

Qwen3.8-Flash 将首发上线 " 千问办公 ",API 即将上线。

在千问 AI 平台上,该模型以 qwen3.8-flash 的名称提供服务,千问 AI 平台支持行业标准协议,包括兼容 OpenAI 的 Chat Completions 和 Responses API,以及兼容 Anthropic 的接口,同时 Qwen API 支持 Anthropic API、OpenAI Responses 协议,可直接配合 Claude Code、Codex 使用。

其博客提到,千问提前释出结构上的改动,是为了在发布 Qwen4 完整模型家族之前,先让社区对其进行检验。

在千问的推特评论区下方,不少海外开发者已经迫不及待想要体验下千问的新模型了,还有网友只是一味夸赞称 " 这太强了 "、" 我们不需要 OpenAI"、"Qwen 未来有可能超越 Opus"。

目前,Qwen3.8-Flash-Next 的模型权重在 Hugging Face 与 ModelScope 发布,默认 1 百万上下文并内置官方工具的生产版本。

技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

Hugging Face 开源地址:https://huggingface.co/Qwen/Qwen3.8-Flash-Next

一、十余项测试超过 DeepSeek ‑ V4 ‑ Flash、Claude ‑ Opus ‑ 4.6

Qwen3.8-Flash-Next 围绕 Attention、Residual、Embedding 和 Optimization 四个方面对模型进行了系统升级,在提升模型能力的同时,进一步优化了计算效率、模型容量和训练稳定性。

▲ Qwen3.8-Flash-Next 模型架构

千问大模型团队放出的基准测试结果显示,Qwen3.8-Flash-Next 在智能体、编程、通用能力以及多模态等方面绝大多数都超越了 Qwen3.8 ‑ 27B、Qwen3.7 ‑ Plus、DeepSeek ‑ V4 ‑ Flash ‑ 0731、Claude ‑ Opus ‑ 4.6(Max),拿下第一。

具体来看在纯文本能力方面,Qwen3.8-Flash-Next 在10 项任务拿下第一,超过 Qwen3.8 ‑ 27B、Qwen3.7 ‑ Plus、DeepSeek ‑ V4 ‑ Flash ‑ 0731、Claude ‑ Opus ‑ 4.6(Max)。

其中编程能力上,Qwen3.8-Flash-Next 在智能体编程 DeepSWE1.1、SWE ‑ bench Pro 多语言软件工程上拿下第一,仅在仓库级代码生成 Repo ‑ level code generation 测试中略逊于 DeepSeek。

智能体上,千问新模型在长周期办公任务、专业工作任务、前沿智能体任务的加权部分得分、真实工具调用测试机中均拿下第一,在前沿智能体任务的一次性完全通关率上得分低于 DeepSeek ‑ V4 ‑ Flash。

通用能力上,Qwen3.8-Flash-Next 在指令遵循、科学推理、竞赛代码上拿下第一,仅在多学科综合推理能力上略弱于 Claude ‑ Opus ‑ 4.6。

多模态能力方面,该模型13 项任务均超过其他三个模型拿下第一。

多模态智能体能力中,主要考验模型是否能看懂截图,操作手机、电脑,复现 APP、网页开发、多模态工具调用。Qwen3.8-Flash-Next 在这一部分中均拿下第一。

通用多模态能力主要考察模型的看图理解、长视频、图表、数学能力,Qwen3.8-Flash-Next 在绝大多数测试中均超过其他三个模型,仅在不给特殊推理提示的科研图标分析测试中,分数低于 DeepSeek。

千问还放出了 Qwen3.8-Flash-Next-Base 在 6B 激活参数的情况下,与 Qwen3.8-27B 及 Qwen3.7-Plus 的 base 模型比较结果,其在 14 个 benchmark 中的8 个上取得最优结果,其中 51B 的 N-gram embedding 参数是确定性寻址的,不进入每 token 的矩阵乘预算。

当前基础模型所需的参数量不断增加,上下文窗口长度不断增加,核心问题已不再是究竟能把规模做到多大,而是实现规模化的效率有多高。基于此阿里千问大模型团队进行了架构上的创新,其开源的 Qwen3.8-Flash-Next,正是阿里朝这一目标迈进的阶段性关键成果。

该模型是其基于 Qwen4 架构打造的实验预览版模型,核心是重新深度思考现代大语言模型的核心组件在大规模运行场景下如何协同工作。

二、四大架构创新,让新模型更强更稳更划算

Qwen3.8-Flash-Next 主要包含四大创新点:

1、GDN 与 QSA(通义稀疏注意力)结合,实现高效记忆和精准检索

传统全局注意力可以直接访问所有历史 token,但上下文越长,计算和 KV Cache 访存成本越高。

其延续 Qwen3.5 的架构设计采用GDN+Attention 的 Hybrid 架构:每四层中三层使用 Gated DeltaNet(GDN),将历史信息持续压缩到固定大小的状态中;另一层保留全局 Attention,负责精确检索全局信息。

研究人员对全局 Attention 进一步引入Qwen Sparse Attention(QSA),通过只关注重要上下文来减少长序列下的计算。QSA 通过压缩式轻量 Indexer 在 micro-block(微块)粒度上筛选重要上下文,降低长序列 Attention 开销。这样不仅减少了实际 Attention 的计算量,也降低了 " 寻找重要上下文 " 本身的上下文索引成本。

可以理解为GDN 负责高效 " 记住 ",QSA 负责精准 " 查找 "

在 1M token 上,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高7.6 倍4.9 倍的加速。在贴近线上高缓存复用场景的实验设定下(Prefix Cache 命中率为 90%),Qwen3.8-Flash-Next 在 1M 上下文下的 Prefill 吞吐达到 Qwen3.7-Plus 的8.6 倍

2、引入 Gated Residual(GR,门控残差),给信息更多传递路径

传统 Transformer 架构中,各层持续在同一条 Residual Stream 上读写信息,随着网络加深,早期特征不断与后续信息混合,重要信息更容易被逐渐稀释。

GR 可以看作两种思路的结合:一方面延续 Hyper-Connection(超连接)将 residual stream(残差流)扩展为多分支的设计,另一方面将 GatedNorm 的逐元素动态门控融入 residual read(残差读)。最终原本单一的 residual stream 被扩展成 4 条并行分支,模型可以根据当前内容动态决定从不同分支读取多少信息,以及向不同分支写入多少信息。

这可以把它理解为把一条信息通道扩展成多条车道:有些分支负责局部信息传递,有些则可以把早期信息直接保留到很深的网络层。研究人员实际分析中也观察到,其中一条 branch(残差分支)会自然形成连接第一层 Attention 和大部分中后层的长距离通道。

GR 还进一步简化了 Hyper-Connection:当 read/write 足够灵活后,额外的 branch mixing(分支混合)已经没有明显收益,因此可以直接去掉,减少访存开销和不稳定因素。归一化后的 Gate 同时能够有效抑制 activation outlier(激活异常值)、提升训练稳定性;Residual State(残差状态)支持使用 FP8 存储,进一步降低访存开销。

3、引入 N-gram Embedding,低成本扩展模型容量

研究人员受到 Gemma 3n 中 Per-Layer Embedding(逐层嵌入)和 DeepSeek Engram 等工作的启发,进一步引入 N-gram Embedding,从 Transformer 参数之外的维度扩展模型容量。

普通 Embedding 根据单个 token 查表;N-gram Embedding 则结合当前 token 与前几个 token 组成的局部上下文进行查表,为常见短语和局部模式提供额外表示。其核心优势是可以增加大量参数,同时几乎不增加每个 token 的计算量。

Qwen3.8-Flash-Next额外引入了 51B N-gram Embedding 参数。由于查询位置可以提前确定,这些参数可以存放在 Host Memory 中,通过异步 Prefetch 与模型计算重叠,无需长期占用 GPU 显存。最终,模型只在前部使用一层 N-gram Embedding,以较低的额外成本增加了一个大规模的 " 局部模式记忆库 "。

4、Optimization:优化 Muon 在大模型训练中的使用方式

Qwen3.8-Flash-Next 使用Muon Optimizer训练,并围绕三个关键问题进一步优化 Muon 在大模型训练中的使用方式:正交化精度、Muon 与 AdamW 的参数分工,以及融合参数矩阵的拆分。

对于真正作为二维线性映射的参数,例如 Attention、GDN 和 MoE Expert 中的主要权重,研究人员使用 Muon;Embedding、MoE Router、GR 低秩参数等则继续使用 AdamW。

对于工程实现中融合存储的 QKV、SwiGLU 和 GDN Projection,先按照实际对应的独立线性变换进行拆分,再分别执行正交化。

针对新的模型结构和 Optimizer,研究人员重新拟合了 Scaling Law,结果显示模型可以稳定使用更大的 Learning Rate(学习率)和 Batch Size(批次大小),进一步提升收敛效率和大规模并行训练吞吐。

其实验还发现,过去大模型训练中常见的 Batch Size Warmup(批次大小预热)已经不再必要,从小 Batch 逐渐增加到目标 Batch 并没有改善最终效果,反而需要额外执行 18.8% 的优化器步数。因此,在最终训练配置中,研究人员直接从目标 Batch Size 开始训练。

三、其余架构优化,继承自 Qwen3 ‑ Next 的成熟架构组件

其余的架构优化沿用 Qwen3-Next 所确立、并在 Qwen3.5 – Qwen3.8 系列中不断打磨的设计:

极致稀疏 MoE:在全局负载均衡下,固定激活专家数量而持续增加专家总参数量,可稳定降低训练 loss,因此 Qwen3.8-Flash-Next 采用较大的专家池,每 token 只路由少量专家,并配合一个共享专家。

Multi-Token Prediction:MTP 模块以多步方式训练,保持训练与推理之间的一致性,从而提升实用场景下 speculative decoding(推测解码)的接受率,同时也提升主干本身的性能,其中的全注意力层同样被替换为 QSA。

训练稳定性:保留 Zero-Centered RMSNorm 并对 norm weight 施加 weight decay、注意力输出门控机制,以及 MoE 路由参数初始化的归一化,这些设计使小规模消融结果更可靠,也有助于大规模训练平稳进行。

结语:率先放出新架构预览模型,千问要依托社区能力完成版本打磨

随着企业侧长文档处理、私有化部署、Agent 智能体等高价值场景规模化落地,行业对大模型的评价标准,更看重其冷输入成本、推理带宽开销、硬件适配能力、训练可复现性等工程化指标。

Qwen3.8 ‑ Flash ‑ Next 这套综合架构改进,也证明总参数量已经不再是衡量模型能力的第一指标,激活参数量、冷 prefill 开销、硬件适配能力的权重持续提升。

此外,千问率先放出下一代架构的预览版本,真实社区的复现、二次预训练、FP8 部署、长上下文压测,可以暴露出内部实验难以覆盖的问题,以便在正式版本发布时进行进一步调优。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

阿里 开源 智东西 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论