Qwen4 还没出,架构先开源了。
阿里发布 Qwen3.8-Flash-Next 的全部权重, 同时也是 Qwen4 新架构的早期预览版。
这个新架构它确实够新。
除了常规的 125B 参数 MoE 模型配 6B 激活参数,关键是还附加了 51B 的 N-gram Embedding 参数。
这是个啥呢?
发布公告明确写着,受 DeepSeek 的 Engram 启发,进一步扩展了这种设计。
它的主要优势在于,它可以添加大量参数,而每个 token 几乎不需要额外的计算。
Qwen3.8-Flash-Next 大幅降低了训练和推理成本,训练时间仅为原来的九分之一,却在代码和办公任务方面表现出色。
Qwen3.8-Flash-Next 的跑分可以总结在小模型里超过 DeepSeek V4 Flash 正式版,向上多项测试可以挑战 Claude-Opus-4.6(Max)。
模型权重公开后,也确实有人在 24GB 显存的 4090+128G 内存上成功部署,而且不用量化。
虽然之前发布的密集模型 Qwen3.8-27B 在消费硬件上体验更好。
但这一次,Qwen3.8-Flash-Next 证明了在消费级硬件上跑满血版 MOE 模型也是完全可行的。
DeepSeek Engram 更复杂,Qwen 更精简
传统 Transformer 只有一个词嵌入层,每个 token 对应一个向量。
而 Qwen 的 N-gram Embedding 和 DeepSeek 的 Engram 都是利用当前 token 及其前面若干 token 组成的局部上下文作为 key,通过确定性的哈希函数在一张巨大的嵌入表中查到对应的向量,时间复杂度为 O ( 1 ) 。
DeepSeek 的 Engram 论文首次将这一思路形式化为 " 条件记忆 "(conditional memory),并将其定位为与 MoE 的 " 条件计算 "(conditional computation)平行的第二种稀疏方式。
Engram 论文通过 Sparsity Allocation 实验发现了一条 U 形缩放定律:在总参数和 FLOPs 固定的前提下,把大约 20% – 25% 的稀疏参数预算从 MoE 专家重新分配给 Engram 嵌入表,能获得比纯 MoE 更低的验证损失。这一分配比例在 5.7B 和 9.9B 两个规模上保持稳定,最优点均落在 75% – 80% 分配给 MoE 的区间。
Qwen3.8-Flash-Next 在技术报告中直接引用了 Engram 论文和 Gemma 3n 的 Per-Layer Embedding 作为灵感来源,并在最终模型中配置了 51B 的 N-gram 嵌入参数,附加在 125B 主模型之上。
Engram 的设计有四个关键组件。
第一是 Tokenizer Compression,通过 NFKC 归一化和小写映射把 128k 词表压缩 23%,消除 "Apple" 和 "apple" 这类语义等价但 ID 不同的冗余。
第二是 Multi-Head Hashing,对每个 N-gram 阶数使用 K 个独立哈希头映射到素数大小的嵌入表中以缓解冲突,最终把所有检索到的向量拼接成一个记忆向量。
第三是 Context-aware Gating,用当前层的隐藏状态作为 Query、检索到的记忆作为 Key 和 Value,通过 RMSNorm 归一化后的缩放点积计算出一个标量门控值,决定是否采纳这条记忆——如果记忆与当前上下文矛盾,门控趋近于零自动抑制噪声。
第四是一个核大小为 4、膨胀率等于最大 N-gram 阶数的深度可分离因果卷积,用于扩展感受野并增加非线性。此外,Engram 还专门设计了与多分支架构的集成方案:多个分支共享一张嵌入表和一个 Value 投影矩阵,但各自拥有独立的 Key 投影以实现分支级别的差异化门控。
Qwen3.8-Flash-Next 的 N-gram Embedding 在公开博客中没有披露同等细节深度的设计说明,但从已公布信息可以看出几点差异。
Qwen 最终只使用了一个 N-gram Embedding 层,而 Engram 在 27B 模型中部署于第 2 层和第 15 层两个位置。
DeepSeek 的 Engram 论文在严格的等参数、等 FLOPs 条件下完成了对照实验。在 26.7B 总参数规模上,Engram-27B 相比纯 MoE-27B 基线在知识任务上提升了 MMLU +3.0、CMMLU +4.0,在推理任务上提升了 BBH +5.0、ARC-Challenge +3.7,在代码数学上提升了 HumanEval +3.0、MATH +2.4。
Engram 论文还通过 LogitLens 和 CKA 分析揭示了增益来源:Engram 让模型的第 5 层表示在功能上等价于纯 MoE 基线的第 12 层,相当于在不增加实际层数的情况下增加了网络的有效深度。
Qwen 的 51B 嵌入参数远超 Engram 论文中验证过的最大规模(Engram-40B 的嵌入参数为 18.5B),这意味着 Qwen 在实践中把 Engram 论文中观察到的 " 嵌入槽数量与验证损失呈对数线性关系 " 这一结论推到了更大的尺度。
不过由于 Qwen3.8-Flash-Next 同时引入了 QSA 稀疏注意力、Gated Residual 和 Muon 优化器等多项改动,N-gram Embedding 的单独贡献无法从最终结果中精确隔离。
四项架构升级,从注意力到优化器全换了
除了嵌入层外,Qwen3.8-Flash-Next 还在注意力、残差、和优化三个维度上做了系统性升级。
注意力层面,模型延续了 Qwen3-Next 以来 "GDN+ 注意力 " 的混合设计。
48 层网络中,每 4 层有 3 层使用门控 DeltaNet 将历史信息压缩进固定大小的状态,剩余 1 层负责全局精确检索。
但这次全局注意力从之前的 Gated Attention 升级为全新的 Qwen Sparse Attention(QSA)。
QSA 的做法是先用一个轻量索引器把序列聚合成 " 微块 ",在块级别估计上下文重要性,再只对最相关的区域做注意力计算。这不仅降低了注意力本身的开销,连索引过程的计算量也一并压了下去。
在 100 万 token 的长上下文场景下,QSA 的注意力内核在预填充和解码阶段分别实现了 7.6 倍和 4.9 倍的加速。在 90% 前缀缓存命中率的在线服务场景中,Qwen3.8-Flash-Next 在 100 万 token 上下文长度下的预填充吞吐量达到了 Qwen3.7-Plus 的 8.6 倍。
残差连接方面,引入了 Gated Residual(GR),把传统 Transformer 的单条残差流扩展为 4 条并行分支,通过动态门控机制控制每一层对各分支的读写。这样做的效果是加强了跨层信息流动和训练稳定性,同时残差状态还支持 FP8 存储以降低显存带宽开销。
优化器方面,用 Muon 替代 AdamW 作为主优化器,并围绕正交化精度、Muon 与 AdamW 的分工以及融合参数的拆分做了改进。
Qwen 还公布了一个新发现:大规模训练中常见的 Batch Size Warmup 在新架构上不再必要,直接用目标 Batch Size 开训的效果一样,反而省掉了 18.8% 的优化器步数。
百万 token 上下文,每百万输入 token 定价 0.16 美元
Qwen3.8-Flash-Next 原生支持 262144 token 上下文,通过 YaRN 可扩展至 100 万 token。模型权重已在 HuggingFace 和 ModelScope 开放下载。
在 QwenCloud 上,这个模型以 "qwen3.8-flash" 提供 API 服务,也是加入了 100 万上下文默认支持和官方内置工具的版本,输入定价为每百万 token 0.16 美元,输出为每百万 token 0.47 美元。
作为参照,同门旗舰 Qwen3.8-Max 的输入和输出定价分别是 2.00 和 6.00 美元,Flash-Next 的成本约为旗舰的十二分之一。
部署生态方面,通义千问这次直接兼容了 Anthropic 和 OpenAI 两套 API 协议,可以直接插入 Claude Code、OpenAI Codex 等主流编程助手使用。
团队还同步推出了 Qoder CLI 和 Qwen Code 两个自研编程工具,以及与 OpenClaw 的集成。
阿里 AI 办公平台 QwenWork 也已将 Qwen3.8-Flash-Next 集成为其 "Standard" 模式的底层模型。
至于未来的 Qwen4 本体,只能说,还会更强。
参考链接:
[ 1 ] https://qwen.ai/blog?id=qwen3.8-flash-next
[ 2 ] https://x.com/analogalok/status/2092697021790708148
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦