快科技 8 月 15 日消息,阿里巴巴旗下千问大模型团队于 8 月 14 日晚间正式开源 Qwen3.8-27B 模型。昇腾在模型开源后同步完成 0Day 适配,通过 vLLM-Ascend 开源推理引擎实现 Qwen3.8-27B 在 Atlas 800 A3、Atlas 850E 超节点上的高效推理部署。
Qwen3.8-27B 是一款原生多模态稠密(Dense)模型,参数量 270 亿。模型原生支持 262K tokens 上下文长度,通过 YaRN 技术可外推至 1M tokens。
在架构上,Qwen3.8-27B 采用混合线性注意力设计,64 层中 48 层为 Gated DeltaNet 线性注意力、16 层为 Full Attention。这种设计打破了长序列下 O ( n ² ) 的计算复杂度,兼顾了长序列处理效率与上下文建模能力。
在性能表现上,Qwen3.8-27B 在编程和办公场景中显著超越前代 Qwen3.6-27B,整体水平优于 Qwen3.7-Plus。
该模型在 Agentic terminal coding 测试中得分 73.0(前代 63.4),在 SWE-bench Pro 测试中得分 61.7(前代 53.5)。模型新增了 reasoning_effort 功能,可根据任务难度动态调节思考深度以节省计算资源。
针对 Qwen3.8-27B 的结构特点,昇腾采用多项关键技术进行优化。在 Prefill 阶段采用 GDN 融合算子,以 Chunk 方式高效处理长序列,减少中间数据搬运和算子调度开销。
vLLM-Ascend 支持 W8A8 量化部署,将权重与激活值从 BF16 量化至 8-bit,充分发挥昇腾 NPU 的 INT8/MXFP8 算力。
同时利用 Qwen3.8 的 MTP 投机推理能力,通过 MTP 模块预测后续 Token、主模型并行校验,减少主模型调用次数。Decode 阶段支持将计算捕获为设备侧执行图(ACLGraph),消除重复调度开销。
目前 Qwen3.8-27B 已在 Hugging Face 和魔搭社区(ModelScope)同步上线。昇腾已提供基于该模型的部署指导,用户可通过 vLLM-Ascend 开源推理引擎快速完成推理部署。

【本文结束】如需转载请务必注明出处:快科技
责任编辑:红茶


登录后才可以发布评论哦
打开小程序可以发布评论哦