驱动之家 16小时前
Qwen3.8-27B开源即用!昇腾0Day适配:270亿参数推理效率拉满
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 8 月 15 日消息,阿里巴巴旗下千问大模型团队于 8 月 14 日晚间正式开源 Qwen3.8-27B 模型。昇腾在模型开源后同步完成 0Day 适配,通过 vLLM-Ascend 开源推理引擎实现 Qwen3.8-27B 在 Atlas 800 A3、Atlas 850E 超节点上的高效推理部署。

Qwen3.8-27B 是一款原生多模态稠密(Dense)模型,参数量 270 亿。模型原生支持 262K tokens 上下文长度,通过 YaRN 技术可外推至 1M tokens。

在架构上,Qwen3.8-27B 采用混合线性注意力设计,64 层中 48 层为 Gated DeltaNet 线性注意力、16 层为 Full Attention。这种设计打破了长序列下 O ( n ² ) 的计算复杂度,兼顾了长序列处理效率与上下文建模能力。

在性能表现上,Qwen3.8-27B 在编程和办公场景中显著超越前代 Qwen3.6-27B,整体水平优于 Qwen3.7-Plus。

该模型在 Agentic terminal coding 测试中得分 73.0(前代 63.4),在 SWE-bench Pro 测试中得分 61.7(前代 53.5)。模型新增了 reasoning_effort 功能,可根据任务难度动态调节思考深度以节省计算资源。

针对 Qwen3.8-27B 的结构特点,昇腾采用多项关键技术进行优化。在 Prefill 阶段采用 GDN 融合算子,以 Chunk 方式高效处理长序列,减少中间数据搬运和算子调度开销。

vLLM-Ascend 支持 W8A8 量化部署,将权重与激活值从 BF16 量化至 8-bit,充分发挥昇腾 NPU 的 INT8/MXFP8 算力。

同时利用 Qwen3.8 的 MTP 投机推理能力,通过 MTP 模块预测后续 Token、主模型并行校验,减少主模型调用次数。Decode 阶段支持将计算捕获为设备侧执行图(ACLGraph),消除重复调度开销。

目前 Qwen3.8-27B 已在 Hugging Face 和魔搭社区(ModelScope)同步上线。昇腾已提供基于该模型的部署指导,用户可通过 vLLM-Ascend 开源推理引擎快速完成推理部署。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:红茶

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

阿里巴巴 开源 指导 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论