
智东西
作者 | 程茜
编辑 | 心缘
智东西 8 月 13 日报道,刚刚,阿里千问大模型团队开放 Qwen3.8-2.4T-A95B 模型权重!
Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,于 8 月 3 日发布,拥有更多功能,例如视觉输入功能、无需思考即可使用、默认支持 1 百万上下文长度处理、内置官方工具等。

Qwen3.8-2.4T-A95B 开源主页(图源:Hugging Face)
魔搭社区模型下载地址:
https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B
Hugging Face 模型下载地址:
https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
这也是阿里千问首次将 Max 级别的旗舰模型对外开放权重。根据魔搭社区的官方预告,更小杯 Qwen3.8-27B 已在路上。
Qwen3.8-2.4T-A95B 的模型总参数为 2.4 万亿,每个 Token 激活 950 亿参数,原生支持 262144 Token 上下文,可扩展至 101 万 Token。该模型采用 Qwen3.5 的底层架构,在编程、办公、科研工作、长周期智能体任务上实现性能提升。
Qwen3.8-2.4T-A95B 模型可以通过SGLang、vLLM 和 TokenSpeed 推理引擎部署,正式部署时需要使用各框架针对 Qwen3.8 的最新 Recipe,并根据权重精度、GPU 型号与数量选择并行策略。
Qwen3.8 模型默认以思考模式运行,在生成最终回答前,模型会先生成由不支持关闭思考模式。
与此同时,开源 AI 项目团队 Unsloth AI 靠动态 1 ‑ bit 分层选择性量化技术,将 Qwen3.8 ‑ 2.4T ‑ A95B 原始 4.9TB 的模型体积压缩至 397GB,存储空间缩减91%。
借助 Unsloth ‑ Desktop 工具,设备内存 + 显存总量达到 410GB 以上即可本地运行该模型。

Unsloth AI 压缩 Qwen3.8-2.4T-A95B(图源:X)
预告 Qwen3.8 发布时,千问称该模型 " 可能是除了 Fable 5 外最强大的模型 "。
基准测试结果显示,在论文复现基准 PaperBench 中,Qwen3.8-Max 取得 93.0 分,高于 GPT-5.6 Sol、Fable 5 和 Claude Opus 4.8。在评估电脑操作能力的 OSWorld-Verified 中,Qwen3.8-Max 以 86.1 分位居参评模型首位;在参数化 CAD 基准中,其 91.5 分同样超过 Fable 5、GPT-5.6 Sol 和 Gemini 3.1 Pro。
不过,Qwen3.8-Max 尚未在所有测试中取得领先。
在 TerminalBench 2.1 中,其成绩为 86.6 分,略低于 GPT-5.6 Sol 的 88.8 分;在 SWE-bench Pro 中,Qwen3.8-Max 获得 67.7 分,落后于 Fable 5 的 80.0 分和 Claude Opus 4.8 的 69.2 分;在长视频基准 VideoMME v2 中,其 68.3 分也低于 GPT-5.6 Sol 的 71.1 分。

Qwen3.8-Max 基准测试结果(图源:阿里)
Qwen3.8 的重点是模型能否脱离人工持续陪伴,自己把一个跨度数小时、数天甚至数周的任务做完。
千问团队让 Qwen3.8-Max 连续自主编程约 16 天、独立复现并改进一篇研究论文、参加真实算法竞赛,还让它在超过 2000 轮交互中经营一家虚拟电商企业。
在连续自主编程 16 天的任务中,Qwen3.8-Max 自主构建了自进化 Harness,并持续完成社区需求收集、issue 派发、代码生成、验证与自我修复。

Qwen3.8-Max 执行自主编程任务(图源:阿里)
API 价格方面,Qwen3.8-Max 国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中 1.5 元;海外每百万 Tokens 输入 2 美元、输出 6 美元,隐式缓存命中 0.25 美元。

API 价格对比表(智东西制图)
结语:全球三大顶流模型齐更新!Qwen3.8 拉高开源天花板
一夜之间,三家大模型顶流轮番炸场:先是马斯克甩出自家最强模型 Grok 4.6,其中 Grok 4.6 high 在其披露的多项智能体编程和知识工作基准测试中综合性能与 GPT-5.6 Sol Max、Claude Fable 5 Max 相当;接着 DeepSeek-V4-Pro 正式版上线,综合性能接近、部分指标超越 Claude Fable 5;最后是 Qwen3.8 开放权重。
可以看出,这三家公司都着重强化了模型多步骤长周期自主工作能力,开始比拼模型独立承接完整项目、自主闭环干活的智能体水平。
此外,阿里千问团队此次将 2.4 万亿参数顶级旗舰模型正式开放权重,是中国开源大模型布局的关键落子。


登录后才可以发布评论哦
打开小程序可以发布评论哦