阿里巴巴旗下千问(Qwen)团队于 8 月 3 日正式发布千问 3.8-Max,总参数量 2.4 万亿,激活参数 95B,是千问家族迄今规模最大、能力最强的模型。这也是千问首次将 Max 级别模型开源——权重将于下周在开源社区 Hugging Face 和 ModelScope 发布。
定价方面,千问 3.8-Max 通过千问 AI 平台(阿里云)提供 API 调用:输入 2.0 美元 / 百万 tokens,输出 6.0 美元 / 百万 tokens,隐式缓存 0.25 美元 / 百万 tokens。
基准测试显示,千问 3.8-Max 在编程智能体和通用智能体多项指标上与 Anthropic Fable5 表现相当,部分指标超越后者。例如,PaperBench 得分 93.0,高于 Fable5 的 88.8;CoWorkBench 得分 74.8,与 Fable5 的 75.9 接近;WideSearch 得分 81.9,与 Fable5 的 81.2 持平。

性能:与 Fable 5 相当,部分超越
根据千问团队发布的完整基准测试数据,Qwen3.8-Max 在多个核心指标上与 Anthropic Claude Fable 5 持平或超出:
PaperBench(论文能力):Qwen3.8-Max 得分 93.0,超过 Fable 5 的 88.8 和 GPT-5.6 Sol 的 90.5
IFBench:Qwen3.8-Max 82.8,Fable 5 为 63.5,GPT-5.6 Sol 为 72.7
HealthBench:Qwen3.8-Max 60.2,超过 GPT-5.6 Sol 的 55.3
CoWorkBench(通用协作):Qwen3.8-Max 74.8,Fable 5 为 75.9,差距极小
JobBench(AI 工作能力):Qwen3.8-Max 53.4,接近 Fable 5 的 57.4
多模态方面同样表现突出:
OSWorld-Verified:Qwen3.8-Max 86.1,超过 Fable 5 的 85.0
AndroidWorld:85.3,Fable 5 为 88.8
MLVU(长视频):90.8,Fable 5 无数据
值得注意的是,Fable 5 的部分结果可能包含回退机制,千问团队在注释中对此作了说明。

编程能力:从空文件夹到生产级交付
千问团队用三个真实案例测试了千问 3.8-Max 的自主编程能力,全程无人工介入。
案例一:十天级自动编程。 模型从零创建 oh-my-cli 项目,自主运行约 16 天,累计完成 265 次 commits、127 个 PR、151 个 issues。它将用户反馈、社区实践与自测结果统一纳入工程循环,实现需求自动领取、代码生成、测试验证的完整闭环。

案例二:复现并超越论文。 模型独立工作约 125 小时,写下约 7,600 行代码,执行超过 1,100 步操作,跑了 33 轮 GPU 训练,完整复现了论文《Unified Data Selection for LLM Reasoning》的六项主要结论。随后进入 " 自我进化 " 阶段,提出并测试 18 种改进方案,最终在竞赛级数学基准 AIME24 上比论文原方法再提升 2.7 分。

案例三:24 小时击败 87% 人类队伍。 模型参加 WWW2025 多模态对话意图识别挑战赛,在 526 支人类队伍中,经 45 次提交迭代,准确率从 0.60 升至 0.853,击败 458 支队伍。

办公与长程任务:数百职业场景的生产级验证
千问团队在数百种高价值职业场景中测试了千问 3.8-Max 的实际交付能力。
企业合规律师:单次通读数百份文档,标出 1,284 条相关条款,一小时内完成——同等工作通常需要法务团队约一周。
UI/UX 设计师:生成包含 8 个页面的高保真可交互原型,全程未经人工返修。
结构工程师:仅凭一份图纸,在浏览器中还原 30 层写字楼的抗震结构模型,传统流程需一周以上。
量化研究:从一句任务描述出发,调度约 330 个子智能体,完成约 6,000 次回测,将原本需要数周的量化研究压缩为一次对话内完成。
在 E-Commerce Bench(365 天电商经营模拟基准)中,千问 3.8-Max 以 ¥ 416,252(4.16 倍回报)胜出,超过第二名 GLM 5.2 达 38%,较上一代千问 3.7-Max 提升 152%。

芯片设计:500 轮交互,面积缩减 81%
千问 3.8-Max 在芯片设计优化任务中展示了长程自主规划能力。
目标是优化一个 G CD/RSA 密码硬件加速器的逻辑门数量。模型在无参考设计、无人工干预的条件下,历经约 500 轮交互、71 次评估,跨越 13 个关键里程碑,将初始设计从 8,298 门优化至 678 门,在所有参评模型中表现最优。
物理实现层面,芯片面积从 106 × 106 µ m ² 收缩至 46 × 46 µ m ²,布线长度从 33,369 µ m 降至 4,187 µ m,并实现 500 MHz 频率下的时序闭合,芯片面积整体缩减 81%。

多模态能力:视觉贯穿执行全流程
千问 3.8-Max 的视觉能力不止于 " 看懂图片 ",而是作为持续反馈回路贯穿任务执行。
模型在执行过程中会持续观察中间产物——检查页面布局、物体方向、动画效果——发现问题后自主定位偏差并修正。千问团队将这一能力定义为 " 原生视觉反馈回路 "。
基准测试方面,千问 3.8-Max 在 OSWorld-Verified 得分 86.1,超过 Fable5 的 85.0;AndroidWorld 得分 85.3,接近 Fable5 的 88.8;ParametricCAD Bench 得分 91.5,超过 Fable5 的 87.5。
为便于开发者接入,千问团队同步推出千问 -MM-Plugins,为不同智能体框架提供图像与视频处理、多模态记忆、视觉工具调用等扩展支持。

开放接入:支持 Claude Code、Codex 等主流框架
千问 3.8-Max 现已通过千问 AI 平台提供 API 服务,支持 OpenAI 兼容协议和 Anthropic 兼容协议,可直接与 Claude Code、Codex、Qoder CLI、千问 Code、OpenClaw 等主流开发工具集成。
API 支持 reasoning_effort 参数调节推理深度:xhigh(默认,适合复杂任务)、medium(平衡准确性与速度)、low(优化速度与成本)。
模型权重将于下周在 Hugging Face 和 ModelScope 开源,届时千问 3.8-27B 也将同步开源。


登录后才可以发布评论哦
打开小程序可以发布评论哦