过去两年,我们判断一个大模型够不够强,往往会问:它能不能回答复杂问题,数学推理怎么样,代码写得准不准。
但当模型能力逐渐逼近,新的问题已经变成:如果人不再守在旁边,它能不能把一件事继续做下去?
不是生成几段代码,也不是给出一份看起来完整的方案,而是自己拆解任务、调用工具、检查结果,在遇到错误后重新调整,最后交付一个真正可用的成果。
这正是阿里新一代旗舰模型 Qwen3.8-Max 想要回答的问题。
8 月 3 日,Qwen 团队正式发布 Qwen3.8-Max。它拥有 2.4 万亿总参数,是目前规模最大的千问模型;但相比这个惊人的数字,更值得关注的是它将升级重点放在了自主编程、专业工作、科学研究、原生多模态和长周期任务上。
换句话说,Qwen3.8-Max 不只想成为一个更聪明的聊天机器人,而是试图成为一个能够连续工作的 AI 同事。
2.4 万亿背后
Qwen3.8-Max 采用混合专家架构,也就是 MoE。虽然模型总参数达到 2.4 万亿,但每次处理任务时,只会激活其中约 950 亿参数,相当于总规模的 4% 左右。
这并不意味着剩下的参数没有作用,而是模型会根据当前内容选择不同的专家模块参与计算。相比每次都调用全部参数,这种设计能够在扩大模型容量的同时,尽可能控制推理成本和响应速度。
所以,2.4 万亿代表的是 Qwen3.8-Max 能够容纳的知识与能力规模,950 亿激活参数则更接近一次实际推理需要动用的计算量。参数规模也不能直接等同于模型能力,真正决定体验的依然是训练质量、模型架构和任务完成效率。
不过,即便采用 MoE,Qwen3.8-Max 也不是普通用户能够轻松部署在个人电脑上的模型。仅按 4bit 精度粗略计算,完整权重就需要约 1.2TB 存储空间,还没有算运行时产生的额外开销。未来开放权重后,它主要仍将面向云服务商、研究机构和拥有大型计算集群的企业。
更适合个人和中小团队部署的,可能是官方同时预告的 Qwen3.8-27B。
一次读完更多
Qwen3.8-Max 是一款原生多模态模型,可以同时接收文字、图片和视频,输出文字结果。它拥有 100 万 Token 上下文窗口,QwenCloud 公布的实际规格为最高约 99.1 万 Token 输入;开启思考模式后约为 98.3 万 Token,单次最多可以输出约 13.1 万 Token。
这意味着它能够一次读取大型代码仓库、数百页的行业报告、成批的法律文件,甚至较长的视频内容,而不必频繁地切割、摘要和重新拼接上下文。
当然,上下文更长并不代表模型会自动记住其中的每一个细节。真正重要的是,它能否在长上下文中找到与当前任务有关的信息,并在多轮操作后维持目标、状态和约束的一致性。
这也是 Qwen3.8-Max 最核心的一次升级:它不仅能够读得更多,还试图工作得更久。
从复现到发现
Qwen3.8-Max 还被要求从零复现一篇机器学习论文。官方称,在没有现成代码和实验流程的情况下,模型连续工作约 125 小时,编写约 7600 行代码,完成 1100 多次操作和 33 轮 GPU 训练。
它先复现了论文中的 6 项主要结论,随后又花费约 88 小时测试 18 种新思路,最终提出的方法在 AIME24 数学评测上比原论文方案提高了 2.7 个百分点。
另一次芯片设计实验则持续约 500 轮交互和 71 次评估。模型将一套加密电路从最初的 8298 个逻辑门,逐步压缩至 678 个逻辑门,并在每一轮中根据仿真、综合与时序结果调整设计。
这些案例共同指向了一种能力:模型不再只是根据已有信息给出答案,而是能够提出假设、执行实验、获得反馈,再利用新结果修改下一步行动。
这也是 " 长周期任务 " 真正困难的地方。一次回答错了,可以重新提问;但一个运行几百轮的智能体,只要早期出现一个没有被发现的错误,后续所有努力都可能建立在错误基础上。模型必须学会检查、回退和重新规划,而不只是一直向前生成内容。
不只会写代码
"Coding and Cowork" 是 Qwen 团队为 Qwen3.8-Max 设定的核心方向。这里的 Cowork 并不是简单地写文档、做总结,而是让模型进入法律、金融、医疗、设计和数据分析等专业流程,最终交付能够继续使用的文件或成果。
在这个过程中,Qwen3.8-Max 的视觉能力也不再只是识别一张图片。
例如,在制作网页、PPT 或三维场景时,模型可以先生成内容,再查看实际渲染结果,识别文字溢出、排版错位或视觉效果不符合要求的问题,随后返回代码和工具进行修改。视觉由一次性的输入,变成了贯穿规划、执行和检查过程的反馈通道。
这可能比单纯提高图片问答分数更加重要。因为人类使用电脑时,本来就是一边操作、一边观察结果,再决定下一步做什么。只有视觉真正进入行动循环,多模态模型才有机会从 " 看懂图片 " 走向 " 使用电脑完成工作 "。
跑分并非全面领先
从 Qwen 团队公布的测试结果来看,Qwen3.8-Max 已经进入当前第一梯队,但它并没有在所有项目上取得第一。
在考察终端环境操作能力的 Terminal-Bench 2.1 中,Qwen3.8-Max 得到 86.6 分,高于 Claude Opus 4.8 和 Claude Fable 5 的 84.6 分,但仍略低于 GPT-5.6 Sol 的 88.8 分。
在考察论文复现能力的 PaperBench 中,它得到 93.0 分,是官方比较模型中的最高成绩;GPQA Diamond 为 92.6 分,也处于第一梯队。
但在更加贴近大型代码仓库维护的 SWE-bench Pro 上,Qwen3.8-Max 得到 67.7 分,低于 Claude Fable 5 的 80.0 分;FrontierSWE 成绩为 73.5 分,同样落后于后者的 88.8 分。
这些成绩说明,Qwen3.8-Max 在终端操作、研究复现、工具使用和长周期任务上表现突出,但并不能简单概括为 " 全面超过所有模型 "。不同测试使用的智能体框架、工具权限、上下文长度和尝试次数也可能影响最终成绩。
模型发布后,Qwen3.8-Max 成为当时排名最高的中国文本模型,并在视觉模型榜单中位列全球第二,仅落后一款 Claude Fable 5 版本。不过公开榜单变化很快,这更适合作为模型进入全球第一梯队的证明,而不是永久不变的排名。
价格与开放
在海外 QwenCloud 平台上,Qwen3.8-Max 的 API 价格为每百万 Token 输入 2 美元、输出 6 美元,隐式缓存命中价格为每百万 Token 0.25 美元。开发者可以通过 qwen3.8-max 这一模型名称调用,并使用函数调用、结构化输出、上下文缓存以及内置搜索工具。
普通用户则可以直接通过 Qwen Studio 体验,Qoder 和 Qwen Code 等编程工具也已经开始接入。
更值得关注的是,Qwen 团队宣布将在正式发布后的一周内开放 Qwen3.8-Max 权重,同时还将发布 Qwen3.8-27B 开放权重模型,这将是千问 Max 级旗舰模型首次走向开放权重。
但 " 开放权重 " 并不完全等同于 " 完全开源 "。模型权重可以下载,并不意味着训练数据、完整训练流程和所有工程代码都会公开。截至 8 月 4 日,Qwen3.8-Max 的具体许可证和最终模型卡仍有待正式发布。
写在最后
Qwen3.8-Max 真正值得关注的地方,不是 2.4 万亿参数,也不是某一张跑分表上的第一名。
它代表着大模型竞争正在发生一次转向。
过去,我们希望 AI 能把一道题回答得更好;现在,我们开始要求它接过一个目标,在数百次操作、多个工具和不断变化的结果之间,把事情真正做完。
当然,一次连续 16 天的官方演示,并不意味着企业已经可以放心地把生产系统完全交给 AI。权限控制、错误回滚、过程审计、成本管理和人工确认,依然决定了一个智能体能否真正投入使用。官方展示的长周期案例和跑分,也需要更多第三方复现与真实业务验证。
但至少,下一轮竞争的方向已经变得清晰。
未来决定一个模型价值的,可能不再只是它在一分钟内能给出多聪明的答案,而是在离开人类的持续提醒之后,它还能可靠地工作多久。
当 AI 从回答问题走向承担任务,我们距离真正的 " 数字同事 ",或许又近了一步。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦