雷锋网 昨天
阿里Qwen3.8正式发布,编程与办公再进化,推理更快更稳定
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

8 月 3 日,阿里巴巴正式发布新一代基座大模型 Qwen3.8,总参数量 2.4 万亿,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。今日放榜的权威三方榜单 Arena 中,阿里 Qwen 模型仅次于 Anthropic 的 Claude 系列,整体性能处于全球大模型第一梯队。目前,Qwen3.8 的 API 已上线千问 AI 平台,并接入阿里今日同步推出的 Agent 产品 " 千问办公 "。Qwen3.8-Max 预计下周开源,同时还将开源 Qwen3.8-27B。

今日起,全球开发者都可通过千问 AI 平台获得 Qwen3.8 的 API 服务,国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元,而输入与输出的国际价格仅为 Opus5 的 40% 与 24%,实现相近智能更高性价比。

 

图说:权威三方榜单 Arena 全球排行榜更新

此次发布的是千问大模型系列中尺寸最大、性能最强的旗舰模型 Qwen3.8-Max,它支持视觉理解,上下文长度达 1M Tokens。在模型架构上,Qwen3.8 通过稀疏 MoE 架构与混合注意力机制的联合优化,首次将千问大模型的总参数量拓展至 2.4T,激活 95B,获得了更高的推理效率、更快的推理速度,整体性能也迎来新突破:在科研复现评测 PaperBench 等编程智能体评测中,Qwen3.8-Max 较上代模型大幅提升 28.2 分,以 93.0 分录得评测新高;在 WideSearch、Agent's Last Exam 等通用智能体评测中,新模型分别取得 81.9 分和 52.4 分,位居前沿。同时,Qwen3.8 在指令遵循 IF Bench 评测中斩获 82.8 分,科学推理 GPQA Diamond 取得 92.6 分,系列通用能力均位居前列;在视觉推理 BabyVision 评测中,Qwen3.8-Max 在无工具条件下取得 82.0 分,超出部分主流模型近两倍,在评估智能体电脑操作能力的 OSWorld-Verified 评测中,Qwen3.8-Max 以 86.1 分位居主流模型首位。

编程能力(Coding)是前沿大模型的核心能力之一,Qwen3.8 实现了自主编程的新突破。在权威 CodeArena 榜中,Qwen3.8 位居全球第四。2 年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手,而如今,Qwen3.8 可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人干预。只需一句 " 创建一个自进化的智能体 Harness",Qwen3.8 就像个资深的工程师,从零开始,自主搭建循环工程(Loop Engineering)框架,编排智能体自动领取和执行任务,人类工程师还可通过钉钉给 Qwen3.8 提出新要求。Qwen3.8 独立编程运行约 16 天后,做出了一个 Hermes Agent 级别的、真实可用的自进化智能体框架 "oh-my-cli",目前该项目现已完全开源,完整过程公开保存在 GitHub 仓库里,可供所有人查看。

Qwen3.8 可胜任广泛的、真实的专业工作任务(Cowork)。面对完全不同的专业任务、评判标准和计算需求,Qwen3.8 通过真实环境和算力的联合强化学习(RL)扩展,实现了数百种高价值、高频专业任务的真实表现提升,在主流的智能体框架中均可稳定可靠地交付生产级成果:一支法务助理团队在数百份法律文档中标注千余个相关条款,需要一周时间,Qwen3.8 一小时内就能做完;一个篮球数据分析团队逐帧标注 160 个小时以上的比赛录像,Qwen3.8 数十分钟就可精准拆解这 8400 多个攻防回合,并一次性输出球员战术画像和教练报告;一个金融研究团队基于数年的专业知识积累,搜集资本市场全面、实时的变动,才能依次完成的量化策略研究,Qwen3.8 自主调动并行的智能体,连续工作数小时后交付完整的 ETF 轮动策略,并持续分析回测、动态修正、最后实现规模化盈利。

在长周期任务中,Qwen3.8 涌现出系统级自主规划与全栈闭环自适应学习能力。无论是在高精密、强物理约束的数字芯片设计,还是在高度动态、博弈激烈的商业模拟运营中,Qwen3.8 均能通过 " 执行 - 反馈 - 迭代 " 的自适应闭环,在数千轮的超长程交互中实现算法与策略的深度重构。

Qwen3.8 除了拥有强大的文本和推理能力,还提高了 AI 视觉理解能力的极限。在权威 Vision Arena 榜单中,Qwen3.8-Max 排名全球第二。Qwen3.8 不仅能读懂 200 页的财报 PDF、看懂超 100 小时的长视频,还能将这些 " 看到 " 的知识和信息反馈到工作全流程去,帮助模型思考得更周全。在千问团队构建的 " 应用复刻 " 基准 RecreationBench 长程任务中,模型没有源代码,也无法联网,只通过交互与反馈去理解这个应用,却能从零复刻出整个应用。这表明,Qwen3.8 已经展现出前沿水准的混合多模态智能体能力,通过 " 迭代编程—交互反馈 " 的反复循环,将视觉编程(Visual Coding)推向新的高度。

据了解,阿里真武 M890 超节点也已成功适配 Qwen3.8,通过芯片、云平台与千问大模型的全链路优化,显著提升推理效率、降低推理成本,在 Agentic 推理场景中最多可实现 1.5 倍性能提升。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

编程 阿里 ai 开源 程序员
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论