雷锋网 14小时前
Code Arena放榜:阿里千问3.7编程能力超越GPT、Gemini,仅次于Claude系列
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

5 月 26 日凌晨,全球权威三方编程榜单 Code Arena 放榜,阿里最新旗舰模型 Qwen3.7-Max 得分 1541,超越 GPT-5.5、Gemini-3.5-Flash、GLM-5.1、Kimi-K2.6 等一众模型,仅次于 Claude 系列,在大模型厂商中排名全球第二,这也标志着在代码理解与生成领域,千问 3.7 成功跻身全球编程模型第一梯队。

 

图说:Code Arena 榜单显示,凭借 Qwen3.7-Max,阿里位列全球第二  

编程能力是当下模型智能水平的核心指标,而 Code Arena 是由知名第三方大模型盲测平台 LMArena 推出的最具影响力的榜单之一。与传统的代码基准测试不同,Code Arena 并不考核孤立的代码片段生成或传统算法题,而是由开发者出题,要求模型从零生成完整的、可交互的 Web 应用程序,并交由用户对匿名模型的生成效果进行两两 PK,由投票综合生成榜单,因此 Code Arena 也被认为是目前全球最具公信力的 AI 编程能力评测之一。经全球开发者以真实使用体验盲测投票,千问 3.7 模型编程能力位居前 4,打破由 Claude-Opus-4.7 和 4.6 统治已久的前四格局,Qwen3.7-Max 也成为目前榜单中唯一突破 1540 分大关的国产大模型。

据了解,面向 Agent 打造的 Qwen3.7-Max 在编程、智能体、长程任务等核心能力上实现了大幅突破,不但能在数小时内独立完成专业团队耗时 2 周的复杂项目端到端交付,大幅提升办公自动化和企业级生产力,甚至可以持续运行 35 小时、累计超 1000 次工具调用的复杂长程任务,自我编程优化芯片内核。

Qwen3.7-Max 发布后迅速在全球引发强烈反响。大量独立开发者、AI 创作者、企业用户第一时间在社交媒体上分享了测评结果:多位开发者评价其 " 长程自主执行能力令人印象深刻 "" 是真正能把事情做完的智能体基座模型 ";有 AI 机构在相同提示词下同步横评了 Qwen3.7-Max、Claude-4.7 与 GPT-5.5,发现千问 3.7 较上代的性能提升幅度最大、推理成本最低,在输出速度和生成质量两个维度上相较其他模型均有明显优势。

雷峰网

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

阿里 ai 编程 效果 芯片
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论