1541分！阿里 Qwen3.7-Max编程力登顶国产第一全球仅次 Claude

快科技 5 月 26 日消息，5 月 26 日凌晨，全球权威三方编程榜单 Code Arena 放榜，阿里最新旗舰模型 Qwen3.7-Max 得分 1541，超越 GPT-5.5、Gemini-3.5-Flash、GLM-5.1、Kimi-K2.6 等一众模型，仅次于 Claude 系列，在大模型厂商中排名全球第二，这也标志着在代码理解与生成领域，千问 3.7 成功跻身全球编程模型第一梯队。

据了解，编程能力是当下模型智能水平的核心指标，而 Code Arena 是由知名第三方大模型盲测平台 LMArena 推出的最具影响力的榜单之一。

与传统的代码基准测试不同，Code Arena 并不考核孤立的代码片段生成或传统算法题，而是由开发者出题，要求模型从零生成完整的、可交互的 Web 应用程序，并交由用户对匿名模型的生成效果进行两两 PK，由投票综合生成榜单，因此 Code Arena 也被认为是目前全球最具公信力的 AI 编程能力评测之一。

经全球开发者以真实使用体验盲测投票，千问 3.7 模型编程能力位居前 4，打破由 Claude-Opus-4.7 和 4.6 统治已久的前四格局，Qwen3.7-Max 也成为目前榜单中唯一突破 1540 分大关的国产大模型。

据了解，面向 Agent 打造的 Qwen3.7-Max 在编程、智能体、长程任务等核心能力上实现了大幅突破，不但能在数小时内独立完成专业团队耗时 2 周的复杂项目端到端交付，大幅提升办公自动化和企业级生产力，甚至可以持续运行 35 小时、累计超 1000 次工具调用的复杂长程任务，自我编程优化芯片内核。

宙世代

一起剪

相关标签