阿里巴巴在 8 月 2 日发布了 Qwen3.8-Max,这款模型首次登上 Arena.ai 前端代码排行榜就排在第 4 位,比 Claude Fable 5 高出一个名次。这是三周内第二家中国实验室的模型在该榜单上超过 Fable 5,此前 Kimi K3 在 7 月拿下了第 1 名。我们给这两款模型布置了相同的 10 个界面设计任务,对比了输出效果、运行成本以及各自的工作方式。
前端设计不再只有 Claude 一个答案

很长一段时间里,设计类工作选哪个模型,答案都是 Anthropic。这不只是做网站,开发者会用 Claude 系列模型来搭仪表盘、落地页、幻灯片、路演页面,以及任何需要给人看的东西。Claude 模型是闭源的,而 Fable 5 是目前榜单前五里最贵的模型。与此同时,OpenAI 的模型一直在前端能力上追赶,从 GPT-5.4 到 5.5 再到 5.6 Sol 逐步改进,但始终没有缩小差距。Kimi K3 是第一个在我们自己的测试中追平 Fable 5 的非头部厂商模型,它跑完 10 个任务的成本只有 Fable 的 29%。而 Qwen3.8-Max 的单 token 价格比 Kimi K3 还要低。
10 个界面实测:4 比 3,另有 3 个平局
先说结论:Qwen3.8-Max 在所有 10 个任务上的表现都进入了 Claude Fable 5 的 " 品味距离 " 之内。我们的统计是 Fable 赢 4 个,Qwen 赢 3 个,3 个打平。和 Kimi K3 不同的是,Qwen3.8-Max 有自己的视觉品味。完整跑完 10 个任务,Qwen3.8-Max 花了 3.05 美元,Fable 5 花了 8.44 美元。
价格差距比排名更刺眼
Fable 5 的输入 token 价格是 Qwen3.8-Max 的 5 倍,输出 token 价格是 8.3 倍。我们把 Kimi K3 也放进对比,是因为目前前端排行榜顶部来回换位的就是这三款模型。阿里巴巴表示会开放 Qwen3.8-Max 的权重,但截至本文写作时还没有发布,许可证情况也不清楚。
测试方法:一次性输出,不做迭代
我们在 Kilo Code CLI 的 Code 模式下运行这两款模型。每个任务都在独立的空目录中开始,不共享任何状态。两款模型收到完全相同的提示词,我们没有做任何迭代修改。本文中的每张截图都是一次性生成的输出。
Qwen3.8-Max 运行在 xhigh 推理档位,这是它五个可用档位里最高的一档。Fable 5 运行在 high thinking 档位,和我们此前对比 Kimi K3 时用的设置一致。不同厂商的推理档位标签没有可比性,所以我们选了 Qwen 的最高档,让 Fable 保持与此前文章一致,成本按实际测量结果报告。
提示词风格:只给产品名和必要内容
提示词采用 " 氛围加最低限度内容 " 的风格。我们指定产品名称,列出必需的内容,其余所有视觉决策都交给模型。每个模型都要生成一个独立的、通过 CDN 使用 Tailwind 的 index.html 文件。10 个任务里有 9 个都是这样完成的。设置页面是唯一的例外,我们给两款模型提供了一套紧凑的深色品牌规范——三个十六进制色值、一组字体搭配、不用渐变、不用纯黑或纯白、圆角上限 8 像素——目的是看它们如何执行既定方向,而不是自己发明方向。
阅读时有一点需要留意:本文中的评价是我们的偏好,不是最终裁决。大多数任务里两个输出足够接近,选哪个更多是品味问题。你看到的可能和我们不一样。


登录后才可以发布评论哦
打开小程序可以发布评论哦