【CNMO 科技消息】9 月 29 日,Claude Sonnet 5.5 正式上线后的多项测试数据陆续公布。相比单纯关注新模型发布,更值得关注的是它的实际性能和成本表现:Anthropic 公布的 Terminal-Bench 4.0 成绩达到 70.6%,而独立评测机构 Artificial Analysis 测得其在最高推理强度下的综合 Intelligence Index 为 56 分,同时单个测试任务平均成本达到 7.60 美元。

Claude
从模型能力来看,Sonnet 5.5 在 Terminal-Bench 4.0 上拿到 70.6%,明显高于上一代 Sonnet 5 的 10.3%,也高于 Opus 5.5 的 66.4%。在 CursorBench 4.0 中,Sonnet 5.5 得分 55.5%,Sonnet 5 为 34.1%;在 GDPval-AA v2.1 知识工作测试中,Sonnet 5.5 达到 1844 分,与 Opus 5.5 的 1846 分仅相差 2 分。

不过,性能提升并不完全等同于成本下降。Sonnet 5.5 的官方 API 价格其实没有变化,输入仍为每百万 Token 2 美元,输出为每百万 Token 10 美元,缓存读取为每百万 Token 0.20 美元。Anthropic 所谓 " 每项任务成本最高降低 30%",主要来自模型完成同一任务时需要更少的 Token 和更少的执行步骤,而不是单个 Token 直接降价。

Artificial Analysis 的测试进一步揭示了不同推理强度下的成本差异。在最高 Effort 设置下,Sonnet 5.5 平均每项任务成本达到 7.60 美元,同时每项任务平均产生约 19.3 万 Output Token;作为对比,Opus 5.5 约为 5.98 美元,Sonnet 5 约为 5.09 美元。也就是说,在最高推理强度下,Sonnet 5.5 虽然性能已经逼近旗舰模型,但单任务实际成本反而高于 Opus 5.5。

Token 消耗也是此次测试中比较突出的数据。Artificial Analysis 统计显示,Sonnet 5.5 在最高 Effort 下完成综合测试时累计产生约 4.10 亿 Output Token,远高于该评测中同类模型约 8800 万 Token 的中位数。单任务平均约 19.3 万 Output Token,其中推理 Token 约 14.2 万。
因此,Sonnet 5.5 目前呈现出的特点比较明确:模型本身的 Token 单价没有变化,但在部分实际任务中,可以通过减少 Token 消耗、工具调用和重复执行来降低整体成本;而当 Effort 拉到最高水平后,模型为了追求更高完成度会消耗大量 Token,单任务成本也随之上升。对于开发者来说,真正值得关注的并不是 " 每百万 Token 多少钱 ",而是完成一个有效任务究竟需要多少 Token,以及不同 Effort 设置下的性能成本比。


登录后才可以发布评论哦
打开小程序可以发布评论哦