说好的未来几周,Anthropic 只等了 6 天。
上周 Opus 5.5 发布的时候,官方顺手剧透了一嘴,Sonnet 5.5 和 Haiku 5.5 都在后面。
刚刚,Sonnet 5.5 先到了。

而且 Claude 家的 " 中杯 ",已经撵着刚发布的旗舰追了。
上周 Opus 5.5 发布时,Terminal-Bench 4.0 的66.4%还是一个挺能打的成绩。
Sonnet 5.5 一来直接干到了70.6%,上一代 Sonnet 5 只有 10.3% ……
在覆盖 44 种职业真实任务的 GDPval-AA 里,Opus 5.5 拿到 1846 Elo,Sonnet 5.5 已经追到 1844;
OSWorld 2.1 测试计算机操作,两者分别拿到 81.8% 和 80.1%。

当然了,真碰上复杂、开放式、需要长时间判断的任务,Opus 5.5 依然明显更强。
Sonnet 5.5 更适合日常 Coding、修 Bug、做文档、PPT、表格这些边界比较明确的活。
价格也继续保持 Sonnet 档:
输入 2 美元 / 百万 Token,输出 10 美元 / 百万 Token,正好只有 Opus 5.5 的一半。

中杯贴着大杯跑
而且 Sonnet 这次不只是更会写代码,干活方式也利索了一点。
早期测试发现,新 Sonnet 不太爱一个工具一个工具往下磨了,能并行处理的调用会更积极地放到一起。
最后完成同样一项 Coding 任务,工具调用少了大约三分之一,Shell 运行次数差不多直接砍半。
Base44 干脆拿 118 个真实 App 构建任务来测。
Sonnet 5.5 平均跑 3.6 轮就能做到和 Opus 5 相当的结果,后者平均需要 7.7 轮;
同时,新 Sonnet 还是这组测试里工具调用失败最少的模型。

还有人直接把它扔进大工程。
Epic Games 让 Sonnet 5.5 去啃数万行游戏系统代码,拿它检查系统架构和数据流;
Unity 的验收方式是模型改完代码之后把项目重新打开,真正跑起来才算完成。
最后 Sonnet 5.5 做完了他们多步骤 Unity Editor 和 Coding 测试中 90% 的任务。

Anthropic 祖传的宝可梦也没落下。
Sonnet 5.5 成了 Claude 家第一款只看游戏截图就成功通关《宝可梦:红》的 Sonnet。
这一代 Sonnet 还多了点设计感,给定幻灯片模版,就能照着原来的版式和视觉规范往下做,生成的 PPT 只需要少量人工调整,大大减少工作量。
单次任务花钱更少
Sonnet 5.5 这次连 API 单价没动。
每百万输入 Token 还是 2 美元,输出还是 10 美元,缓存读取也继续维持 0.2 美元,和 Sonnet 5 完全一样。
但 Anthropic 测下来,完成大多数任务的实际成本,最高能再降 30%,速度提升 30% 以上。
而且这次 Anthropic 还专门算起了另一笔账,同样的钱,模型到底能干多少活。
Terminal-Bench 4.0 上,Sonnet 5.5 只开到 Medium effort,已经超过 Sonnet 5 能做到的最好成绩,单任务成本却不到后者的十分之一。

CursorBench 更省,Sonnet 5.5 甚至只开 Low effort,就能超过 Sonnet 5 的最高成绩,同样只花不到十分之一的钱。

到了 FrontierCode,比较对象直接换成了 GPT-6 Sol。
在 Claude Platform 默认的 High effort 下,Sonnet 5.5 能做到和 GPT-6 Sol 最佳成绩相当,而 Anthropic 给出的单任务成本大约只有后者的五分之一。

这两周 Claude 连续更新,Anthropic 已经越来越喜欢把一个数字放在 Benchmark 旁边:
完成一项任务,到底花多少钱。
而 Anthropic 接下来还有一款模型,更是来卷这笔账的——
Haiku 5.5。
Anthropic 给它的定位很明确,高吞吐量、成本敏感型。
参考链接:
[ 1 ] https://x.com/claudeai/status/2104633131760333046
[ 2 ] https://www.anthropic.com/claude-sonnet-5-5
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


