量子位 昨天
Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

Claude 最新旗舰Opus 5.5跑分登顶!

在代码、知识工作、计算机操作等多项基准测试中拿下第一的同时,输出速度也比Opus 5快了30% 以上

这暂停得好好的前沿,怎么不到两周又被推进了。

那 CEO Dario Amodei 发表的 " 放缓前沿 " 公开信算什么?

算他能发。

这届模型开始拿代码当画笔

目前看到比较新颖的测试是用纯代码生成图像,SVG 鹈鹕骑自行车已经被刷爆了,这次是更复杂的 Python 渲染。

类似的能力可以扩展成用纯 js 代码生成渲染视频。

多项跑分登顶,API 价格打 8 折

他们说任务成本降4 成,但 API 价格并没有直接打6 折

Opus 5.5 的输入、输出价格分别是每百万 Token  4 美元20 美元,相比 Opus 5 下降20%

再加上完成同一任务需要的步骤和 Token 更少,Anthropic 测算,典型任务的总成本可以下降40%

真正下狠手的是缓存读取价。这一项从 Opus 5 的每百万 Token  0.50 美元,直接降到0.20 美元,砍了60%

做 Agent 编程的都知道,长对话和大型代码任务需要反复读取上下文,缓存读取经常占据成本的大头。相比账面上的 API 单价,这一刀可能更有实际体感。

另外还有一个 Fast mode,输出速度最高可达标准模式的2.5 倍,价格也翻倍至每百万输入 Token  8 美元、输出 Token  40 美元,适合对延迟特别敏感的场景。

订阅用户也加量了,Pro、Max、Team 和按席位收费的企业版,五小时使用限额都会提高;Anthropic 还提供了一次可以暂存、由用户自行选择时间使用的 rate limit reset。

具体看跑分,目前最新鲜的榜就是Terminal-Bench 4.0了,衡量模型处理复杂命令行任务的能力。

Opus 5.5 拿下66.4%,上一代 Opus 5 是52.3%,OpenAI 的GPT-6 Astra57.9%,Claude 自家的Fable 5.155.8%

已经明显拉开差距。

在另一项编程基准 FrontierCode v1.1 上,Opus 5.5 以54.4%超过 GPT-6 Astra 的53.3%,差距就没那么明显了。

而且推理 effort 开中档效果反而更好。

Opus 5.5 在默认 effort,也就是中档设置下,反而跑出了54.6%,超过表中其他模型的最高成绩,也略高于自己开到最高档时的54.4%

到了这个能力水平,0.2 个百分点基本已经落在波动范围里。

Anthropic 自己也承认,跑分差距越来越难准确反映真实使用体验,他们内部使用时,Opus 5.5 和 Fable 5.1 的差距就没有榜单看起来这么大。

另一项CursorBench 4.0,测的是来自真实 Cursor 会话的多文件模糊任务。

最高 effort 下,Opus 5.5 拿到57.8%,比 Fable 5.1 的51.8%6 分,比GPT-5.6 Sol41.7%16.1 分

如果看性价比,Opus 5.5 在默认中档设置下得分52.5%,依然领先 GPT-5.6 Sol 的最高成绩约11 分,单项任务成本只有后者的三分之一左右。

Opus 5.5 特别强调在大规模代码库级别的任务上有明显提升。

早期测试者曾用它迁移68 万行代码不到一天完成。换成人类工程团队,预计至少需要数周

还有一位测试者用它审计并修复一个20 万行代码库,耗时不到 3 小时。同样的任务,Opus 5 花了超过 20 小时,使用的 Token 数量还是它的2.5 倍

在一项内部测试中,Anthropic 让 Opus 5.5 和 Fable 5.1 分别将 HAProxy 从 C 语言重写成 Rust。HAProxy 是一款被广泛使用的 Web 流量负载均衡软件。

两个版本都通过了 HAProxy 自身几乎全部回归测试,但 Opus 5.5 只用了9.5 小时,Fable 5.1 用了12 小时,前者的成本低了51%

Anthropic 还让模型优化一个 Web 应用所有页面的加载速度。Opus 5.5 在40 次测试中成功了39 次;Opus 5 虽然也缩短了加载时间,但改进幅度更小,还改变了应用原本的行为。

知识工作方面同样值得关注。

在覆盖44 个职业的真实工作能力评估 GDPval-AA v2.1 中,Opus 5.5 得分1846 Elo,Fable 5.1 是1735,Opus 5 是1708

在默认 effort 设置下,Opus 5.5 的得分就超过了 GPT-6 Astra 在最高 effort 下的表现,单项任务成本大约只有后者的五分之一

投资公司 Walleye Capital 反馈,Opus 5.5 在最低设置下,就基本完成了他们的量化研究评测任务。

把 effort 调高后,它还发现评测指令里的分钟索引存在一个 off-by-one 错误,并主动修正。

模型甚至特意备注:这样处理是正确的,但可能会导致自己被评分器扣分。

Walleye 称,此前测试过的所有模型,都没有发现并处理这个问题。

还有个明显变化在于:Opus 5.5 说话的方式变了

以前 Opus 5 虽然也能找到答案,但很快就会钻进代码块、时间线和区间定义里,用户需要自己从大量技术细节中提炼结论。

Opus 5.5 会先把最重要的信息摆出来,再解释原因。

官网展示了一个 billing 系统 Bug 的对比。Opus 5 找到问题后,马上开始解释代码改动和时间区间;Opus 5.5 开头就把账算清楚了:

额外减少的9.92 美元来自一个 Bug,免费层调整只占1.50 美元

随后它才说明,究竟是哪次代码重构把每个月最后一天的大部分用量漏掉了。

一位早期测试者的评价是:

It writes the way I do(它写东西的方式跟我一样)。

Anthropic 还特意强调,表达清楚不只是文风升级。模型把关键信息放在前面、减少术语和特异性表达,人类检查其结论和操作过程也会更加容易,这本身就是一项安全收益。

和 Fable 一个级别的笼子

能力往前冲,安全笼子也跟着加厚了。

Opus 5.5 是首款同时搭载 Fable 5.1 同级网络安全、生物安全和反蒸馏护栏的 Opus 模型。触发相关限制后,系统会透明地回退到其他模型处理。

发布之前,它还接受了 METR 和 Frontier Design 两家外部机构的评估。

这也是 Anthropic 对 " 放缓前沿 " 的解释:模型照常研发和发布,但要给安全对齐和外部审查留出时间。

在 Anthropic 内部覆盖近 2000 个模拟场景的自动化行为审计中,Opus 5.5 在几乎所有失调行为指标上,都拿到了近期 Claude 模型中的最好成绩。

在一项专门测试模型越过安全边界倾向的新评估中,Opus 5.5 尝试规避边界的频率,比 Opus 5 和 Claude Mythos 5.1 低了约 85%。

仅有的几次尝试也都属于低严重性事件,而且由模型自行上报。

不过 Anthropic 同时承认,他们观察到 Opus 5.5 经常怀疑自己正在接受评估。

一旦模型知道 " 这是一场考试 ",测试中的表现能否代表真实部署环境,就要打上一个问号。Anthropic 称,目前仍然没有办法在发布前可靠地发现所有潜在问题。

在更实际的 Agent 防护上,Opus 5.5 还配备了三层措施。

它会在执行前检查每一个操作;运行环境放在安全团队可以审计的开源沙箱中;代码审查功能则会在代码合并前检查漏洞。

面对提示注入攻击,Opus 5.5 在 Anthropic 测试的编程、工具调用、计算机操作和网页浏览等场景中,都追平或超过了 Opus 5。

这么厚的笼子,也和它在高风险领域的能力有关。

在生物学领域,Opus 5.5 已经在多个方向追平甚至超过 Claude Mythos 5.1,因此使用了与 Fable 5.1 相同的生物安全护栏。

在与 Dyno Therapeutics 合作开展的长期分子预测和设计评估中,Opus 5.5 取得了进一步提升。参与红队测试的专家认为,其科学新颖性与他们测试过的最强模型相当。

经过审核的学术实验室、初创公司和制药企业,可以通过新推出的 Life Sciences Verification Program,申请适用于生物研发工作的更宽松权限。

网络安全也是一样。

由于 Opus 5.5 的网络安全能力很强,普通用户提交的大多数网络安全任务会被自动转交给 Opus 4.8。经过认证的网络安全从业者,则可以通过即将扩展的 Cyber Verification Program 申请使用 Opus 5.5。

反蒸馏措施也直接上到了 Fable 5.1 的级别。

Opus 5.5 搭载了 preserved thinking 机制,限制 API 用户编辑 Claude 此前生成的思考上下文,防止攻击者借此批量提取模型的推理能力。

这项限制适用于 2026 年 8 月 31 日及以后创建的 API 账户。

与此同时,Opus 5.5 不再允许关闭 thinking 模式,输出文本中也加入了水印。

这种水印不会直接显示在文本里,也没有添加隐藏字符。它通过调整模型在多个意思相近的词语之间如何选择,留下可供专用检测工具识别的统计模式,普通读者看不出区别。

OMT:Haiku 终于更新了

在 Sonnet、Opus 和 Fable 都已经进入 5 系列之后,Claude 家的 " 小杯 " 还停留在 Haiku 4.5。

这次终于有准信了。

Anthropic 宣布,Sonnet 5.5 和 Haiku 5.5 都将在未来几周内推出,同样会获得性能、效率和安全方面的升级。

也就是说,Opus 5.5 只是 5.5 系列的第一款。

OpenAI 这边刚刚一口气端出 GPT-6 Astra 和 GPT-5.6 Sol,Anthropic 那边紧接着发布 Opus 5.5,还预告后面有两款新模型排队。

前沿确实没有停,大家都在忙着踩油门啊~

参考链接:

[ 1 ] https://www.anthropic.com/claude-opus-5-5

[ 2 ] https://x.com/claudeai/status/2102435511222890900

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

python 元和 鹈鹕 计算机
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论