智东西 昨天
Anthropic深夜放大招:Claude Opus 5.5上线,任务成本大降40%
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

编译 | 杨京丽

编辑 | 李水青

智东西 9 月 23 日消息,今天凌晨,Anthropic 发布Claude Opus 5.5,这是 Claude 5.5 系列的首款模型。Anthropic 称,新模型在多数任务上的表现与 Claude Fable 5.1 相当,默认设置下的典型任务成本较上一代 Opus 5 降低 40%,输出速度提升超过 30%

在官方公布的 9 项测试中,Opus 5.5 有7 项成绩领先 Fable 5.1、Opus 5、GPT-6 Astra 和 GPT-5.6 Sol。其中,Opus 5.5 在三项编程测试中均取得最高分,但在业务流程和科研 Agent 测试中仍落后于 GPT-6 Astra。

在第三方评测机构 Artificial Analysis 的 Intelligence 榜单上,Claude Opus 5.5 以 58 分位列第一,领先 Claude Fable 5.1 和 GPT-6 Astra 的 53 分。

具体任务中,Anthropic 披露,Opus 5.5 用9.5 小时完成了将负载均衡软件 HAProxy 从 C 语言改写为 Rust 的任务,成本比 Fable 5.1 低 51%;在要求逐一核对数字和引语的财报研究测试中,其生成的18 份报告有 16 份达标,Fable 5.1 和 Opus 5 则均未通过。此外,一名早期测试者使用 Opus 5.5,不到一天完成了涉及68 万行代码的迁移。

价格方面,Opus 5.5 每百万输入、输出 Token 分别收费 4 美元(约合人民币 26.8 元)和 20 美元(约合人民币 134 元),较 Opus 5下调 20%缓存读取价格较 Opus 5 下降 60%。与此同时,Anthropic提高了多个付费套餐的五小时使用额度,并向订阅用户提供一次可自行选择使用时间的额度重置机会

Opus 5.5 已上线 Claude 及亚马逊云科技、谷歌云、微软 Azure 等平台。不过,部分专业任务仍受安全机制限制,例如大多数网络安全任务会被转交 Opus 4.8 处理。Claude Sonnet 5.5 和 Claude Haiku 5.5计划在未来几周推出。

Claude Opus 5.5 发布近 2 个小时后,OpenAI 也推出了GPT-6 Sol 和 GPT-6 Luna,GPT-6" 宇宙 " 加入新成员。

一、编程成绩超过 Fable 5.1、GPT-6 Astra,输入输出价格下调 20%

Anthropic 公布了 Opus 5.5 与 4 款模型在 9 项测试中的成绩,对比对象包括 Fable 5.1、Opus 5,以及 OpenAI 的 GPT-6 Astra 和 GPT-5.6 Sol。9 项测试中,Opus 5.5 有 7 项得分最高。

智能体编程方面,Opus 5.5 在 Terminal-Bench 4.0、FrontierCode v1.1 和 CursorBench 4.0 上分别得到 66.4%、54.4% 和 57.8%,三项都是对比模型中最高。

在业务流程测试 AutomationBench 和科研 Agent 测试 Terminal-Bench-Science 0.1 中,其成绩低于 GPT-6 Astra。

价格方面,Opus 5.5 每百万输入 Token 收费 4 美元(约合人民币 26.8 元),每百万输出 Token 收费 20 美元(约合人民币 134 元),均较 Opus 5 下降 20%。

Claude Code 和 Claude Platform 还提供 Opus 5.5 快速模式,Anthropic 称其速度最高可达普通模式的 2.5 倍。该模式每百万输入、输出 Token 分别收费 8 美元(约合人民币 53.6 元)和 40 美元(约合人民币 268 元)。

二、9.5 小时完成代码改写,财报测试 18 份报告中 16 份达标

编程方面,Anthropic 重点展示了代码迁移、代码库审查和性能优化等长时间任务。

Anthropic 称,一名早期测试者使用 Opus 5.5,在不到一天内完成了涉及 68 万行代码的迁移。另一名测试者对一个 20 万行代码库进行审查和修复,Opus 5.5 用时不到 3 小时;Opus 5 完成该任务则超过 20 小时,消耗的 Token 是前者的 2.5 倍。

在内部测试中,Anthropic 要求 Opus 5.5 和 Fable 5.1 将负载均衡软件 HAProxy 从 C 语言改写为 Rust。两者改写后的版本均通过了 HAProxy 自身几乎全部回归测试。Opus 5.5 用时 9.5 小时,Fable 5.1 用时 12 小时,前者成本低 51%。

另一项网页性能优化测试要求模型降低一个 Web 应用所有页面的加载时间。Opus 5.5 在 40 次测试中成功 39 次。Anthropic 称,Opus 5 的优化幅度较小,且改变了应用原有行为。

Anthropic 还比较了不同推理强度下的任务成本。Anthropic 称,在默认推理强度下,Opus 5.5 在 FrontierCode 上的成绩超过 GPT-6 Astra,单次任务成本约为后者的 20%;在 Terminal-Bench 4.0 上达到相近成绩时,成本约为后者的 40%。这些比例对应特定测试设置,不能直接等同于所有实际开发任务的费用差异。

知识工作方面,Opus 5.5 在覆盖 44 种职业任务的 GDPval-AA v2.1 中取得 1846 分,高于 Fable 5.1 的 1735 分和 Opus 5 的 1708 分。

Anthropic 还设计了一项财报研究测试:模型只能在一个财报公告较难找到的网页副本环境中检索资料,并据此撰写公司季度业绩报告。自动评分程序会逐一核对报告中的数字和引语,任何编造都会导致不达标。

在不同推理强度下,Opus 5.5 生成的 18 份报告中有 16 份通过质量门槛,Fable 5.1 和 Opus 5 则未有报告通过。

另一项测试中,Anthropic 要求模型分析两家虚构人力资源软件公司的并购交易,先用 Excel 建立财务模型,再生成面向管理层的演示文稿。Opus 5.5 与 Opus 5 得出了相同的交易判断,但前者用时 63 分钟,后者用时 93 分钟,前者成本低 50%。Anthropic 认为,Opus 5.5 的财务模型更完整,演示文稿更易读,Opus 5 的结果则存在少量错误。

三、回答更简洁,越界尝试降低 85%

除了任务执行能力,Anthropic 还调整了 Opus 5.5 的写作与沟通方式,包括优先呈现关键信息、减少术语和不常见表达,以及更好地遵循用户指定的写作规则。

在官方展示案例中,两个模型被要求解释同一个问题,某客户 8 月的账单金额为什么出现了额外的下降。Opus 5.5 在第一句话中能够直接给出结论," 计费系统重构导致月末账单出现漏计 ",再解释代码边界条件如何产生错误。从篇幅来看,Opus 5.5 的回答也更简洁。

安全方面,Anthropic 称,Opus 5.5 发布前接受了 METR、Frontier Design 等外部机构评估。在覆盖近 2000 个模拟场景的自动化行为审计中,其在几乎所有受测的不对齐行为指标上优于近期 Claude 模型。

在一项测试模型是否试图突破隔离边界的新评估中,Opus 5.5 尝试绕过边界的频率,较 Opus 5 或 Claude Mythos 5.1 降低约 85%。按照官方描述,Opus 5.5 出现的相关尝试均被评为低严重程度,且模型自行报告了这些行为。

提示词注入方面,Anthropic 称,Opus 5.5 在编程、工具调用、计算机操作和网页浏览等受测场景中的防御表现不弱于 Opus 5。在 AI 安全公司 Gray Swan 开展的一项测试中,Opus 5.5 与 Fable 5.1 并列取得受测模型中最低的提示词注入攻击成功率。

不过,Anthropic 同时承认,部署前评估仍无法可靠发现所有失效情况。测试中,Opus 5.5 经常疑似意识到自己正接受评估,这会增加判断其真实部署行为的难度。

针对后续模型,Anthropic 计划加强强化学习训练环境筛选、调整对齐奖励、增加安全训练场景,并改进基于可解释性的监控和评估,减少对模型所写思维链的依赖。这些属于后续安全工作方向,并非已经验证有效的结果。

四、部分安全任务转交旧模型,订阅额度同步提高

Opus 5.5 此次上线附带了与 Fable 5.1 类似的网络安全、生物学和反蒸馏防护机制。触发相关限制时,请求会转交其他模型处理。

网络安全方面,用户仍可在日常软件开发中查找和修复代码漏洞,但大多数网络安全任务会被转交 Opus 4.8。Anthropic 计划在未来几周扩大网络安全验证计划,将 Opus 5.5 纳入其中,并设置三个不同权限等级,部分等级可使用 Claude Mythos 模型。

生物研究方面,Anthropic 称,Opus 5.5 在多个任务上的能力达到或超过 Claude Mythos 5.1,因此采用了与 Fable 5.1 相同的生物学防护措施。受相关限制影响的学术实验室、初创公司和药企,可申请生命科学验证计划,经审核后获得适用于更广泛生物研究工作的访问权限。

反蒸馏方面,Opus 5.5 启用了 " 保留思考 "(preserved thinking)机制,限制 API 用户通过修改 Claude 此前上下文来提取模型推理。该机制适用于 2026 年 8 月 31 日及之后创建的 API 账户,覆盖 Fable 5.1 和 Opus 5.5。

数据处理方面,Opus 5.5 继续提供零数据保留选项,并加入 Anthropic 所称用于满足欧盟《人工智能法案》要求的水印措施。同时,该模型不再提供关闭思考模式的选项。

Opus 5.5 已上线 Claude 及亚马逊云科技、谷歌云、微软 Azure 等平台,开发者可通过模型标识 claude-opus-5-5 调用。

订阅方面,Anthropic 提高了 Pro、Max、Team 及按席位计费的 Enterprise 套餐的五小时使用额度。订阅用户还将获得一次使用限额重置机会,可保留至需要时使用。

结语:长任务的效率与成本成为升级重点

Opus 5.5 此次更新的主要变化,是在提高部分编程和知识工作测试成绩的同时,也着重降低了完成任务所需的时间和费用。对于需要持续运行的 Agent,这些变化直接关系到实际使用成本。

不过,官方测试中的优势能否延续到真实业务中,还取决于任务复杂度、结果准确性,以及安全限制对任务执行的影响。

来源:Claude

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论