智东西 19小时前
Claude Opus 5来了,Fable 5性能、一半价格
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

作者 | 云鹏

编辑 | 漠影

智东西 7 月 25 日早间报道,今天凌晨,Anthropic 的新一代旗舰大模型Claude Opus 5正式发布并上线,其兼顾 " 深思熟虑 " 与 " 主动响应 " 特点,在性能上极为接近 Claude Fable 5,但价格只有一半。

此时网友祭出神评:

" 如果跟 Fable 5 差不多,那为什么还要花 2 倍的价格用 Fable 5?"

回到模型,在拿手老本行编程方面,Claude Opus 5 在 Frontier-Bench 和 GDPval-AA 等编程与知识工作评估中实现 SOTA,不过在网络安全任务上仍落后于 Mythos 5。

Anthropic 这次真是既吹足了新模型,又给此前大热的 Fable 5 和 Mythos 5 留足了面子,可以说是" 端水大师 "了。

价格方面,Claude Opus 5 定价为输入每百万 Token 5 美元 / 输出每百万 Token 25 美元(与 Opus 4.8 持平)。开发者可在 API 中使用 claude-opus-5。快速模式(Fast mode)运行速度约为默认速度的 2.5 倍,价格为基础价格的 2 倍。

此次 Claude 还更新了两个处于测试阶段的功能:对话中途更换工具提示词缓存不失效、API 自动降级处理(遇到被安全分类器标记的请求时)避免请求直接被拒绝。

Anthropic 提到,Opus 5 专为日常高频使用设计,比以往模型的工作效率更高,其已经成为 Claude Max 新默认模型,是 Claude Pro 中性能最强的模型。

对于 Opus 5 的发布,网友们讨论度很高,也有人掏出了那张 " 老图 ":

还有网友吐槽 Anthropic 的拿手好戏:重置

也有网友使用后发现 Opus 5 的写作风格跟 4.8 很像,跟 Fable 5 完全不是一个模式,尤其在用词上:

有人认为,叫 Opus 5 不如说是 Fable 5.1:

网友还贴心的预测了各类文章又要 " 教你用 Opus 5" 了,这个帖子热度颇高:

一、从高价值软件工程到科研、视觉输出,性能与性价比成突出优势

大家吐槽 Claude 最多的一个词,就是 " 贵 "。

这一次,在维持与前代产品 Opus 4.8 相同成本的前提下,Claude Opus 5 实现了性能的大幅跃升。

该模型的 " 思考程度 / 努力程度 "(Effort)设置支持用户灵活调节——既可以追求极致智能,也可以节省 Token 以获取更快、更廉价的结果。

Opus 5 在高价值的软件工程任务中表现优异:

Frontier-Bench v0.1:Opus 5 超越了所有其他模型,在降低单项任务成本的同时,性能达到了 Opus 4.8 的两倍以上。

CursorBench 3.2:在最高努力模式(Max Effort)下,其性能距离 Fable 5 的峰值得分仅相差 0.5%,但单任务成本仅为后者的一半;在 High、Xhigh 和 Max 努力模式下,Opus 5 在相同成本下的性能表现均优于所有其他模型。

在知识工作与复杂问题解决任务中,Opus 5 同样表现亮眼:

ARC-AGI 3(考验模型解决全新未知问题的评估):Opus 5 的得分是第二名模型的 3 倍。

Zapier AutomationBench(衡量模型端到端完成商业自动化流程的能力):在相同单任务成本下,Opus 5 的通过率约为第二名模型的 1.5 倍。即使在最低努力设置下,Opus 5 通过的任务数也超过了其他任何模型。

OSWorld 2.0(计算机操作使用基准测试):在任意给定成本下,Opus 5 的表现均优于其他所有模型,仅需略高于三分之一的成本即可超过 Fable 5 的最佳成绩。

此外,它在多项相关评估中均成为了性能最强且最具性价比的模型,包括 HLE、AutomationBench、DeepSearchQA 等测试。

对于科学研究而言,Opus 5 相比 Opus 4.8 带来了显著提升。在涵盖结构生物学、有机化学和生物信息学等领域的全部生命科学评估中,Opus 5 的表现均优于 Opus 4.8。其最显著的突破体现在:

有机化学任务(如根据光谱数据推断分子结构):在内部基准测试中得分比 Opus 4.8 高出 10.2 个百分点。

蛋白质相关任务(如预测蛋白质序列变异对其功能的影响):得分提升了 7.7 个百分点。

最后,Opus 5 具备了大幅增强的视觉输出生成能力。

生成空气动力学风洞风流图解:

细胞结构互动图示:

二、自我校验、迭代能力提升,写代码前更爱 " 动脑子 ",Lovable 联创:4.5 后最大飞跃

Claude Opus 5 在自我校验与审慎迭代方面能力提升显著,能持续优化直至任务成功。这也是当前业内非常关注的模型能力之一。

在评估和早期测试中,我们及测试用户发现了许多体现 Opus 5 主动性(Agency)与严谨性的典型案例:

自主构建视觉管线:在 Frontier-Bench 的一项任务中,模型收到一张机械零件图纸,要求编写代码在 FreeCAD 中重建 3D 模型,但任务故意未向模型提供直接查看图纸的接口。Opus 5 的做法是:自行编写了一套计算机视觉处理管线,从原始像素中提取几何特征,进而完成了完整机械零件的重建,且多次重复实验均告成功。在相同设置下,其他竞争模型尝试 5 次无一成功。

根治深层 Bug:面对一款热门开源包管理器中的真实 Bug,Opus 5 找到了根本原因,并修复了社区补丁遗漏的边缘情况;而竞争模型仅修复了表面症状而非底层根因,就报告问题已解决。

自建测试套件:某交易公司的工程师使用 Opus 5 在单次会话中为一个新交易所构建了市场数据接入源。此前即便工程师提供了详尽方案,旧模型也完全无法完成该任务。由于当时没有可用于验证的实时数据源,Opus 5 甚至自己构建了一套测试套件,用以检查代码是否准确解析了交易所数据。

Anthropic 还发布了一些业内知名人士对 Opus 5 的评价,比如:

Cognition CEO Scott Wu 提到 Opus 5 在自家 Devin 软件中,在困难问题的调试与根因分析任务中表现出色。

Zapier CEO Wade Foster 提到,Claude Opus 5 在未增加 Token 消耗的前提下拿下了 Zapier AutomationBench 榜首。它读取了一份原始客户健康度表格,端到端执行了整套客户流失预防流程(标记风险账户、通知负责人、整理留存报告)。旧模型没完成,但 Opus 5 100% 拿下了。

Lovable 联合创始人 Fabian Hedin 认为,Claude Opus 5 是 Opus 家族自 4.5 以来最大的一次飞跃。

在 JetBrains IDE AI 负责人 Denis Shiryaev 看来,Claude Opus 5 最令其印象深刻的是判别力与决策力,其在写下代码前会更深入地思考,在规划阶段就能捕获自己的逻辑缺陷,这是解题能力的一次重要跨越。

三、安全性更高、更不容易被骗,重点限制漏洞利用能力

在部署前的测试中,Anthropic 自动化行为审计表明,Opus 5 是其迄今为止对齐程度最高的模型。

它比 Opus 4.8、Sonnet 5 或 Fable 5 更符合《Claude ’ s Constitution》,欺骗行为发生率最低,且最不容易被误导或诱导滥用,在避免可能产生不可逆副作用的轻率行为方面是目前 Anthropic 最安全的模型。

在自动化行为审计中,Opus 5 在整体非对齐行为上的得分为 2.3,为近期模型中的最低值

与 Opus 4.8 一样,Anthropic 特意避免在网络攻防任务上训练 Opus 5。不过,由于通用能力的提升,该模型在相关任务上的表现仍有显著增强,在寻找网络安全漏洞方面已逼近 Mythos 5。

在漏洞利用(即把漏洞转化为实质性网络威胁)方面,它依然大幅落后于 Mythos 5(这一点在 OSS-Fuzz 评估中得到了验证)。

网络安全方面,Opus 5 的网络安全分类器限制相对比 Fable 5 更加宽松,允许 Opus 5 在源代码中查找漏洞,但会拦截 " 基于二进制 " 的漏洞扫描、渗透测试以及 Exploits 生成。针对拦截请求,系统默认会自动退回至 Opus 4.8。

生物领域,Opus 5 延续了与 Opus 4.8 类似的安全防护体系,据称是目前可用于科学研究的最强通用模型。

结语:Claude 开始走 " 性价比 " 路线了

Claude Opus 5 这次是性能与性价比双重提升,在核心的编程、复杂推理、知识工作中提升显著,性价比优势突出,行业关注的自我校验迭代能力也有所提升,Anthropic 在安全性方面花了比较大的篇幅解读。

当前国内开源、闭源模型 " 爆更 " 给海外大模型厂商带来显著压力,不少海外科技巨头逐渐转向中国模型,加码 " 性价比 ",或许会成为海外大模型厂商后续的重要策略之一。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

智东西 编程 科研 网络安全
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论