
作者 | 云鹏
编辑 | 漠影
智东西 7 月 25 日早间报道,今天凌晨,Anthropic 的新一代旗舰大模型Claude Opus 5正式发布并上线,其兼顾 " 深思熟虑 " 与 " 主动响应 " 特点,在性能上极为接近 Claude Fable 5,但价格只有一半。
此时网友祭出神评:
" 如果跟 Fable 5 差不多,那为什么还要花 2 倍的价格用 Fable 5?"


价格方面,Claude Opus 5 定价为输入每百万 Token 5 美元 / 输出每百万 Token 25 美元(与 Opus 4.8 持平)。开发者可在 API 中使用 claude-opus-5。快速模式(Fast mode)运行速度约为默认速度的 2.5 倍,价格为基础价格的 2 倍。

Anthropic 提到,Opus 5 专为日常高频使用设计,比以往模型的工作效率更高,其已经成为 Claude Max 新默认模型,是 Claude Pro 中性能最强的模型。
对于 Opus 5 的发布,网友们讨论度很高,也有人掏出了那张 " 老图 ":





大家吐槽 Claude 最多的一个词,就是 " 贵 "。
这一次,在维持与前代产品 Opus 4.8 相同成本的前提下,Claude Opus 5 实现了性能的大幅跃升。
该模型的 " 思考程度 / 努力程度 "(Effort)设置支持用户灵活调节——既可以追求极致智能,也可以节省 Token 以获取更快、更廉价的结果。
Opus 5 在高价值的软件工程任务中表现优异:
Frontier-Bench v0.1:Opus 5 超越了所有其他模型,在降低单项任务成本的同时,性能达到了 Opus 4.8 的两倍以上。

在知识工作与复杂问题解决任务中,Opus 5 同样表现亮眼:


OSWorld 2.0(计算机操作使用基准测试):在任意给定成本下,Opus 5 的表现均优于其他所有模型,仅需略高于三分之一的成本即可超过 Fable 5 的最佳成绩。


有机化学任务(如根据光谱数据推断分子结构):在内部基准测试中得分比 Opus 4.8 高出 10.2 个百分点。
蛋白质相关任务(如预测蛋白质序列变异对其功能的影响):得分提升了 7.7 个百分点。
最后,Opus 5 具备了大幅增强的视觉输出生成能力。
生成空气动力学风洞风流图解:
细胞结构互动图示:
二、自我校验、迭代能力提升,写代码前更爱 " 动脑子 ",Lovable 联创:4.5 后最大飞跃
Claude Opus 5 在自我校验与审慎迭代方面能力提升显著,能持续优化直至任务成功。这也是当前业内非常关注的模型能力之一。
在评估和早期测试中,我们及测试用户发现了许多体现 Opus 5 主动性(Agency)与严谨性的典型案例:
自主构建视觉管线:在 Frontier-Bench 的一项任务中,模型收到一张机械零件图纸,要求编写代码在 FreeCAD 中重建 3D 模型,但任务故意未向模型提供直接查看图纸的接口。Opus 5 的做法是:自行编写了一套计算机视觉处理管线,从原始像素中提取几何特征,进而完成了完整机械零件的重建,且多次重复实验均告成功。在相同设置下,其他竞争模型尝试 5 次无一成功。
根治深层 Bug:面对一款热门开源包管理器中的真实 Bug,Opus 5 找到了根本原因,并修复了社区补丁遗漏的边缘情况;而竞争模型仅修复了表面症状而非底层根因,就报告问题已解决。
自建测试套件:某交易公司的工程师使用 Opus 5 在单次会话中为一个新交易所构建了市场数据接入源。此前即便工程师提供了详尽方案,旧模型也完全无法完成该任务。由于当时没有可用于验证的实时数据源,Opus 5 甚至自己构建了一套测试套件,用以检查代码是否准确解析了交易所数据。
Anthropic 还发布了一些业内知名人士对 Opus 5 的评价,比如:
Cognition CEO Scott Wu 提到 Opus 5 在自家 Devin 软件中,在困难问题的调试与根因分析任务中表现出色。
Zapier CEO Wade Foster 提到,Claude Opus 5 在未增加 Token 消耗的前提下拿下了 Zapier AutomationBench 榜首。它读取了一份原始客户健康度表格,端到端执行了整套客户流失预防流程(标记风险账户、通知负责人、整理留存报告)。旧模型没完成,但 Opus 5 100% 拿下了。
Lovable 联合创始人 Fabian Hedin 认为,Claude Opus 5 是 Opus 家族自 4.5 以来最大的一次飞跃。
在 JetBrains IDE AI 负责人 Denis Shiryaev 看来,Claude Opus 5 最令其印象深刻的是判别力与决策力,其在写下代码前会更深入地思考,在规划阶段就能捕获自己的逻辑缺陷,这是解题能力的一次重要跨越。
三、安全性更高、更不容易被骗,重点限制漏洞利用能力
在部署前的测试中,Anthropic 自动化行为审计表明,Opus 5 是其迄今为止对齐程度最高的模型。
它比 Opus 4.8、Sonnet 5 或 Fable 5 更符合《Claude ’ s Constitution》,欺骗行为发生率最低,且最不容易被误导或诱导滥用,在避免可能产生不可逆副作用的轻率行为方面是目前 Anthropic 最安全的模型。

与 Opus 4.8 一样,Anthropic 特意避免在网络攻防任务上训练 Opus 5。不过,由于通用能力的提升,该模型在相关任务上的表现仍有显著增强,在寻找网络安全漏洞方面已逼近 Mythos 5。
在漏洞利用(即把漏洞转化为实质性网络威胁)方面,它依然大幅落后于 Mythos 5(这一点在 OSS-Fuzz 评估中得到了验证)。

生物领域,Opus 5 延续了与 Opus 4.8 类似的安全防护体系,据称是目前可用于科学研究的最强通用模型。
结语:Claude 开始走 " 性价比 " 路线了
Claude Opus 5 这次是性能与性价比双重提升,在核心的编程、复杂推理、知识工作中提升显著,性价比优势突出,行业关注的自我校验迭代能力也有所提升,Anthropic 在安全性方面花了比较大的篇幅解读。
当前国内开源、闭源模型 " 爆更 " 给海外大模型厂商带来显著压力,不少海外科技巨头逐渐转向中国模型,加码 " 性价比 ",或许会成为海外大模型厂商后续的重要策略之一。


登录后才可以发布评论哦
打开小程序可以发布评论哦