钛媒体APP 10小时前
Opus 5冲上第一,还需要Fable 5吗?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

(本文作者为 AIX 财经,钛媒体经授权发布)

文 | AIX 财经(AIXcaijing),作者 | 雷晶,编辑 | 金玙璠

7 月的模型圈很热闹。

25 日凌晨,Anthropic 正式推出了新模型 Claude   Opus 5。

这一次,Anthropic 没有强调 " 最强模型 ",而是给出更务实的定位:Opus 5在复杂任务上更少遗漏步骤、更倾向主动验证中间结果,在多项评测中兼顾性能与成本,适合日常高频使用。

定位的变化也直接体现在产品里,目前 Opus 5 成为 Claude Max 的默认模型,也是面向个人订阅用户(Max/Pro)可调用的最强模型;能力更高的 Fable 5 主要面向 API 与企业客户,个人订阅用户虽然可用,但额度相当有限。

从官方公布的成绩来看,Opus 5 重点提升了编程、知识工作和智能体任务的完成效率,在多项软件工程、商业流程和电脑操作评测中位居前列;在最高思考档位下,部分成绩已经逼近甚至超过 Fable 5。不过,在进攻性网络利用和长周期自主生物研究等高风险场景中,受限的 Mythos 5 仍然更强。

Opus 5 提供了可调节的 effort(思考档位),用户可按任务难度调整推理资源投入。档位越高,处理复杂问题的能力越强,但速度更慢、Token 消耗也更多;调低则省时省钱

目前,Opus 5 已在全平台上线,API 价格为每百万 Token 输入 5 美元、输出 25 美元,与 Opus 4.8 持平,约为 Fable 5 的一半;追求速度可开 Fast 模式,以约两倍价格换 2.5 倍速度。

Anthropic 同时上线了两项 Beta 功能:动态调整工具与自动回退,用于降低 Agent 任务因缓存失效抬升成本、或因安全拦截中断的风险。

性能逼近、价格减半,那 Opus 5 能替代 Fable 5 吗?

01. 登上榜首,但不是断层领先

我们先来看官方给出的成绩单。

为了突出模型的领先性,Opus 5 的对比对象选的是当前能力最强的几款模型:上一代 Opus 4.8、公开旗舰 Fable   5,以及 OpenAI 刚发布的旗舰模型 GPT-5.6 Sol。

软件工程是最突出的方面。在 Frontier-Bench v0.1 测试中,Opus 5 超过所有参测模型,成绩相比 Opus 4.8 提高一倍以上,单项任务成本反而更低。在 CursorBench 3.2 测试中,开启 max effort 后,两者成绩相差不到 0.5%,每项任务成本约为后者一半。

类似优势也出现在需要模型连续操作的任务中。在 Zapier AutomationBench 测试中,按相同的单项任务成本计算,Opus 5 通过率约为第二名(Fable 5)的 1.5 倍。在 OSWorld 2.0 测试中,它仅用 Fable 5 单项任务成本的略多于三分之一,超过了后者最好成绩。

这些项目的共同点在于,测试的不只是模型能否答对一道题,还包括它能否调用工具、跨越多个步骤、发现错误并继续推进。

ARC-AGI 3 主要考察模型处理陌生规则和新问题的能力。Opus 5 得到 30.2%,此前榜首是 GPT-5.6 Sol 的 7.8%。不过该成绩取自 high 档而非 max 档,max 档结果尚未公布。至少在此设定下,Opus 5 展现了较强的规则归纳、观察与试错能力。

不过,Opus 5 并非在所有项目中都领先。在 Anthropic 公布的十余项对比中,有四项落后其他模型。

在 Humanity ’ s Last Exam 测试中,不用工具时,Opus 5 得 56.3%,略低于 Fable 5 的 56.5%;开放工具后 Opus 5 升至 64.7%,反超 Fable 5 的 63.9%。这更能说明两者差别Fable 5 仍有更强的纯模型能力,Opus 5 更擅长搜索、调用工具、检查结果并持续推进任务。

Anthropic 披露的案例也符合这一特点。Opus 5 在没有图像查看工具的情况下,自行编写计算机视觉程序,从机械图纸的原始像素中提取数据;在缺少实时行情的情况下,主动搭建测试环境验证交易所数据接口是否正确。

从这些表现来看,Opus 5 此次升级的重点,与其说是纯模型能力的跃升,不如说是执行、验证和纠错能力变得更成熟。

当然,官方跑分需要谨慎看待。以 Frontier-Bench 测试为例,结果是在特定智能体框架下进行五次测试后取平均值,触发安全分类器时还会由 Opus 4.8 接管,说明工具配置、提示词和运行环境发生变化,结果也可能变化。

我们再来看看第三方榜单。

截至 7 月 25 日,Artificial Analysis 的智能指数榜单上,Opus 5 max 以 61 分排在第一位,仅高于第二名的 Fable 5 一分。该榜单综合 9 项评测,比单看某个优势项目更能反映综合能力。

到这里可以得出两个结论。第一,Opus 5 进入当前第一梯队,而且在最高思考档位下暂时排在榜首。第二,在各项测试中,Opus 5 并没有和其他模型拉开明显差距,没有形成断层优势。

所以,Opus 5 只是当前榜单上的领先者。跑分给出了能力上限,真实使用中的稳定性、Token 消耗和最终交付质量,才决定性价比究竟高不高。

02. 跑分更高,不等于活干得更好

模型上线后,评价很快两极分化。

正面评价集中在编程和可交互内容生成。有网友在 X 上分享 Opus 5 生成的可交互 3D 黑洞可视化器,还能实时合成一段电子音乐,代码、视觉效果和声音被整合进同一个成品,说明它快速制作产品原型的能力很强。

也有网友将 Opus 5 和 Fable 5、GPT-5.6、Kimi K3 对比,认为它在 3D 的制作上效果更好。

但也有开发者认为,Opus 5 在部分任务中过度思考,推理过程很长,做到后面甚至会 " 我行我素 ",偏离最初目标。有网友测试后称,模型消耗了大量 Token,并占用了较多上下文空间,却没有严格按照要求执行,更高的 effort 并不一定带来更好的结果。

更系统的测试来自代码审查平台 CodeRabbit。它的结论是,Opus 5 更适合写代码,而不是独立承担全部代码审查工作。它处理开放式、设计导向的任务时效果更好,但在逻辑错误、竞态条件和 API 误用等问题上仍可能漏检。

独立开发者李默将 Opus 5 形容为一个 " 做事靠谱,但略有个性的同事 "。实际体验中,其调试能力很强,整体远高于 Opus 4.8,也是 Fable 5 额度耗尽后的合适替代品。但 Opus 4 时代形成的工作流和提示词不能直接迁移到 Opus 5,想获得明显提升,得了解新模型习惯,调整任务拆分、effort 档位和验证方法。

李默提到,实用的是两个 Beta 功能直接改善了 Agent 开发体验:过去改一次工具列表整段缓存就作废,现在对话中途换工具也不会失效;API 还可启用自动降级,被安全分类器拦截的请求会自动转交其他模型。

综合来看,Opus 5 目前更像一名执行力强、愿意自查,但还需要磨合的同事。它适合生成代码、修复问题和完成边界清楚的工作,但在复杂规划、长周期自主任务和部分文字表达上,Fable 5 仍有优势。

03.Anthropic 需要一款更日常的旗舰模型

Anthropic 最近在加快模型更新速度。

5 月 29 日,发布 Opus 4.8;6 月 10 日,发布 Fable 5 和 Mythos 5;7 月 1 日,上线 Sonnet 5;7 月 25 日,发布 Opus 5,不到两个月,Claude 的主要产品线几乎更新了一遍。

在密集发布模型的情况下,行业对模型应该如何开放的分歧也在扩大。7 月 16 日,月之暗面发布开放权重模型 Kimi K3,性能被认为已接近前沿。几天后,OpenAI 战略负责人在 X 上预测,华盛顿会围绕中国开放权重模型制造 " 监管风险 ",这番话被广泛解读为对开源阵营的施压。

Opus 5 发布当天,英伟达、Meta、微软等 25 家公司和机构联合发表公开信,呼吁美国政府不要过早限制开放权重模型,OpenAI、Anthropic 和 Google 没有出现在签署名单中。

缺席不等于明确反对开放权重,但与开放权重相比,Anthropic 确实更强调闭源、分级开放和风险控制。6 月 12 日,美国政府对 Fable 5 和 Mythos 5 实施管制,两款模型一度全面下线。限制解除后,Fable 5 恢复公开服务,安全限制更少的 Mythos 5 仍只向部分获批机构开放。

Opus 5 的定位,正嵌在 Anthropic 这套 " 模型该如何开放 " 的策略里。它发现源代码漏洞的能力接近 Mythos 5,将漏洞转化为实际攻击工具的能力却明显较弱。对 Anthropic 而言,它不只是更便宜的 Fable 5 替代品,也是一个更容易在合规框架下向普通用户和企业开放的选项。

与此同时,Anthropic 还在扩充算力。Opus 5 发布前两天,公司宣布将部署最高 2 吉瓦规模的 AMD Instinct MI450 系列 GPU 和 Helios 机架级系统,首批 1 吉瓦计划于 2027 年上半年开始部署。AMD 还承诺未来向 Anthropic 进行最高 50 亿美元的战略股权投资。

从密集发布模型,到扩充芯片供给,再到精简系统提示词,Anthropic 做的不仅是提高跑分,而是把模型能力拆分到不同价格、风险和使用场景中:Fable 5 负责更复杂、更长周期的任务,Sonnet 5 承接成本敏感的普遍需求,Opus 5 则试图成为开发者和知识工作者的日常默认选择。

所以,Opus 5 没有让 Fable 5 失去意义。后者仍代表 Anthropic 公开可用的模型能力上限,Opus 5 解决的是如何以更低成本,把接近旗舰的能力交给更多用户。它的竞争力在于能否以更稳定的表现、更少的人工接管和可以控制的成本,把一项工作真正完成。

* 题图来源于 Anthropic 官网。应受访者要求,李默为化名。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

成绩单 生物 钛媒体 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论