
作者 | 程茜
编辑 | 心缘
智东西 9 月 2 日消息,今日,Anthropic 宣布推出新一代全球最强模型Claude Fable 5.1、Claude Mythos 5.1。Fable 5.1 和 Mythos 5.1 共用同一模型底座,差异只在于安全护栏配置。
Fable 5.1 的优势集中在编程、知识工作与长周期任务场景。该模型在 Anthropic 放出的全部 8 项测试中霸榜第一,超过 Fable 5、Opus 5、GPT-5.6 Sol。Artificial Analysis 的数据显示,Fable 5.1 在 AI 分析指数榜拿下66 分,位列第一,超过 Claude Opus 5 的 63 分、Claude Fable 5 的 62 分、GPT-5.6 Sol 的 61 分以及 Grok 4.6 的 61 分。


具体来看,Fable 5.1 API 服务中的缓存读取操作成本为每百万 Token 0.25 美元(约合人民币 1.68 元)。对比 Fable 5,常规业务负载的成本降幅约25%;复杂代码开发以及高智能体属性任务场景下,成本最高可节约45%。


Artificial Analysis 数据显示,尽管缓存读取资费下调 75%,Fable 5.1 单任务实际成本仍较 Fable 5 高出20%,根源在于其输出 Token 消耗量约为后者的1.7 倍。

Anthropic 内部高级个体贡献者 Lance Martin 透露了一个小 tips,在 CursorBench 3.2.0 测试中,低推理档位(low ‑ effort)的 Fable 5.1 在性能表现上与 Fable 5 高版本相当,但成本却只有后者的 1/3。


在社交平台 X 上,网友已经玩疯了,纷纷放出自己的体验案例以及和 GPT-5.6 Sol、Kimi K3 的对比生成效果。
开发者对比 Fable 5.1 和 GPT-5.6 Sol 让其生成几个独立的 3D 场景,包括一座位于私人岛屿上的未来主义豪宅、带有钻石式枝形吊灯的宏伟大厅等。结果显示,Fable 5.1 完成任务的价格是 GPT ‑ 5.6 Sol 的6 倍,但画面细节也更丰富。
还有开发者对比了 Fable 5.1 和 Kimi K3 生成游戏的能力。开发者体验发现,Fable 5.1在用户界面和游戏体验方面都优于 Kimi K3,其机制更加流畅,交互体验也更出色。Kimi K3 的成本为 11 美元,Fable 5.1 为 18 美元。
开发者让 Fable 5.1 为自己设计了一座房屋,并制作了房屋的渲染图以及流畅的动画。可以看到视频里画面流畅,客厅桌椅反射到镜子上的影子都很逼真。有网友在评论区感慨,后悔做了设计师。
另一位开发者使用 Fable 5.1 制作出其最棒的《马里奥卡丁车》游戏,他称自己对这款游戏的开发非常满意。
二、8 项测试霸榜,科学研究智能体测试性能几乎翻倍
Anthropic 放出的基准测试显示,Fable 5.1 的性能远高于其上一代 Fable 5。当将其难度设置为低或中等时,Fable 5.1 仍能取得与 Fable 5 相当甚至更好的效果,且成本更低。

Anthropic 的基准测试中,Fable 5.1 在全部 8 项基准中霸榜第一,尤其在科学研究和业务工作流两个 " 长程智能体 " 测试中,与其他模型拉开了很大差距。
尤其是科学研究智能体 Terminal-Bench-Science 测试中,Fable 5.1 达到 52.6%,其他三款得分均在 22% – 29% 之间。

二、Mythos 5.1 专搞科学研究,做分子设计、绘制金星地图
Anthropic 举了几个例子说明 Mythos 5.1 在科学研究方面的能力。
分子设计:研究团队为模型接入开源蛋白质设计与折叠工具,结果表明,Mythos 5.1 可以设计出亲和力更高的结合剂。针对 3 个靶点,其结合亲和力较竞赛最有成果 Adaptyv Bio 高出 10 倍,12 个靶点测试整体命中率近 50%,高于行业 10 ‑ 15% 的常规水平。



Mythos 5.1 将沿用 Mythos 5 的安全管控策略,对生物研究相关能力实施访问限制;暂未发现 Fable 5.1 的网络安全防护机制存在重大漏洞;针对恶意智能体编程、计算机操作类请求,模型的拒绝率与 Mythos 5、Sonnet 5、Opus 5 基本持平;自动化行为审计结果显示,在绝大多数指标上,Claude Mythos 5.1 的对齐表现优于前代 Mythos 5。
Anthropic 还提到了在数据保留、安全机制方面的措施,其采用的全新企业安全防护体系(EFS),效果等同于零数据留存策略,将数据存储在完全由客户管控的云基础设施中,该功能将于今年秋末开始,分阶段面向企业客户推出。
安全方面,网络安全场景下,新版安全策略的误报数量较此前下降 60%,部分得益于 Fable 5.1 已支持挖掘软件漏洞。其将我们联合美国政府搭建专项访问计划,开放 Mythos 5.1 的高阶生物能力,很快面向科研人员开启申请通道。
Mythos 5.1 将通过两个可信计划进行开放:
生命科学验证计划(LSVP)面向生命科学领域专业人员开放,使用者可在其余安全防护机制保持生效的前提下,启用适配专业研发场景的防护策略来调用 Claude Mythos 5.1。
网络安全验证计划(CVP)向防御性安全研究工作开放部分 Opus、Sonnet 系列模型,配套放宽网络安全相关防护限制。近期该计划将纳入 Claude Mythos 系列模型。
此外,Anthropic 还提到,根据其此前签署的《欧盟人工智能法案》要求,8 月 2 日之后发布的模型输出结果都会添加水印机制。这种水印不会对 Claude 输出的质量或内容产生影响,同时也不会包含有关用户、他们的组织以及他们与 Claude 之间的对话的任何信息。
结语:Fable 5.1 把模型能力、成本的选择权,交给开发者
Fable 5.1 此次更新跑分榜单全面领跑,但综合来看其输出 token 的消耗量仍在上涨,若无缓存读取价格下调的加持,其单任务成本反而抬升。与此同时,其通过下调缓存读取资费、并新增不同推理档位设定,可以将更多成本、模型能力的选择权交给开发者。
这也说明,对于 Agent、自动化工作流这类生产业务,token 标价已经不再是衡量成本的核心标尺,真实单任务开销、缓存命中率、推理档位调优更为重要。



登录后才可以发布评论哦
打开小程序可以发布评论哦