智东西 昨天
Claude Fable 5.1深夜空降!8项霸榜,缓存降价75%,奥尔特曼急了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

作者 | 程茜

编辑 | 心缘

智东西 9 月 2 日消息,今日,Anthropic 宣布推出新一代全球最强模型Claude Fable 5.1、Claude Mythos 5.1。Fable 5.1 和 Mythos 5.1 共用同一模型底座,差异只在于安全护栏配置。

Fable 5.1 的优势集中在编程、知识工作与长周期任务场景。该模型在 Anthropic 放出的全部 8 项测试中霸榜第一,超过 Fable 5、Opus 5、GPT-5.6 Sol。Artificial Analysis 的数据显示,Fable 5.1 在 AI 分析指数榜拿下66 分位列第一,超过 Claude Opus 5 的 63 分、Claude Fable 5 的 62 分、GPT-5.6 Sol 的 61 分以及 Grok 4.6 的 61 分。

Fable 5.1 发布后几个小时,OpenAI 联合创始人、CEO 萨姆 · 奥尔特曼(Sam Altman)在社交平台 X 发长文剧透OpenAI 很快也将推出下一款产品,称此前 OpenAI 一直专注于安全方面的优先事项。

价格方面,Anthropic 称,无论使用哪种计费方式,Fable 5.1 都将比 Fable 5 低25%。这是因为缓存读取资费下降 75%,使得智能体类任务的价格最大降幅可至45%

具体来看,Fable 5.1 API 服务中的缓存读取操作成本为每百万 Token 0.25 美元(约合人民币 1.68 元)。对比 Fable 5,常规业务负载的成本降幅约25%;复杂代码开发以及高智能体属性任务场景下,成本最高可节约45%

除缓存读取资费之外,Fable 5.1 其余定价与 Fable 5 保持一致:输入 Token 为每百万 10 美元(约合人民币 67.21 元),输出 Token 每百万 50 美元(约合人民币 336.04 元)。

Claude Fable 5.1 价格(图源:Anthropic)

Artificial Analysis 数据显示,尽管缓存读取资费下调 75%,Fable 5.1 单任务实际成本仍较 Fable 5 高出20%,根源在于其输出 Token 消耗量约为后者的1.7 倍

Claude Fable 5.1 现已上线,兼容 AWS、谷歌云、微软 Azure;开发者可通过 Claude API,使用模型名 claude ‑ fable ‑ 5 ‑ 1 进行调用。

Anthropic 内部高级个体贡献者 Lance Martin 透露了一个小 tips,在 CursorBench 3.2.0 测试中,低推理档位(low ‑ effort)的 Fable 5.1 在性能表现上与 Fable 5 高版本相当,但成本却只有后者的 1/3。

还有几位网友突然发现,Anthropic 为自己重置了额度。

一、对比 GPT ‑ 5.6 Sol、Kimi K3 生成效果更出色,但也更贵

在社交平台 X 上,网友已经玩疯了,纷纷放出自己的体验案例以及和 GPT-5.6 Sol、Kimi K3 的对比生成效果。

开发者对比 Fable 5.1 和 GPT-5.6 Sol 让其生成几个独立的 3D 场景,包括一座位于私人岛屿上的未来主义豪宅、带有钻石式枝形吊灯的宏伟大厅等。结果显示,Fable 5.1 完成任务的价格是 GPT ‑ 5.6 Sol 的6 倍,但画面细节也更丰富。

还有开发者对比了 Fable 5.1 和 Kimi K3 生成游戏的能力。开发者体验发现,Fable 5.1在用户界面和游戏体验方面都优于 Kimi K3,其机制更加流畅,交互体验也更出色。Kimi K3 的成本为 11 美元,Fable 5.1 为 18 美元。

开发者让 Fable 5.1 为自己设计了一座房屋,并制作了房屋的渲染图以及流畅的动画。可以看到视频里画面流畅,客厅桌椅反射到镜子上的影子都很逼真。有网友在评论区感慨,后悔做了设计师。

另一位开发者使用 Fable 5.1 制作出其最棒的《马里奥卡丁车》游戏,他称自己对这款游戏的开发非常满意。

二、8 项测试霸榜,科学研究智能体测试性能几乎翻倍

Anthropic 放出的基准测试显示,Fable 5.1 的性能远高于其上一代 Fable 5。当将其难度设置为低或中等时,Fable 5.1 仍能取得与 Fable 5 相当甚至更好的效果,且成本更低。

主动性科学研究、终端编程(第一排从左到右)跨学科思维、自主编程(第二排从左到右)

Anthropic 的基准测试中,Fable 5.1 在全部 8 项基准中霸榜第一,尤其在科学研究和业务工作流两个 " 长程智能体 " 测试中,与其他模型拉开了很大差距。

尤其是科学研究智能体 Terminal-Bench-Science 测试中,Fable 5.1 达到 52.6%,其他三款得分均在 22% – 29% 之间。

此外,Anthropic 还提到,Fable 5.1 不会采用会拉低输出质量的捷径,其具备定位软件问题根源的能力。例如,投资机构 Millennium 的测试显示,其内部系统存在一处罕见崩溃故障,历经数年排查,内部工程师以及其他大模型均未能找出诱因,而 Fable 5.1 定位到了该问题原因。

二、Mythos 5.1 专搞科学研究,做分子设计、绘制金星地图

Anthropic 举了几个例子说明 Mythos 5.1 在科学研究方面的能力。

分子设计:研究团队为模型接入开源蛋白质设计与折叠工具,结果表明,Mythos 5.1 可以设计出亲和力更高的结合剂。针对 3 个靶点,其结合亲和力较竞赛最有成果 Adaptyv Bio 高出 10 倍,12 个靶点测试整体命中率近 50%,高于行业 10 ‑ 15% 的常规水平。

计算分析与建模:依托 NASA 三十多年前麦哲伦探测器任务获取的雷达影像,以及一份原有覆盖金星五分之一区域的高程地图,Claude Fable 5.1 训练神经网络,生成了覆盖金星 1/3 地表的全新高分辨率高程图,分辨率由原先 10 ‑ 20 公里提升至 2 ‑ 3 公里,测高精度最高提升 25%。

计算生物学:基于 GPU 运行任务专用机器学习模型属于常规做法,模型运算速度成为科研进展的主要瓶颈。Mythos 5.1 的方案是自动编写定制 GPU 算子,并对中间计算结果做缓存处理,使七套开源深度学习模型获得最高 2.5 倍性能提升。

三、沿用 Mythos 5 管控,为企业提供零数据留存策略

Mythos 5.1 将沿用 Mythos 5 的安全管控策略,对生物研究相关能力实施访问限制;暂未发现 Fable 5.1 的网络安全防护机制存在重大漏洞;针对恶意智能体编程、计算机操作类请求,模型的拒绝率与 Mythos 5、Sonnet 5、Opus 5 基本持平;自动化行为审计结果显示,在绝大多数指标上,Claude Mythos 5.1 的对齐表现优于前代 Mythos 5。

Anthropic 还提到了在数据保留、安全机制方面的措施,其采用的全新企业安全防护体系(EFS),效果等同于零数据留存策略,将数据存储在完全由客户管控的云基础设施中,该功能将于今年秋末开始,分阶段面向企业客户推出。

安全方面,网络安全场景下,新版安全策略的误报数量较此前下降 60%,部分得益于 Fable 5.1 已支持挖掘软件漏洞。其将我们联合美国政府搭建专项访问计划,开放 Mythos 5.1 的高阶生物能力,很快面向科研人员开启申请通道。

Mythos 5.1 将通过两个可信计划进行开放:

生命科学验证计划(LSVP)面向生命科学领域专业人员开放,使用者可在其余安全防护机制保持生效的前提下,启用适配专业研发场景的防护策略来调用 Claude Mythos 5.1。

网络安全验证计划(CVP)向防御性安全研究工作开放部分 Opus、Sonnet 系列模型,配套放宽网络安全相关防护限制。近期该计划将纳入 Claude Mythos 系列模型。

此外,Anthropic 还提到,根据其此前签署的《欧盟人工智能法案》要求,8 月 2 日之后发布的模型输出结果都会添加水印机制。这种水印不会对 Claude 输出的质量或内容产生影响,同时也不会包含有关用户、他们的组织以及他们与 Claude 之间的对话的任何信息。

结语:Fable 5.1 把模型能力、成本的选择权,交给开发者

Fable 5.1 此次更新跑分榜单全面领跑,但综合来看其输出 token 的消耗量仍在上涨,若无缓存读取价格下调的加持,其单任务成本反而抬升。与此同时,其通过下调缓存读取资费、并新增不同推理档位设定,可以将更多成本、模型能力的选择权交给开发者。

这也说明,对于 Agent、自动化工作流这类生产业务,token 标价已经不再是衡量成本的核心标尺,真实单任务开销、缓存命中率、推理档位调优更为重要。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

智东西 社交平台 ai分析 创始人 谷歌云
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论