虎嗅APP 昨天
OpenAI、Anthropic邀您进入“大模型折扣季”
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

AI 圈真是喘口气的时间都不给留。

北京时间 9 月 23 日,Anthropic 刚把 Claude Opus 5.5 端上桌。2 小时后,OpenAI 立马祭出 GPT-6 Sol 和 Luna 迎战。

Opus 5.5 比上一代 Opus 更强了,输入、输出单价也比上一代低了 20%。而 GPT-6 Sol 两项单价只有 Astra 的五分之一;Luna 更夸张,每百万输出 Token 只要 0.5 美元。

不过,这轮交锋最有意思的地方,不止降价。

Opus 的能力提升,把自家 Fable 的位置弄得有点尴尬。OpenAI 推出更低单价的 Sol 和 Luna,想扩大用户的使用范围。但模型思考时间久了,最后可能花得反而更多。

Opus 一升级,Fable 先坐不住了

Opus 5.5 是 Claude 5.5 系列第一个登场的模型。

Anthropic 给它的定位很高——大多数任务能做到 Fable 5.1 级别,典型工作负载成本比 Opus 5 低约 40%,而输出速度还快了 30% 以上。

我们翻了翻 Opus 5.5 的跑分。

在 Anthropic 公布的 Terminal-Bench 4.0 测试里,Opus 5.5 拿到 66.4%,Astra 是 57.9%,Fable 5.1 是 55.8%。到了 FrontierCode,Opus 又以 54.4% 小幅领先 Astra 的 53.3%。

但在跨应用工作流测试 AutomationBench 和科学 Agent 测试里,领先的仍然是 Astra。各项测试的推理设置也有差异,离 " 全面打爆 " 还有一段距离。

比跑分更直观的,是 Claude Code 负责人 Boris Cherny 分享的一次代码迁移案例。

他们让 Opus 5.5 和 Fable 5.1 分别把 HAProxy 从 C 移植到 Rust。

两个模型都通过了几乎全部 HAProxy 测试,但 Opus 用了 9.5 小时,Fable 用了 12 小时,而 Opus 的成本还低了 51%。

当然,这是 Anthropic 内部分享的单项任务结果,不能代表所有项目。

但对开发者来说,活儿差不多,速度更快,钱还少一半。

这比别的好像都重要。

最先感到压力的,可能就是 Fable 5.1 模型了。

它的标准 API 输入、输出价格分别是每百万 Token 10 美元和 50 美元,Opus 5.5 则是 4 美元和 20 美元。

如果手头的活儿 Opus 已经能干好,用户愿意为 Fable 多花这笔钱吗?

OpenAI 摊开价目表

OpenAI 的打法有所不同。

Astra 把持最高能力的位置,Sol 负责复杂编程和 Agent 工作流,Luna 接高频、相对集中的任务。

它贴心地照顾到了不同预算的用户。

按标准 API 价格,每百万 Token 输入、输出分别计算,Astra 是 10 美元、50 美元;Sol 是 2 美元、10 美元;Luna 只有 0.1 美元、0.5 美元。

同样是一百万输出 Token,Astra 收 50 美元,Luna 收 0.5 美元,差了 100 倍。

对于每天要调用成千上万次的产品来说,简单工作场景的分类、提取、批量处理任务里,便宜模型只要够用就行。

第三方机构 Artificial Analysis 的测试也给出了实际成本变化。Sol 在其测试中的单任务成本从上一代的 1.99 美元降到 1.06 美元,Luna 则从 0.18 美元降到 0.07 美元。

单价降了,账单可不一定

确实是普降价格了,但你可别上来就急着把推理强度拉满。

Artificial Analysis 测试显示,Opus 5.5 在 max 档的能力指数达到 58 分,但平均每项任务生成约 11.9 万 Token,其中约 8.4 万是推理 Token。

同一机构测试里,max 档每项任务成本是 5.98 美元,high 档则是 1.82 美元,对应能力指数 54 分。

为了多拿这 4 分提升,成本涨了不少。每个 Token 便宜了,但推理强度拉高后,模型可能生成更多 Token,最后的账单未必更低。

Sol 和 Luna 也出现了 Token 消耗增加的情况,不过,降价抵消了这部分增量。

Artificial Analysis 的评测也显示,Sol 和 Luna 这次省钱,主要靠的是靠降单价,没有省消耗。

在该机构的测试中,相比各自上一代模型,Sol 每项任务平均生成的 Token 从约 2.9 万增加到 3.1 万,Luna 则从约 4.1 万增加到 5.1 万。虽然消耗更多,但由于单价降低,Sol 的单任务成本仍从 1.99 美元降到了 1.06 美元,Luna 则从 0.18 美元降到了 0.07 美元。

此外,能力也没有每项都涨。

在 Artificial Analysis 的编程指数中,Sol 从 55 分升到 57 分,Luna 则从 43 分降到 41 分。

接地气的变化

除了价格,这次还有个很接地气的变化。

Anthropic 专门强调,Opus 5.5 这次会把重要信息放前面,减少行话,改善过去又长又密的表达。

毕竟,干活已经够忙了,谁还想先读一篇 AI 的工作感想。

但 " 去啰嗦化 " 做得怎么样,用户的反馈并不一致。

沃顿商学院教授 Ethan Mollick 在早期测试后,认可 Opus 5.5 已经有了 Fable 级模型的感觉,同时也指出,近期 Claude 语言过于密集的问题,还没完全解决。

另一边,不少开发者已经开始整活。

Anthropic 工程师 Addy Osmani 用一只 Three.js 里的骑车鹈鹕庆祝发布。小鸟踩起踏板,比一屏参数容易让人记住多了,这一波手搓动画的效果也让不少人感叹其视频动画能力的提升之大。

但热闹归热闹,对普通用户来说,真正决定你留下哪个模型的,还得回归性价比。

同一件事,谁能少返工几次、少花一点钱,谁才一直能够留存用户。

大模型还得卷一会儿。

文章标题:OpenAI、Anthropic 邀您进入 " 大模型折扣季 "

文章链接:https://www.huxiu.com/article/4893419.html

阅读原文:OpenAI、Anthropic 邀您进入 " 大模型折扣季 "_ 虎嗅网

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra 元和 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论