智东西 20小时前
Claude Sonnet 5.5深夜空降!一半价格击败Opus,开发者实测账单暴涨
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

作者 | 程茜

编辑 | 心缘

智东西 9 月 29 日消息,今日凌晨,Anthropic 发布 Claude 5.5 系列第二款模型 Claude Sonnet 5.5,主打快速、高性价比。

Anthropic 在博客中透露,相比 Claude Sonnet 5,新模型速度提升超 30%,成本降低近 30%,更擅长处理日常任务,如修复错误、创建文档、制作幻灯片和电子表格等。

先来看几项关键指标,Sonnet 5.5 在多项指标中可对标 Opus 5.5,相比 Sonnet 5 有数倍提升。Anthropic 称,这是首个仅通过截图就能赢得《口袋妖怪红》游戏的 Sonnet 模型。在 Artificial Analysis 上,Sonnet 5.5 在 AI 分析指数上得分为 56,仅次于 Opus 5.5 的 58 分,该榜单上,Claude 系列模型包揽前三席。

价格方面,Claude Sonnet 5.5 定价与上一代相同,即每百万输入 token 2 美元,每百万输出 token 10 美元,每百万 token 的缓存读取操作需 0.20 美元。不过,其博客提到,模型在实际完成任务时,单任务成本比 Claude Sonnet 5 要低 30%。

官方放出的案例显示,Sonnet 5.5 复原魔方时仅花费 10 秒、0.11 美元就完成任务。

Artificial Analysis 的榜单显示,Sonnet 5.5 单任务输出 token 数量更多,其单任务成本为 7.60 美元,比 Sonnet 5 的单任务成本高出约 50%,接近于 Opus 5.5 的 7.63 美元。

不少开发者实测发现,Sonnet 5.5 的成本非常高," 建议坚持使用 Opus 5.5"。

Claude Sonnet 5.5 现已在全平台上线,包括 AWS、谷歌云以及微软 Azure。开发者可在 Claude 平台通过模型标识符 claude-sonnet-5-5 接入使用。 如果原先在 Sonnet 模型上关闭思考功能,迁移至 Sonnet 5.5 前,需要切换至新的 between_tools 参数配置,该配置可保持前置思考功能处于关闭状态。

Anthropic 还透露,其专为高并发和成本敏感的应用而设计的 Claude Haiku 5.5,将在未来几周发布。

一、数位开发者实测对比,效果惊艳但烧不起,一款射击游戏花费上千元

不少开发者实测对比了 Sonnet 5 和 Sonnet 5.5,两代模型之间的性能提升幅度肉眼可见。

官方案例,知名开发者 @_re_pete 对比了 Sonnet 5 和 Sonnet 5.5 生成落叶模拟器的效果。可以看出,Sonnet 5.5 的落叶飘落效果更自然,整体画面更和谐。

在不到一分钟内,开发者 @kevin_t_ngo 让 Sonnet 5.5 通过 JavaScript 动画展示了恐龙的历史,其还对比了 Sonnet 5 和 Sonnet 5.5 的生成结果。Sonnet 5.5 生成的动画主题形象明确,还能添加配套文字,生成带叙事感的完整插画。

另一开发者对比了 Sonnet 5.5 与 GPT-6 Sol、GPT-6 Astra 的效果,其与 GPT-6 Astra 的差距并不大。Sonnet 5.5、GPT-6 Astra 在生成骑自行车动作时没有出现太大瑕疵。

不过效果惊艳背后,用户实测发现 Sonnet 5.5 的成本并不低。

BridgeMind 使用 Sonnet 5.5 制作了一款射击游戏,它称新模型表现机器出色,生成的游戏堪称神作,但构建成本要达到 177 美元(约合人民币 1187 元),耗时 49 分钟完成。

在下面开发者制作的城市模拟器案例中,Sonnet 5.5 的效果明显比 Sonnet 5 更好,Sonnet 5.5 的输出 token 数量为 38 万,花费了 9.23 美元,Sonnet 5 为 12 万,花费 4.85 美元。

另一开发者使用 Sonnet 5.5 制作了一个果酱西瓜浏览器动画,最终预计的 API 使用成本约为 8.20 美元,其中代码与推理 2.80 美元、缓存上下文数据 3.6 美元、缓存写入操作 1.8 美元、常规输入 token 0.02 美元,其中 2/3 的资源都被用于处理上下文相关任务。

二、多项测试可对标 Opus 5.5,Anthropic 建议开发者调节档位降成本

从 Anthropic 发布的基准测试来看,Sonnet 5.5 在多项指标中已经超越其性能更高的 Opus 5.5 模型。

具体来看,该基准测试对比了 Sonnet 5.5、Sonnet 5、Opus 5.5、GPT-6 Sol 四大模型在智能体编程、知识工作、多学科推理、电脑操作、图表识别等方面的性能。

和上代 Sonnet 5 对比,Sonnet 5.5 在编程、图表识别上的分数提升了数倍;和 GPT-6 Sol 对比,Sonnet 5.5 在智能体编程、知识工作、图表识别上都更优;Sonnet 5.5 在主动编程领域上的分数甚至超过 Claude Opus 5.5,其他几项与之相当。

下图是各模型在不同投入等级下的得分与单任务成本的对比曲线,数据点越靠近图表左上角,代表每花费一美元所能获得的模型能力越强。

在多项基准测试中,低 / 中等投入档位下的 Sonnet 5.5 能超越 Sonnet 5 的最高得分,而单任务成本仅为后者的约十分之一。 Sonnet 5.5 在较低投入档位运行时,单任务成本更低,与 Opus 5.5 形成互补;拉高投入档位后,它可以达到接近 Opus 的性能,同时成本处于相近水平。

编程是 Sonnet 5.5 性能提升的一个突出场景。在智能体编程基准 FrontierCode 的高投入档位下,它的得分比同档位 Sonnet 5 高出 10 分左右,单任务成本仅约后者的 1/15。

CursorBench 基于 Cursor 真实编程会话任务开展测试,在该基准上,Sonnet 5.5 的最高分与 Opus 5.5 差距仅约 2 分。

很多早期测试者称,在直接对比测试中,Sonnet 5.5 能够将工具调用合并在一起,从而减少操作步骤、降低成本。

Sonnet 5.5 在多项知识工作任务上均取得性能提升。GDPval-AA 基准覆盖 44 个职业、9 大行业的真实业务任务,在该测试中,Sonnet 5.5 得分与 Opus 5.5 几乎持平,相比 Sonnet 5 高出约 400 分。在电脑操作与图表识别能力上,它的表现也十分接近 Opus 5.5;而在长周期知识工作场景,其性能明显优于 Sonnet 5 和 GPT-6 Sol。

价格方面,开发者调整投入档位,可在成本、响应速度与任务整体质量之间做权衡。在 Claude Code 以及 Anthropic 官方应用中,默认投入档位为中等(Medium);开发者平台 Claude Platform 默认档位为高(High)。

Anthropic 官方称,档位较低时,Claude 响应更快、消耗 Token 更少,适合常规事务处理;档位调高后,Claude 会进行更长时间的推理,并对输出结果做更全面的自检核验。

三、大多数对齐性指标,与 Sonnet 5 相当

在其自动化行为审计中,Sonnet 5.5 在大多数对齐性指标上均优于或达到与 Sonnet 5 相同的水平。由于其网络安全能力与 Opus 5 相当,因此它是首个具备网络安全防护措施和回退机制的 Sonnet 模型。其生物学安全防护机制与 Sonnet 5 相同。这两种安全防护机制都针对的是少数高风险操作;常规的软件开发和大多数生命科学领域的操作并未受到影响。

Anthropic 研究人员在博客中透露,Sonnet 5.5 并未突破其模型能力的前沿上限,因此他们将模型的对齐评估,聚焦于一组适用于所有能力等级模型的特定风险,包括损害用户利益、误导用户,以及被用于高风险恶意场景时产生协同危害。

研究人员开展自动化行为审计,在约 1850 个场景下对 Claude 进行测试。

结果显示,在对齐性、抗滥用能力与诚实度的大部分指标上,Sonnet 5.5 相比 Sonnet 5 均有提升或持平。 在其新推出的隔离防护评估中,Sonnet 5.5 尝试突破沙箱的概率接近本次测试中表现最优的 Opus 5.5;并且在所有 Anthropic 模型里,它去试探容器防护边界的概率最低。他们没有发现 Sonnet 5.5 会去执行与用户意图相冲突的目标。

网络安全方面,Sonnet 5.5 的网络安全相关能力相对 Sonnet 5 有提升,因此研究人员为其部署了与 Opus 5.5 相近的安全防护机制。用户仍然可以在常规软件开发流程中,利用模型查找并修复代码漏洞;但高风险网络安全任务会自动降级回 Sonnet 5 处理。

Sonnet 5.5 沿用与 Sonnet 5 相同的生物相关安全防护机制。该防护体系针对有害请求;绝大多数科研、教育以及临床工作不受影响,但部分微生物学与病毒学相关请求可能出现误拦截。

在模型蒸馏防护方面,Sonnet 5.5 是首款内置安全分类器以抵御推理提取攻击的 Sonnet 系列模型,并扩展了保留思考链路(preserved thinking)机制:Claude 的推理思考过程无法脱离生成该内容的账号单独剥离。

此外,Claude Sonnet 5.5 版本也提供了不保存任何数据功能的版本。

结语:Claude 中端主力模型性能暴涨,但成本是个坎

Sonnet 5.5 的升级,标志着 Anthropic 的主力中端大模型正在快速收窄与旗舰模型之间的能力差距。这或许会改变企业落地大模型的选型思路,不必一味追求最高规格旗舰,可采用主力模型承担绝大多数常规任务、旗舰模型仅处理高难度复杂任务的分层调用架构,在能力与成本之间找到更优平衡点。

不过综合开发者的实测结果来看,Sonnet 5.5 在成本端并未实现大幅缩减。一旦面对复杂 Agent 任务,用户往往需要拉高投入等级来换取足够性能,此时单任务开销会明显抬升。

来源:Anthropic、X

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论