智东西 23小时前
Claude最强迷你模型登场,价格暴降90%,直逼DeepSeek?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

编译 | 程茜

编辑 | 云鹏

智东西 10 月 8 日消息,今日凌晨,Anthropic 发布其迄今最便宜、最快且功能最强大的迷你模型Claude Haiku 5.5,平均运行成本比 Claude Haiku 4.5 低约 75%。

Anthropic 的官方博客称,Claude Haiku 5.5 适用于高吞吐量且对成本敏感的任务,可以处理快速且重复性的工作负载,例如摘要生成、数据整理、数据库查询、分类任务、实时客户支持以及浏览器相关操作等。Haiku 5.5 也可以和 Sonnet 5.5 搭配,作为编程工作的子智能体使用。

在 Artificial Analysis 上, Haiku 5.5 在 AI 分析指数上得分为43,在最高性能模式下,得分略高于 GLM-5.3 Flash(42 分)、Gemini 3.8 Flash(41 分)和 GPT-6 Luna(38 分)。

Claude Haiku 5.5 不超过 10 万 token 时的输出价格比 DeepSeek-V4.1-Flash 空闲时段还要便宜。

Claude Haiku 5.5 的定价比 Claude Haiku 4.5低 90%,适用于请求量不超过 10 万个 token 的情况;而超过 10 万个 token 的请求可享受50%的折扣。在 Claude Haiku 4.5 版本中,有 90% 的请求属于上述范围。

此外,Anthropic 还对全系模型性价比进行了优化,其将 Claude Sonnet 5.5 的缓存读取操作价格下调至一半,即每百万个 token 只需支付0.1 美元(约合人民币 0.67 元),在大多数智能体任务场景下,其运行成本降低约20%;Claude Max 和 Team 订阅用户还将拥有新的月度 API 积分奖励。

Claude Haiku 5.5 现已可在所有平台上使用,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude 平台上,开发者可以立即开始使用 claude-haiku-5-5。

一、动画效果实测惊艳,但部分场景比 GPT-6 Luna 贵 12 倍

不少开发者实测对比了 Claude Haiku 5.5 和 GPT-6 Luna 的表现。

一位开发者生成了斑马在奔跑的动画,其中从斑马的花纹、形态到背景,Haiku 5.5 生成的画面都更为和谐自然。

另一位网友实测了 Haiku 5.5 和 Sonnet 5.5 作为子智能体协同使用,在下方的案例中,两个模型协同只花了不到 1 分钟就完成任务。

有开发者对比发现,Claude Haiku 5.5 在相同场景下的成本是 GPT-6 Luna 的 12 倍。

下图中两个项目的 API 价格相同,在 Claude Haiku 5.5 平台上构建同一个动画化的体素式 3D 宝塔岛屿需要 24.96 美元(约合人民币 167.27 元),在 GPT-6 Luna 平台上为 1.91 美元(约合人民币 12.8 元)。

另一位开发者使用 Haiku 5.5 与 GPT-6 Luna 生成了夜班列车动画。GPT-6 Luna 在 54.6 秒内以低于 0.01 美元(约合人民币 0.07 元)的价格,生成了上面的内容,列车在夜间的森林里运行,摄像机还会切换远景、近景。

Haiku 5.5 则使用了 5 分钟 12 秒,成本为 0.03 美元(约合人民币 0.21 元),但开发者放出的案例中 Haiku 5.5 只生成了一张火车的静态图。

综合来看,Haiku 5.5 在绝大多数上下文不超过 10 万 token 的自动化任务、浏览器与计算机操作、轻量智能体场景下可以实现更优的综合收益。但面对更为复杂,需要重度编程、极高复杂度的多步规划任务时,其能力仍存在短板,这类场景依旧需要选用更高阶模型来保障输出质量。

二、相比上代模型得分几乎翻倍,整体可对标 GPT-6 Luna

Anthropic 放出的基准测试表中,对比了 Haiku 5.5 与 Haiku 4.5、GPT-6 Luna、Sonnet 5.5 在知识工作、计算机操作、多学科推理、智能体编程、视觉推理等方面的表现。

8 项基准测试中,Haiku 5.5 的表现均超过了 Haiku 4.5、GPT-6 Luna。其中相对于上一代的 Haiku 4.5,Haiku 5.5 的知识工作得分几乎翻倍,Terminal ‑ Bench 智能体编程得分从 0% 上涨到 39.2%,这说明 Haiku 5.5 已经具备较强的智能体能力。

整体来看,Haiku 5.5 综合性能相比 GPT-6 Luna 更强,尤其在 OSWorld 电脑操作测试中具有明显优势。Haiku 5.5 距离高端模型 Sonnet 5.5 仍有差距。

Haiku 5.5 是 Anthropic 首款支持可调算力档位(adjustable effort setting)的 Haiku 系列模型。用户可以自主选择优先优化成本,或是优先优化模型智能度。

Haiku 5.5 在不同算力档位下,三项基准测试的表现。

定价方面,Anthropic 称,当提示词长度不超过 10 万 token 时,Haiku 5.5 的性价比尤为突出。

下图展示了 Haiku 5.5 与 Anthropic 更先进模型之间的关键差异。

对于需要复杂智能体编程任务的场景,如那些通过 Terminal-Bench 4.0 进行评估的任务,Sonnet 5.5 和 Opus 5.5 仍然是更好的选择。Haiku 5.5 则更适合那些范围较为狭窄的任务,这些任务在 Claude 的先前版本中可能会因为成本过高而难以实现,比如压缩、摘要处理或子智能体工作等任务。

此外,本周 Anthropic 将向所有 Max 和团队订阅者提供新的月度 API 信用额度,供他们在 Claude 平台上使用。使用 Max 5x 的用户每月可获得 100 美元(约合人民币 670 元)的信用额度,使用 Max 20x 的用户则每月可获得 200 美元(约合人民币 1340 元),团队订阅者最多可获得 500 美元(约合人民币 3350 元)的信用额度。

面向开发者,他们同时更新了 Claude Python 与 TypeScript SDK,新增计算机操作与浏览器操作的测试版能力支持。

三、对齐错误案例减少,Haiku 5.5 网络安全保护更严格

Claude Haiku 5.5 在几乎所有对齐评估指标上都取得了显著改进。相比上一代模型,研究人员发现的对齐错误案例大幅减少,同时,模型在应对错误行为时的协作意愿也更强。

根据其功能特性,Haiku 5.5 的网络安全保护措施比 Haiku 4.5 更为严格。在网络安全方面,这些措施允许执行更广泛的防御任务,但无法阻止攻击者进行的渗透测试及其他攻击手段。

Haiku 5.5 的生物安全机制与 Sonnet 5、Sonnet 5.5 以及 Opus 5 相同。这些机制允许研究相关生物学问题,但会限制那些可能带来危害的请求的访问权限。

结语:轻量模型也要有智能体能力,小模型不再只追求 " 便宜够用 "

时隔一年,Anthropic 更新了自家迷你模型,并升级了智能体能力,这或许将改写过去小模型主打 " 便宜够用 " 的定位,如今 Haiku 5.5 补齐了计算机操作、终端编码、图表推理短板,搭配可调推理档位,可以用更低成本承接 10 万 token 以内的智能体业务。

这意味着 AI 智能体开发的成本门槛被进一步压低,开发者不必动辄调用高价主力模型来做网页浏览、桌面自动化这类高频任务。不过值得注意的是,Haiku 5.5 依然存在能力边界,在复杂场景高端模型的价值依旧不可替代。

未来,轻量模型或许也会成为智能体产品规模化落地的主力选型,这也会倒逼各家厂商在低成本智能体赛道加速竞争。

来源:Anthropic、X

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

flash amazon ai分析 效果
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论