
编译 | 程茜
编辑 | 云鹏
智东西 10 月 8 日消息,今日凌晨,Anthropic 发布其迄今最便宜、最快且功能最强大的迷你模型Claude Haiku 5.5,平均运行成本比 Claude Haiku 4.5 低约 75%。

在 Artificial Analysis 上, Haiku 5.5 在 AI 分析指数上得分为43,在最高性能模式下,得分略高于 GLM-5.3 Flash(42 分)、Gemini 3.8 Flash(41 分)和 GPT-6 Luna(38 分)。



Claude Haiku 5.5 现已可在所有平台上使用,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude 平台上,开发者可以立即开始使用 claude-haiku-5-5。
一、动画效果实测惊艳,但部分场景比 GPT-6 Luna 贵 12 倍
不少开发者实测对比了 Claude Haiku 5.5 和 GPT-6 Luna 的表现。
一位开发者生成了斑马在奔跑的动画,其中从斑马的花纹、形态到背景,Haiku 5.5 生成的画面都更为和谐自然。
另一位网友实测了 Haiku 5.5 和 Sonnet 5.5 作为子智能体协同使用,在下方的案例中,两个模型协同只花了不到 1 分钟就完成任务。

下图中两个项目的 API 价格相同,在 Claude Haiku 5.5 平台上构建同一个动画化的体素式 3D 宝塔岛屿需要 24.96 美元(约合人民币 167.27 元),在 GPT-6 Luna 平台上为 1.91 美元(约合人民币 12.8 元)。
另一位开发者使用 Haiku 5.5 与 GPT-6 Luna 生成了夜班列车动画。GPT-6 Luna 在 54.6 秒内以低于 0.01 美元(约合人民币 0.07 元)的价格,生成了上面的内容,列车在夜间的森林里运行,摄像机还会切换远景、近景。
Haiku 5.5 则使用了 5 分钟 12 秒,成本为 0.03 美元(约合人民币 0.21 元),但开发者放出的案例中 Haiku 5.5 只生成了一张火车的静态图。
综合来看,Haiku 5.5 在绝大多数上下文不超过 10 万 token 的自动化任务、浏览器与计算机操作、轻量智能体场景下可以实现更优的综合收益。但面对更为复杂,需要重度编程、极高复杂度的多步规划任务时,其能力仍存在短板,这类场景依旧需要选用更高阶模型来保障输出质量。
二、相比上代模型得分几乎翻倍,整体可对标 GPT-6 Luna
Anthropic 放出的基准测试表中,对比了 Haiku 5.5 与 Haiku 4.5、GPT-6 Luna、Sonnet 5.5 在知识工作、计算机操作、多学科推理、智能体编程、视觉推理等方面的表现。
8 项基准测试中,Haiku 5.5 的表现均超过了 Haiku 4.5、GPT-6 Luna。其中相对于上一代的 Haiku 4.5,Haiku 5.5 的知识工作得分几乎翻倍,Terminal ‑ Bench 智能体编程得分从 0% 上涨到 39.2%,这说明 Haiku 5.5 已经具备较强的智能体能力。
整体来看,Haiku 5.5 综合性能相比 GPT-6 Luna 更强,尤其在 OSWorld 电脑操作测试中具有明显优势。Haiku 5.5 距离高端模型 Sonnet 5.5 仍有差距。


定价方面,Anthropic 称,当提示词长度不超过 10 万 token 时,Haiku 5.5 的性价比尤为突出。
下图展示了 Haiku 5.5 与 Anthropic 更先进模型之间的关键差异。
对于需要复杂智能体编程任务的场景,如那些通过 Terminal-Bench 4.0 进行评估的任务,Sonnet 5.5 和 Opus 5.5 仍然是更好的选择。Haiku 5.5 则更适合那些范围较为狭窄的任务,这些任务在 Claude 的先前版本中可能会因为成本过高而难以实现,比如压缩、摘要处理或子智能体工作等任务。

面向开发者,他们同时更新了 Claude Python 与 TypeScript SDK,新增计算机操作与浏览器操作的测试版能力支持。
三、对齐错误案例减少,Haiku 5.5 网络安全保护更严格
Claude Haiku 5.5 在几乎所有对齐评估指标上都取得了显著改进。相比上一代模型,研究人员发现的对齐错误案例大幅减少,同时,模型在应对错误行为时的协作意愿也更强。
根据其功能特性,Haiku 5.5 的网络安全保护措施比 Haiku 4.5 更为严格。在网络安全方面,这些措施允许执行更广泛的防御任务,但无法阻止攻击者进行的渗透测试及其他攻击手段。
Haiku 5.5 的生物安全机制与 Sonnet 5、Sonnet 5.5 以及 Opus 5 相同。这些机制允许研究相关生物学问题,但会限制那些可能带来危害的请求的访问权限。
结语:轻量模型也要有智能体能力,小模型不再只追求 " 便宜够用 "
时隔一年,Anthropic 更新了自家迷你模型,并升级了智能体能力,这或许将改写过去小模型主打 " 便宜够用 " 的定位,如今 Haiku 5.5 补齐了计算机操作、终端编码、图表推理短板,搭配可调推理档位,可以用更低成本承接 10 万 token 以内的智能体业务。
这意味着 AI 智能体开发的成本门槛被进一步压低,开发者不必动辄调用高价主力模型来做网页浏览、桌面自动化这类高频任务。不过值得注意的是,Haiku 5.5 依然存在能力边界,在复杂场景高端模型的价值依旧不可替代。
未来,轻量模型或许也会成为智能体产品规模化落地的主力选型,这也会倒逼各家厂商在低成本智能体赛道加速竞争。
来源:Anthropic、X




登录后才可以发布评论哦
打开小程序可以发布评论哦