Claude Haiku 5.5 发布,小模型大逆袭!
单论跑分,直接超越两大前 " 斩杀线 "DeepSeek V4.1Flash 和 GLM-5.3-Flash,成为新的小模型守门员。

一看官方跑分,好嘛,这就是冲着 GPT-6 Luna 来的,逐项赢过 Luna。

由于鹈鹕骑自行车测试已经基本饱和了,最新赶到战场的是奔跑斑马测试。
Haiku 5.5 甚至价格也完全对标 GPT-6 Luna。
上代 Haiku 4.5 还是刚好一年前出的,价格是 5.5 的 10 倍。

不过 Haiku5.5 的价格还有条件,提示词在 10 万 token 以内的请求(占 Haiku 4.5 请求量的 90%),输入输出价格直接砍 90%;超过 10 万 token 的部分,只砍 50%。
而且这样一来,除了缓存命中的输入这一项,Haiku 5.5 在不超出 100k 提示词时的价格也比 DeepSeek-V4.1 Flash 的谷时价格便宜了。
为了测试计算机使用能力,我们让 Haiku 5.5 把 GPT-6 和 DeepSeek 的价格填到 Haiku 发布页表格的后面。

它没有直接编辑 html 元素,而是到控制台用脚本注入内容。

至此 Opus 5.5 管复杂推理、Sonnet 5.5 管通用执行、Haiku 5.5 管跑量和速度,群贤毕至,只差 Fable 了。
只能说隔壁 OpenAI 要是不努把力,Claude 都没必要把 Fable 5.5 这管大牙膏挤出来。
仿佛回到了英特尔和 AMD 比拼 CPU 的日子。
换了 tokenizer,耗费 token 更多
Haiku 5.5 是第一个支持 effort 调节的 Haiku 模型,继承了系列从 low 到 max 的五档配置。
上一代 Haiku 4.5 在计算机操作和编码方面基本交白卷,这一代直接进化。
看 OSWorld 2.1(测 agent 操作真实电脑完成多步任务):Low 档 42.0% 准确率、单次成本 $0.07;Max 档 72.4%、$0.61。Haiku 4.5 只有 Max 档 15.7%、$1.45,
也就是说,5.5 的 Low 档比 4.5 的 Max 档准,还便宜一半。

GDPval-AA v2.1(测 44 个职业的真实专业工作)也是类似曲线:Low 档 Elo 1125、$0.01;Max 档 1620、$0.87。4.5 的 Max 档只有 735、$0.24。

不过 Haiku 5.5 换了 tokenizer(和 Sonnet 5.5、Opus 5.5 同款),同样任务会多耗费 token,所以实际省的钱比标价折扣少亿点点。
特别是代码、表格、非英语内容的膨胀可能更高。
在 AA 测评中,Haiku 5.5 虽然 API 价格便宜了,但 " 完成任务的平均成本 " 并没有到达理想区间。

替不了 Sonnet
很多人对 Haiku5.5 的期待是能在部分任务替代 Sonnet 5.5,进一步压低成本。
但这次并没有出现奇迹,小杯还是小杯。
Terminal-Bench 4.0 上 Haiku 5.5 拿 39.2%,Sonnet 5.5 拿 70.6%。复杂多步编码、跨文件重构、长周期自主规划方面差距非常清楚。
Anthropic 自己也建议了,复杂 agent 编码优先用 Sonnet 5.5 或 Opus 5.5。
Haiku 5.5 的价值在执行层。任务已经拆好、验收标准明确、可以并行跑的任务。
比如 Cognition 的 Devin 用 Opus 5.5 做主模型、Haiku 5.5 做子智能体,FrontierCode 组合跑到了 66.2%,比两个模型各自单跑都高。

如果你以前的业务用 Haiku 4.5,这次不是换个模型名就能上线的。
budget_tokens 手动思考配置直接报错,必须改成自适应思考加 effort 参数。
temperature、top_p、top_k 全部锁定默认值,依赖采样参数做创意控制或多样化生成的应用要改逻辑。
assistant 消息预填充被取消了,以前靠预填充强制 JSON 开头的写法得换工具调用或结构化输出接口。
计算机操作工具版本也更新了,从 computer_20250124 换成 computer_toolset_20260801,接口格式和返回结构可能都不同。
另外自适应思考默认开启,响应第一个内容块可能是思考块而不是正文,解析逻辑要按 type 字段过滤。
五处变动,每一处都可能让请求直接报错或返回非预期结构。
Anthropic 提供了迁移指南,建议切之前对着过一遍。
顺带两条福利
Sonnet 5.5 的缓存读取从 $0.20/M 降到 $0.10/M,Anthropic 称大多数 agent 任务因此成本降约 20%。

Max 和 Team 订阅用户本周起可以领取 API 额度,Max 5x 每月 $100,Max 20x 每月 $200,Team 最多 $500/ 月在团队内共享。
这些额度可以用来实验调 API 建工具、应用、agent,所有模型通用。
神马?你说 A 社把我的买 Coding Plan 钱还给我,让我还可以在 API 上再用一次?

那么 OpenAI 在干嘛呢?OpenAI 又送了一张重置卡。

参考链接:
[ 1 ] https://www.anthropic.com/claude-haiku-5-5
[ 2 ] https://x.com/AI_Screening/status/2107906044915749274?s=20
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


