量子位 1小时前
缓存命中率99.93%!DeepSeek最适合的Harness来了,GitHub狂揽8.6万Star
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

好啊好啊。

DeepSeek 官方版还在路上,民间「最佳 Harness」已经先杀出来了!(卷死算了 .jpg)

项目名叫「Pi」,一款在 GitHub 狂揽揽揽揽揽约 8.6 万 Star 的开源编程 Agent。

项目之所以 so 火爆,主要还是因为这玩意儿太《省》了。。。

瞧下面这位开发者老哥 Evan Kim,人家把 DeepSeek 接入 Pi 后,约 99.93% 的输入 Token 都成功命中缓存。

换句话说,缓存不命中率只有 0.07%,绝大部分重复上下文无需重新计算???

甚至吧,Composio 团队最近还横向测试了 8 款主流 Agent Harness,直接把 DeepSeek V4 Flash 塞进去跑真实任务。

结果出来之后,多少也有点抓马——

Pi 完成一次成功任务的平均成本最低,只需要约 0.028 美元。

Claude Code:咋直接把我干到 Pi 的 7 倍价格啦!!!

DeepSeek:我的 Token 已经卖这么便宜了。

Pi 等一众省钱项目:没事,我还能让用户少买点哈。

四个工具配 DeepSeek,缓存不命中率低至 0.07%

说 Pi 之前,我们再来小唠一下 Harness 到底是个啥。

我们都知道,大模型本身更像一颗负责思考的大脑——

想让它真正进入代码仓库干活,还得给它配上眼睛、手脚和工作流程。

就比如谁来读取文件、怎样调用终端、修改代码后如何运行测试,这些围绕模型运转的工程系统,统称为 Harness。

也正因如此,同一个模型换一套 Harness,实际表现和调用成本都可能出现巨大差距!!

而开发者 Mario Zechner 创建的这个「Pi」,干的就是给大模型搭建这样一套编程工作台。

我翻了一遍项目,浅浅总结下来就是,Pi 的思路相当《直给》——

那就是这玩意儿,其实从一开始,就没打算把「所有功能」全塞进核心里。。。

具体来说,在默认情况下 Pi 只给模型四件工具——读文件、写文件、改文件和执行命令。

如果用户需要计划模式、子 Agent、MCP、Git 检查点或权限控制,那可以再通过扩展和 Skills 逐件装上去~

emm …大概就像先交付一间水电齐全的毛坯房,Pi 负责把四面墙盖好,最后装修成工作室、电竞房还是三室一厅,全看用户自己折腾??

好巧不巧呢,这恰好撞上了 DeepSeek 的需求。。。

众所周知,DeepSeek 的推理与编程能力蛮强,但工具调用、上下文管理和思考内容回放却有自己的接口规则。

这就导致我们直接塞进围绕 OpenAI 或 Claude 设计的通用 Harness,容易遇到工具格式不兼容、推理内容回放报错和缓存失效等问题。

这不嘛 DeepSeek 官方产品还在路上,Pi 先动手适配了——

在今年 4 月的时候,Pi 加入 DeepSeek 原生 Provider 支持,同时修复了 V4 会话回放中的 400 报错。

它会按照 DeepSeek 接口要求保留 reasoning_content,并将 Pi 内部的推理强度映射到 DeepSeek 支持的思考级别。

真 · 民间专属定制了也是。

但!真正让 Pi 与 DeepSeek 一拍即合的,还是「缓存」。

毕竟 Coding Agent 每执行一步,都要把系统提示词、工具定义、历史对话和代码重新发给模型,这就导致——

模型任务越做越久,请求也会越滚越长,其中大部分内容,DeepSeek 其实早就看过了。。。

这时候,自动前缀缓存就能派上用场了。

它能暂时记住已经计算过的请求开头,下一轮调用时,只要系统提示词、工具定义和历史对话仍然保持一致,这一大段内容就能直接复用,模型只需处理末尾新增的信息。

而「缓存命中率」,衡量的正是这次输入中,有多少 Token 成功复用了此前的计算结果。

命中率越高,重新计算的 Token 越少,调用成本自然也越低。

但麻烦也藏在这里,提示词多一个时间、工具换个顺序,缓存都可能当场失忆,再从头计算。

但 Pi 人家的优势就是《足够简单》:默认工具少,会话内容持续向后追加,很少回头折腾前面的内容。

这样一来,DeepSeek 翻开日志后,前面看过的几百页可以直接跳过,只处理最后新添的几页,缓存不命中率直接大大降低~

这不嘛,网友 Evan Kim 现身说法验证了——

DeepSeek 接入 Pi 后的缓存不命中率低至 0.03%,对应约 99.97% 的缓存命中率。

换算一下就是 10 亿和 token 处理费用成本仅为 19 块钱左右,如果不使用缓存的话,那成本得 900 多块钱。。

此外,Composio 团队最近还横向测试了 8 款主流 Agent Harness,直接把 DeepSeek V4 Flash 塞进去跑真实任务。

结果出来之后,多少有点戏剧性,同一个 DeepSeek,换一套 Harness,成本差距最高能拉到 7 倍???

打眼一看,确实 Pi Agent 完成一次成功任务的「平均成本」最低,只需要差不多 0.028 美元。

排在后面的分别是 Deep Agents、Hermes Agent、OpenCode、Codex、Oh My Pi 和 Prime Agent。

咱再来看看 A 社大宝贝 Claude Code,当之无愧「最贵选手」——

完成一次成功任务平均需要约 0.195 美元,是的,接近 Pi 的 7 倍。。。(天塌啦)

当然啦,这个数字并不代表 Claude Code 能力不行,毕竟它本身就是围绕 Claude 模型打造的完整工程体系。

只能说当底层模型换成 DeepSeek 后,原本针对 Claude 生态优化的工作流,并没有完全吃到 DeepSeek 低成本、高缓存效率的红利。

模型还是那个 DeepSeek,Pi 只是让它少读了很多遍已经读过的内容。

Pi:静等官方 Harness 超越俺哈。

官方 Harness 已经组队,目标直指 Claude Code

当然了,Pi 再适合 DeepSeek,眼下仍是一套第三方方案。

毕竟 DeepSeek 自己,也已经决定亲自下场造 Harness 了,甚至八成离上线的日子也不远了?(我猜)

今年 5 月的时候,DeepSeek 资深研究员陈德里确认,公司内部正在组建 Agent Harness 团队,用一句相当直白的话概括其目标——

从零开始做 DeepSeek Code Harness,对标 Claude Code。

然后中间这几个月,关于 Harness 产品经理和研发工程师的岗位也铺天盖地地在官网上狂更狂上,be like:

然后就是 7 月底,DeepSeek Agent Harness 团队负责人、ACM 金牌大神崔添翼在网上还是招募相关项目的开发者。

也算是快水到渠成了。

把几条线索放在一起,DeepSeek 的路径已经逐渐清楚了。

V4 负责补强底层推理、编程和 Agent 能力;官方 Harness 负责把模型接入终端、代码仓库与工具链;上下文管理和测试反馈又能把真实用户的失败案例送回模型团队。

当然了,说实话,等官方产品上线后,Pi 也不会因此失去位置。

DeepSeek Harness 主打开箱即用,以及与自家模型更深的协同。

Pi 则把工作台留给用户自行改造,更适合喜欢控制工具、定制工作流和随时更换模型的开发者。

毕竟 Pi 从一开始就没把自己绑死在 DeepSeek 身上。。。

Claude、OpenAI、Gemini、Kimi、MiniMax 这些都支持,今天用 DeepSeek 省 Token,明天换其他模型处理特殊任务,用户随时可以切换 Provider。

emm …这也意味着,DeepSeek 官方 Harness 真正要面对的除了一众 Claude Code 式产品,还有 Pi 这类已经被开发者改造得相当顺手的开放工作台。(doge)

所以现在,压力正式给到官方版——

自己给 DeepSeek 做的 Harness,总不能还没有第三方懂得怎么省 Token 吧???(doge)

参考链接:

[ 1 ] https://x.com/composio/status/2086814488162972027?s=20

[ 2 ] https://github.com/earendil-works/pi

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

命中率 编程 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论