雷锋网 昨天
工作流可以自我进化了,英伟达开源 SoL-Pi,每小时省13.5刀!
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

Token 砍半,活没少干,每小时还省 13.5 刀!

    作者丨高允毅

    编辑丨岑   峰

                                                                                                       

最适合鞭打 AI 干活,还得是 AI 啊。 

英伟达今早开源了一套提高工作效率的 Harness ——SoL-Pi,它让 AI 亲自当监工,去 Agent 工作流中吹毛求疵,把每一处可能 " 摸鱼、浪费 Token" 的环节进行修复,自我迭代优化。

效率提升后,Token 消耗最高减少了 64%,API 调用成本下降 50% – 54%,在实际开发中每小时能帮企业省下 8.75 到 13.5 美元。

它之所以能有这么好的效果,是因为英伟达让 AI 提出了 152 个优化工作流的想法,通过严苛的自动化流水线层层淘汰,最终只有 4 个机制活了下来。这 4 个机制就成为了 SoL-Pi 的核心。

因为它是基于开源项目 Pi 改造的,所以名字里也带上了这个关键词。

现在大家都在想办法降本增效,英伟达的这次创新,实实在在为企业省了不少钱。

01

AI 怎么发现 AI 偷懒的?

AI 是怎么找到 AI 偷懒的?这件事要从两个层面讲,一个是眼前的浪费,一个是长远的困境。

在真实业务中,现在 AI 的工作早已进化成成千上百个 Agent 协作,干个几天几夜,都不需要人插手了。不过,这也意味着,如此长的周期,上下文堆积的历史记录会越来越臃肿,调用的工具也越来越多。

每次调用模型,都要把这些历史内容重新读一遍,必然藏着巨大的冗余。而且 AI 缺乏人类的变通能力,有时候很多可以连续完成的操作,它可能就会死板的拆成两次决策。这些零散的浪费积累起来,烧掉的都是真金白银。

目前行业都在聊 RSI,即 AI 自己优化自己,但每一次尝试都是要消耗 Token 的,而且 90% 以上的尝试最终都会失败。这种盲目试错的成本太高了,企业可能还没等到 AI 进化成功,资金链就先断裂了。

那英伟达的思路是,效率我要提升,但钱我也要省。他们没有让 AI 盲目地在线去改代码,先让 AI 批量提出 152 个优化工作流程的想法,然后放进一个严苛的自动化沙盒里进行筛选。这个自动筛选的过程,被称为 " 自动研究循环 "。

英伟达还探索了3 种 AI 管理 AI的方式。

一个是计划经济模式,即你是老板,我照做。由人或者主模型定死每一个步骤,但很快因为死板的规则被放弃。

第二是中心化管理模式,即有一个超级主管 AI,在运行时现场写代码、开会、给底下的 Agent 派发任务、实时调整流程。这种模式非常灵活,但会累死主管,主模型核心代码库变得无比庞大臃肿。

第三个是共享快闪模式,整个系统只维护一个最简化的 " 工作模板 " 和说明书。每个 AI 实验启动时,直接复制一份这个模板,在里面随心所欲地改代码、跑实验。一旦这个实验结束,这套临时改出来的指挥代码就被直接丢弃。

第三个方案被采用,跑完了 152 个实验。最终,只有 4 个最有效的机制活了下来,成为了 SoL-Pi 的核心骨架。

▎机制 1:动作融合

之前 AI 改完一行代码,要先停下来思考一次 " 接下来我要不要跑个测试验证一下?",做出决定后,再发指令调用终端跑测试,这中间多了一次 AI 推理。

系统识别后,直接把 " 改代码 + 跑测试 " 这种固定的连续动作,两步并做一步,省掉那次多余的决策开销。

▎机制 2:在线上下文压缩

Transformer 的机制,决定了 AI 的记忆,是线性累加的,每做完一个任务,都要把前面的积累 " 上下文 " 都看一遍,这样成本会越拉越高。

优化后,系统会把大任务拆分成一个个独立的小任务,每做完一个小任务,就把这段历史压缩整理成精简版,只保留关键结论。平常只开 " 摘要 ",需要核对细节了,再把原始记录调取出来。

▎机制 3:观察包

每次工具输出的结果,也会完整地塞进上下文里,比如跑测试生成的几百行日志。后面每次讨论到这个结果,都要带着这一大段内容,非常占用空间。

优化后,系统会把完整的输出结果存在本地,上下文里只留一个简短的 " 摘要 + 索引 ",AI 如果想看具体详情,再专门调取对应段落即可。

▎机制 4:证据保存型简化器

在分析错误日志、排查问题时,都需要主模型从头读到尾,这有点 " 杀鸡焉用牛刀 "。

优化后,系统会用成本更低的小模型把日志提炼成 " 诊断报告 ",而这份报告的每一个结论,都能对应回原文的具体位置。主模型只看这份精简报告,如果有疑问,再去核对原始原文。

02

  比 Pi 更省钱的 Harness,

将大模型性价比推向极限

为了验证这 4 个机制效果如何,英伟达搭出535 个可验证环境

其中,495 个任务是英伟达团队去 GitHub 上翻找了 真实的开源项目 bug,它们把代码仓库 " 一键还原 " 到当年程序员还没修这个 Bug 时的历史状态,并在离线环境里装好依赖。同时,把当年人类程序员是怎么修好这个 Bug 的 " 正确答案 " 藏起来不让 AI 看到。

另外 40 个任务是 " 盲盒通关题 ",英伟达先用代码写好一个 " 验证器,然后把 AI 丢进一个开放式的沙盒里,没有剧本,全靠 AI 自由探索去触发这个通关条件。

然后让 4 种 Harness 同台竞赛,分别是用原生框架驱动的  GPT-5.6 Sol、Claude Opus 5、开源智能体底座 Pi 以及英伟达自己的 SoL-Pi 。

结果,SoL-Pi 在保住基本盘情况下,展现出了惊人的省钱效率。

对比 Pi, SoL-Pi 消耗的 Token 减少了 45% – 49%,开发成本直接砍掉约三分之一。

对比模型原生的官方代理框架,SoL-Pi 的 Token 消耗最高骤降 64%, API 价格最多降了 54%  

经过这场实验后,英伟达得出了自己的结论:效率本身也是一种 RSI

与其一味追求让 AI 更聪明,不如先让 AI 干活更有效率。这样省下来的预算可以用来跑更多实验,尝试更多想法,最终反过来加速 AI 能力的泛化和进步。论文里把这个叫"Efficiency for efficiency"——效率既是结果,也是下一轮研究的资源。

而真正的效率并不是刷题来的,这四个机制,本质上都是挖出了 AI 工作流中普遍存在的 " 通病 "。哪怕你换了模型、换了任务,这些通病依然存在。

而这四个想法之所以能诞生,全靠广撒网、多尝试,如果只盯着一个方向深挖,很容易钻进死胡同。在这个阶段," 广度比深度更重要 "

以后这种 "AI 改进 AI 工具 " 的事情会越来越多,哪怕你不用 SoL-Pi 这个工具,这四个优化思维也可以直接套用到你自己的 AI 工作流里了。

参考链接:https://nvlabs.github.io/SoL-Pi/

上车,雷峰网 ( 公众号:雷峰网 ) 带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

英伟达 ai 开源 自动化 效果
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论