钛媒体APP 4小时前
DeepSeek Harness来了:AI开始制造AI了?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

(本文作者为 深流研究所,钛媒体经授权发布)

文 | 深流研究所,作者 | 之丰

" 第一台超智能机器,将是人类最后一项发明。"

这句话出自数学家 I.J. 古德在 1965 年发表的论文《关于第一台超智能机器的猜想》。言外之意,机器一旦比人聪明,就能自己设计更聪明的下一代。

这个循环的第一步是让机器开始动手改进自己。这也是 AI 圈内最近备受关注的 RSI(Recursive Self-Improvement, 递归式自我改进)的含义。

简单来说,RSI 就是让 AI 自己参与造更强的 AI,再让更强的 AI 加速下一轮 AI 的改进,循环往复。

在 Codex、Claude Code、Kimi、Hy 都有了自己的 Harness 之后,上周 DeepSeek 终于推出了 DeepSeek Harness ( DSH ) 。

尽管 DSH 姗姗来迟,而且还只是一个开发者预览版,但依然引起了巨大关注。这是因为,梁文锋对 RSI 路径的规划,开始清晰地显现出来了。

在 7 月底内部的四小时发言中,梁文锋将 AI 的发展比喻成一个个阶梯:LLM — CoT — Agent —持续学习—自我迭代—具身智能。在他看来,AI 的自我迭代,将会带领大家走到一个奇点。

当然,DSH 还是 DeepSeek 在探索 RSI 路上的一次落点,还远远到不了奇点。发布几天后,也被一些用户吐槽部署繁琐、配置复杂,体验上感觉像是 " 半成品 "。但这作为一次对 AI 业内对 RSI 探索的呼应,还是让 AI 圈内兴奋。

那么,DeepSeek 给实现 RSI 提供了怎样的解法?当各家都在追求 RSI 时,业内竞争的方向又发生了怎样的转变?

一、DeepSeek 怎么让 AI 自进化?

在内部发言中,梁文锋讲了一句挺奇怪的话。他说,DeepSeek 做的模型," 第一目标不是大家用得好用,而是我们自己用得好用 "。

模型做出来,不就是给用户用的吗?梁文锋进一步解释,模型先服务于 DeepSeek,这是 DeepSeek 实现 AGI 最快的办法。

RSI 不等于 AGI,也不是说有了 RSI 就一定能实现 AGI。但 RSI 解决了追求 AGI 路上的一个关键问题:谁来加速 AI 能力本身的进化?

所以,AGI 是目标,RSI 是手段。让 AI 帮助自己不断变强,最终把 AI 的能力推向 AGI。

具体来讲,RSI 是怎么帮助 DeepSeek 走向 AGI 的?

在发布 DSH 的同时,DeepSeek 和北京大学联合发表了论文《a programming paradigm for spatiotemporal composability》,透露了更多关于这套架构的思路。

DSH 的底层运行框架里,有一个叫 Cordis 的核心机制。它试图解决的是行业的一个老难题:传统插件系统普遍擅长将插件装上去,却很难在不重启整个进程的情况下,把一个插件留下的影响完整撤掉。

这个问题放在一个要求能自进化的 AI Agent 身上,就是致命的。

一个 Agent 的运行环境里通常塞满了工具、权限、沙箱、记忆、会话状态等等组件。想象一下,如果未来 Agent 为了提升自己的能力,需要持续修改这些插件,那么每次修改都要求整个系统重启,原本持续运行的状态就会被打断。更麻烦的是,一次失败的修改还可能把系统带进一个无法恢复的中间状态。

那么,创造一个让 AI 敢于自我进化的环境就至关重要。Cordis 尝试从时间和空间两个维度去解决,一是让插件退出时,它此前产生的影响能够被追踪和撤销;二是插件之间的依赖发生变化时,系统能够自动重新协调。这就是论文题目里提到的 temporal composability(时间可组合性)和 spatial composability(空间可组合性)。

这不是纸上谈兵。这套机制已经在一个叫做 Koishi 的开源聊天机器人框架里跑了 4 年,后者拥有四千多个社区插件。当然,这套机制未来还需要在更大规模的插件系统里验证。

现在回头看梁文锋那句话,就不怪了。他说模型先得自己用得好用,落到工程上,就是得先给模型一块允许它不断修改自己的底座:新的组件装得上,旧的卸得干净,改坏了能恢复,组件之间的关系还能自动重新组织。

当这种自我修改变成一种可以持续、可以失败、也可以回退的工程过程,AI 自我进化才算真正有了能落脚的土壤。

二、大厂 AI in RSI

作为 AI 届最诱人的里程碑之一,RSI 吸引的人可不止梁文锋。

7 月份,谷歌 DeepMind 的掌门人哈萨比斯在接受专访时表示,大多数前沿实验室都在致力于研究 RSI。一个月后,谷歌 DeepMind 的首席战略官 Jasjeet Sekhon 也公开表示,RSI 正成为 AI 资本开支的核心投资逻辑。

" 当年人类正是依靠蒸汽机来制造新一代蒸汽机。"Jasjeet Sekhon 认为,用 AI 来造 AI,听起来并没有那么不可思议。

图:哈萨比斯接受专访

DeepMind 已经有一个接近 RSI 的实际案例,叫做 AlphaEvolve,目前已经运行一年多。

AlphaEvolve 的核心机制并不复杂。它先让 Gemini 生成一批程序,再交给自动评估器运行、验证和打分。表现好的方案会被保留下来,继续成为下一轮生成和组合的基础。这个过程可以持续循环,不需要工程师插手。

这套方法最关键的地方,在于评价环节也被自动化了。只要一个问题能够建立相对客观的评价标准,AI 就可以自己进行大量试错:生成一个方案,运行它,看看分数,再根据结果继续寻找更好的方案。

Google 已经开始用 AlphaEvolve 优化自己的计算基础设施。Google 称,AlphaEvolve 为数据中心调度找到了一种新的算法,平均回收全球约 0.7% 的计算资源;在 Gemini 的训练过程中,它又将一个关键的矩阵乘法内核加速了 23%,使 Gemini 的整体训练时间缩短约 1%。

今年 8 月,谷歌 AI 团队经历了一次引人瞩目的动荡。尽管劳燕分飞,大家的目标依然一致:接下来要追求 RSI。

在 Google 干了 27 年的 Jeff Dean 离职,带走几个研究员创办了 Discovery Loop,核心方向就是 RSI。谷歌的联合创始人 Sergey Brin 同样还在内部大力推动资源流向 RSI。

两家明星 AI 公司 OpenAI 和 Anthropic 也是押注了 RSI。7 月,OpenAI 在 GPT-5.6 的发布说明里有一个新指标叫做 RSI-Index,就是专门衡量模型的自进化程度。

Anthropic 今年成立的 Anthropic Institute,也将 RSI 列为重点研究方向之一。在一个叫 Automated Weak-to-Strong Researcher 的实验中,Anthropic 已让 Claude 驱动的多个 AI agent 自主提出研究假设、设计并运行实验、分析结果,再根据结果迭代下一轮方案,在一个 AI 对齐问题上取得了优于人工研究者的结果。

Anthropic 联合创始人 Jack Clark 更是给出预测,称 RSI 有 60% 的概率在 2028 年底之前发生。

在国内,有玩家比 DeepSeek 更早在做接近 RSI 的探索。比如,腾讯在 7 月推出了 Hyra-1.0,官方称这是一个能够递归自我改进、专为性能导向的研究与工程任务打造的智能体。除了公开基准,它还能在十余个不同的真实场景中产生价值。

图:腾讯混元发布 Hyra-1.0

MiniMax 还要早,在 3 月发布 M2.7 时,官方标题就是 "Early Echoes of Self-Evolution(自我进化的早期回响)"。它让早期模型自己搭了一套 harness,分析失败轨迹、规划改动、修改脚手架代码、跑评测、决定保留还是回退。这套循环跑了一百多轮后,把内部评测的成绩抬高了 3 成。

三、环境、反馈和循环成了兵家必争

当 RSI 成为通往 AGI 的一种重要设想,它开始改变 AI 公司的竞争方向。

过去,行业习惯把模型发布当作能力变化的时间节点。一家公司的新模型上线,跑一轮榜单,行业重新排队。现在,新模型发布依然重要,但模型之间的领先周期正在缩短,单次发布越来越难以代表一家公司的长期能力。与此同时,实现 RSI 的路径,也发生在模型发布之后。

RSI 的基本设想是让 AI 进入一个能持续改进的循环中。这对 AI 基础设施提出了新的要求。

首先,模型不能只接触已经整理好的训练数据,还需要进入真实任务,拥有可以行动、修改和验证的环境,在实际工作中不断暴露问题。

其次,系统还需要可靠的反馈机制,能够判断一次修改究竟解决了问题,还是只让某个指标暂时变好,并把这些结果转化为下一步行动的依据。

最后,这个过程必须能够持续循环,形成一个 Loop。这样,上一轮的结果能够进入下一轮,新的方案可以反复运行、比较和迭代,失败也不会让整个实验失去恢复和重来的能力。

归结起来,就是环境、反馈和循环。这也是前面讲的 DeepSeek、Google 等公司在尝试创建的条件。

这也解释了为什么马斯克近期花 600 亿美元买下 Cursor 后,Grok 大有逆袭之势。

Cursor 是一个代码编辑器。SEC 文件给出的收购理由是,软件开发同时具备高质量的结构化数据、快速的反馈周期和高频使用。AI 编程留下的工作轨迹,能反过来改善模型的训练和性能。

简单来说,当用户用 AI 写代码,Cursor 会记录它在哪一步卡住,要怎样补救等等。工程师再把这些行为轨迹和反馈结果加工成训练模型的数据。

所以,马斯克真正想买的是 AI 进入真实工作环境后的反馈和循环。而这些反馈和循环,也将是接下来 AI 公司的竞争重点。也许会有更多公司开始复制马斯克的做法,通过收购拿到这些资源。与此同时,原本掌握高价值业务场景、产品入口和用户规模的公司,也会显示出更大的优势。

当然,RSI 目前还只是远方的一个目标,业内还有质疑之声。华盛顿大学教授 Pedro Domingos 认为,从 LISP 在 1950 年代出现开始,AI 就已经具备某种构建自身的能力。这种自我改进究竟会带来递增回报还是递减回报,目前在他看来并没有足够证据证明前者。

此外,还有一个更深远的问题。60 年前,当 I.J. 古德把超智能机器叫人类最后一项发明,他给出的一个前提是:机器得一直肯听人的话,人可以随时关掉它。

那么,如果 AI 真的能够通过 RSI 不断加速,实现能力指数级增长后,人类还攥不攥得住那个开关?

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体 App

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 北京大学 kimi 研究所
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论