钛媒体 22小时前
当AI开始制造AI
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

文 | 15Bit

刘慈欣在《乡村教师》里写过一段对话。

外星文明发现,人类没有记忆遗传,每一代都需要重新学习,却依然发展出了能够进入太空的文明。它们难以理解,这个物种怎样积累知识。

「他们没有记忆遗传,所有记忆都是后天取得的。」

答案落在一种负责跨代传递知识的人身上。

「他们叫教师。」

这个故事写出了人类进步的一项成本。前人的知识能够留下,后来的人还得花时间读懂。论文可以复制,培养一个能够继续研究的人,要经过很多年。

如果这个过程能够被大幅缩短呢?如果参与研究的智能,可以帮助制造下一代更强的智能呢?

今年 9 月 29 日,特朗普签署行政命令,要求美国行政部门在法律允许的范围内,将官方通信和非法律文件中的 AI 改称 SI,也就是超级智能。

对照文件的定义可以看到,SI 暂时仍覆盖现有法律所定义的 AI。改名已经发生,超级智能是否到来,需要另外的技术证据。

相比名字的变化,我更在意 AI 公司正在尝试的另一件事。

让今天的 AI,参与制造明天的 AI。

无限自进化

过去,模型开发主要由人来推动。研究者提出方法,工程师把它写成程序,再训练、测试,根据结果决定下一次怎么改。

如今,AI 开始接手其中的一部分工作。

Google 的 AlphaEvolve 用 Gemini 提出候选程序,运行并评价结果,再沿着表现较好的方案继续修改。Google 披露,它找到的一项优化让 Gemini 中的关键计算核加速 23%,对应整个训练时间缩短约 1%。支撑这套系统的模型,已经用到了它帮助发现的改进。

这就出现了一种值得关注的反馈关系。模型参与改善训练,改善后的训练条件,又可能帮助开发后续模型。

沿着这条关系继续走,就是 RSI,递归自我改进。

理解它,可以先抓住一个问题。一次改进得到的能力,能不能让下一次改进更容易发生?如果每一轮都能提高研究效率,模型的进步速度也可能跟着变化。

这也是 RSI 让人不安的地方。

我们习惯了一代代人接着研究。新人学习已有知识,再尝试补上一点。AI 若能承担更多研发工作,知识转化为下一项发现的过程,就可能少等一些人的成长。

但这里有一个很容易混淆的区别。

ASI,也就是人工超级智能,描述的是一种能力目标,通常指在广泛的重要领域超过人类的智能。RSI 描述的是改进过程。一个系统可以在有限任务上自我改进,却远没有达到超级智能;超级智能也未必只能通过 RSI 实现。

把两者连起来,能够得到一种令人兴奋、也令人恐惧的设想。足够强的 AI 参与研发,研发得到更强的 AI,再继续提高研发能力。

它能持续多久?会不会越来越快?

现在还没有答案。Anthropic 在讨论这条路线时,也明确承认,完整 RSI 尚未实现,而且并非必然实现。

AlphaEvolve 的 1% 改善,已经有具体的工程用途。至于无限自进化,仍然是需要验证的远景。反复修改同一段程序,也可能很快用尽容易改善的地方。

公司要继续往前走,还得解决比生成代码更难的问题。

新命题

但 " 自我改进 " 这四个字里,有一个问题很容易被忽略。

凭什么判断,它改得更好了?

我们平时问 AI,已经见过这种情况。同一个问题,换一种问法,答案可能就变了。它可以把一件事解释得很流畅,也可能把错误解释得很流畅。回答更像那么回事,和回答更接近事实,之间还有距离。

到了 RSI,这个问题会进入研发过程。我们期待 AI 不断改进自己,却不能把 " 发生了改进 " 直接理解成 " 结果一定是好的 "。

这里可以分开看两件事。

一种是改进自身的能力。例如,同样的任务做得更快,原来解不出的题现在能解了。人先定好要求,再检查它有没有达到。

另一种,是改进自己寻找改进的方法。它开始调整实验怎么做、方案怎么选,让下一次研发更有效率。人类交给它的工作,由完成一道题,逐渐扩大到研究怎样才能更好地解题。

方法可以变,判断方法好坏的依据却需要说清楚。一套方案省下了时间,但增加了错误,我们愿不愿意接受?它给出了更漂亮的结果,可别人无法重复验证,这算不算进步?

Klarna 的一次实验就遇到了这个问题。据其工程团队介绍,他们用 AI 寻找更快的训练代码,有些候选方案确实跑得很快,却无法保证相同条件下得到可复现的结果。工程师后来把这项要求加入筛选条件,不能只看速度决定采用哪个方案。

这个例子并不意味着 AI 已经失控。它说明了一件很具体的事,系统可以找到符合某项指标的好办法,但那项指标未必涵盖了我们对 " 好 " 的全部要求。漏掉的要求,仍然需要有人补上。

如果未来连评估方法也交给 AI 改进,问题还会继续往前走。它提出了一套新的测试,认为比旧测试更有效,谁来确认这套测试没有放过原来能发现的问题?如果仍然只让同一个系统证明自己正确,我们就需要警惕这种证明究竟有多可靠。

因此,我认为,自进化可以探索新的方法,但安全边界不能仅凭系统自己的评价就被取消。允许它寻找更快的办法,不等于允许它自行放宽原来的限制。即便评估工具由 AI 协助开发,也需要独立检查和实际验证。

这也关系到企业怎样讲述自己的进步。研发速度、模型分数都容易拿出来展示,可靠性和安全性则往往需要更长时间才能确认。开发者既从技术进步中获益,又参与制定评价标准,它们的判断值得听,但不能成为唯一的判断。

我们需要关注的,因而不只是 AI 能不能自己研究 AI。还要看哪些要求始终有效,谁有权修改这些要求,以及出了问题以后,谁能叫停。

这些事情尚未解决,企业之间的竞争却已经要求它们尽快拿出下一代模型。

赛博狂飙

RSI 还没有完整实现,为什么公司已经开始下注?

因为它可能改变一家公司开发下一代 AI 的速度。

过去,模型更强,主要可以用来吸引更多用户。现在,更强的模型还能帮助自己的研究团队写程序、做实验。倘若这些工作持续有效,公司就可能更早做出下一代模型,再用它继续参与研发。

今天的成果,有机会影响明天取得成果的速度。

这让等待变得难了。

一家公司可以选择晚一点投入,等技术成熟再跟进。但如果竞争者先找到了有效的方法,它等待的这段时间,可能让对方积累起更好的研发条件。等到路线得到证明,再追赶就未必只差一次模型发布。

当然,提前投入也可能失败。实验需要花钱,做得更多,也不保证发现更多。企业面对的是两种都无法提前算清的代价,投入可能没有回报,等待可能错过机会。

Anthropic 公开讨论过类似的困境。它认为,放慢研发能够给社会更多准备时间;但如果只有部分公司放慢,其他竞争者继续推进,结果可能只是换了一家领先的公司。

担心风险,与继续研发,可以同时发生。

一家公司的决定,只能约束自己。它停下来,无法保证竞争者也停下来。即使大家都知道这条路线还有很多问题,谁先等待、等待多久,仍然很难达成一致。

我理解这些公司为什么继续投入。谁也不愿意在下一次技术变化中被甩开。

但我对这种竞争有一个担忧。当企业越来越在意别人走得多快,它判断一项技术值不值得推进的标准,也可能发生变化。技术能够解决什么问题,需要承担什么代价,逐渐让位于一个更急迫的问题,竞争者是不是已经开始了?

竞争可以推动研究,也可能让企业在路线尚未得到充分验证时,就不断追加投入。

RSI 尤其容易放大这种压力。它承诺的收益,包含了更快取得下一次进步的可能。错过一次,企业担心的便不只是少卖一款产品,还有此后的研发差距。

这种担心可以解释企业的选择,却不足以证明加速一定值得。

我愿意看到 AI 参与制造下一代 AI。许多难题值得研究,也有许多人等不起漫长的研究过程。如果自我改进能够让新的发现更早出现,让更多人用得上这些成果,我们有充分的理由期待它。

《乡村教师》里的教师,把已有的知识交给下一代,让后来的人有机会继续向前。到了 AI 参与研发的今天,我们有望缩短这段积累的时间。但怎样使用新的能力,什么风险可以接受,仍然需要人来判断。

我们希望制造出更强的智能,也应该对它提出更高的要求。下一代 AI 到来的时候,人应当拥有更多选择,更有能力决定自己的生活。这样的进步,值得我们加快脚步。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai google 美国 刘慈欣 特朗普
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论