【CNMO 科技消息】人工智能是否会在这个十年结束前毁灭人类,这个问题近来被推上风口浪尖。普林斯顿大学的两位知名计算机科学家、畅销书《AI Snake Oil》的作者 Sayash Kapoor 和 Arvind Narayanan 就此发表了看法。两人长期以厘清 AI 领域的真伪著称,此次是在 Anthropic 承认未来十年内 AI 杀死全人类的概率超过 10% 之后作出回应。

AI 示意图
事情的起因是曾在 OpenAI 和 Anthropic 任职的 AI 研究员 Jacob Coxon 辞职,并称这两家公司都心知肚明,AI 系统有可能在这个十年结束前杀死全人类。他的帖子获得了超过 1.56 亿次浏览。他写道,构建 AI 的人真心相信它可能在本十年末毁灭人类,这不是营销噱头;许多高管和资深研究员在媒体上会措辞谨慎,显得理性,但私下里他们同样表达过恐惧,没有任何其他人类活动会带来这种级别的危险。
外界本以为两家公司会把他当作怪人一笑了之,实际情况恰恰相反。Anthropic 的一位 AI 安全负责人 Evan Hubinger 表示,Coxon 说得对,只是时间跨度稍长一些。他认为,Coxon 这一点是对的,他们确实真心相信 AI 可能杀死全人类,他个人认为未来十年内概率超过 10%;他相信 Anthropic 在尽力而为,但迄今并没有解决超级智能对齐问题的方案,也没有明确走在解决的道路上。至于 AI 究竟会以何种方式毁灭人类,目前并没有太多具体说法,讨论主要集中在它对水电等公用基础设施以及现代文明所依赖的其他关键系统发动破坏性网络攻击的能力上。
争议的一大焦点在于,能否通过对齐工作来消除风险。对齐一词指的是确保 AI 系统的目标与人类目标保持一致。有人认为,这最终能通过让 AI 系统想要与我们相同的东西来消除风险。另一些人则不同意,认为 AI 系统可能在通过安全检查时装作已经对齐,暗中却怀有自己矛盾的目标。
Kapoor 和 Narayanan 并未直接回应那个超过 10% 的毁灭风险说法,而是撰写了一篇长文,主张可以通过一种分层的方式来应对 AI 风险。他们把 AI 安全界的悲观看法,与网络安全界部分人认为这不过是常态的轻描淡写态度做了对比,认为需要一种更为持衡的中间立场。他们特别指出,对齐本身并不足够,还需要另外三层作为补充。
这三层分别是控制,例如沙箱隔离、人类监督和实时监控;下游防御,例如各类机构利用 AI 来抵御 AI 攻击;以及韧性,例如针对攻击得手后的恢复预案。两人在文章结尾给出了较为乐观的判断:如果以适当的紧迫感采取行动,就能让 AI 公司承担更高的标准,降低失控带来的风险,甚至把网络安全中攻守双方的平衡重新扳回到防御者一方。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦