雷锋网 昨天
黄仁勋倡议的开源联名信,Anthropic 为何不愿签名?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

权重、协议与运行环境,或许成了这场开放争论的三条线。

    作者丨郑佳美

    编辑丨马晓宁

                                                                                                       

黄仁勋开通个人 X 账号后,发布的第一篇帖子没有介绍新 GPU,而是分享了一封支持开放权重模型的联名信。

这封信主要讨论的是:一家机构把大模型训练好后,要不要把模型文件公开出来,让其他开发者下载到自己的电脑或服务器上运行,并根据具体任务继续调整。

NVIDIA、Google、OpenAI、Meta、Microsoft、Mistral、Hugging Face 等公司和机构出现在联署名单中,唯独 Anthropic 没有参与,意识到 A 社缺席的网友们纷纷开始了在线讨伐。

Anthropic 研究人员 Julian Schrittwieser 随后发了几条回应。他没有否定开放模型的作用,也表示自己并不主张限制开放权重。然后反过来开始阴阳:既然 NVIDIA 开始强调开放,CUDA 和 GPU 驱动什么时候开放,Microsoft 也支持开放权重,那么 Windows 和 Office 又该怎么看。

工程师 Atharva Ingle 专门针对 Julian 的评论列出了他提到的这两家公司已经开放的项目,包括 NVIDIA 的 NCCL、CUTLASS、TensorRT-LLM,以及 Microsoft 的 .NET、TypeScript、ONNX Runtime 和 DeepSpeed。

同时他也把 Anthropic 放进了比较:MCP 是开放协议,Claude 没有公开权重,Claude Code 的代码仓库虽然公开,却没有使用常见的开源许可证 ... ...

也有网友直接开怼,:这些公司明明贡献了大量开源软件,你到底在胡说八道些什么?

另一部分网友则抓住了 Anthropic 前后表态之间的落差。有人认为,Julian 此时声称自己并不反对开放权重,与 Anthropic 管理层此前反复释放的信息并不完全一致,也和他原帖传达出的态度对不上。雷峰网

在这些评论者看来,问题已经不只是 Claude 开不开放,而是 Anthropic 是否在用一套更温和的说法,重新包装此前对开放权重表现出的谨慎甚至排斥。

Reddit 上的批评更加尖锐。有人认为,Anthropic 正在因为反开放权重的立场快速消耗开发者社区的好感。

几个月前,它还是不少人眼中挑战 OpenAI 的 " 后来者 ",如今随着模型能力和市场声量上升,却越来越像一家只在意资本和估值的公司。原评论甚至直言,Anthropic 正在亲手毁掉过去积累的开发者信任。

几轮交锋下来,Anthropic 遭到的质疑也逐渐从 " 为什么没有签署 ",扩大到了 " 它究竟如何看待开放权重 "。有人批评它前后表态不一致,有人认为 Julian 在偷换讨论对象,也有人把问题上升到了开发者社区对 A 社的整体信任。

表面上看,几方你来我往,像是在争谁更支持开源。可把情绪拿掉,这场讨论其实可能存在着错位:大家都在使用 " 开放 " 这个词,谈的却不是同一个对象。

不同技术层有不同的开放方式,也对应不同的工程边界,放在一起直接比较,很容易越说越乱。与其继续追着谁更双标,不如回到技术本身,看看开放发生在哪一层,又具体改变了什么。

01

签的是什么

这封联名信支持的,并不是 " 所有大模型都必须公开 ",而是希望开放权重继续作为一种正常的模型发布方式存在。

通过 API 使用模型时,开发者只能把请求发给模型公司,再接收返回结果。至于背后运行的是哪个版本、使用什么推理参数、有没有更新安全规则,外部通常难以确认。

开放权重后,开发者拿到的是训练完成的参数文件。模型可以部署在自己的服务器上,也可以继续量化、微调和蒸馏。

量化可以降低模型运行时的显存需求;微调可以让模型适应特定任务;蒸馏则可以把大模型的部分能力转移到更小的模型中。研究人员还可以固定同一个版本反复测试,观察模型经过修改后,能力和安全表现发生了哪些变化。

所以,签署这封信并不等于承诺公开最强模型。参与联署的公司和机构认可的,更像是这样一种判断:并非所有模型都必须留在原厂服务器里。经过评测、能力和风险相对清楚的模型,可以考虑把权重交给外部使用。

这也解释了为什么 OpenAI、Google 等仍以 API 为主的公司同样可以参与。它们可以继续保留前沿模型,同时支持其他模型以开放权重的方式发布。

02

为什么有人愿意签

名单中的公司愿意支持开放权重,背后大致有三个技术判断。

第一个判断是,模型是否适合开放,更适合结合它具体具备的能力来评估,而不是只根据 " 权重是否公开 " 得出结论。

一个主要用于文本整理的小模型,和一个能够执行复杂网络操作、调用工具并连续完成任务的模型,风险显然不同。发布前可以测试模型在网络攻击、生物知识、自动执行和绕过安全限制等方面的能力,再决定是否公开权重。

按照这种方式,开放和关闭不必被看成只能二选一。部分模型可以公开,能力更强、风险暂时难以判断的模型,仍然可以只提供 API。雷峰网 ( 公众号:雷峰网 )

第二个判断是,很多模型问题只有在拿到权重后,才能研究得更清楚。

通过 API 测试时,研究人员看到的主要是最终回答。模型表现突然发生变化,可能是权重更新了,也可能是系统提示词、分类器或推理配置发生了变化,外部很难把这些因素完全分开。

拿到权重后,研究人员可以固定版本,测试同一个模型经过量化、微调或合并之后会发生什么。比如,一个模型原本会拒绝某类请求,经过少量微调后是否还会拒绝;降低到 4 位精度后,安全行为是否出现变化;多个模型合并后,原来的限制是否仍然存在。

仅靠原厂测试,往往难以覆盖模型发布后的所有修改方式。开放权重可以让更多团队复现问题,也能进一步验证模型发布时的安全结论,在后续修改中是否仍然成立。

第三个判断是,模型权重和安全系统可以在一定程度上分开部署。

模型负责生成内容,输入检查、输出过滤、工具权限和异常监测可以放在模型外面。权重公开后,部署者仍然可以增加分类器,限制模型能够访问哪些文件、数据库和外部工具,也可以记录异常调用。

这些公司并不一定认为开放权重没有风险。它们更倾向于认为,可以先筛选适合开放的模型,再通过外部评测和部署限制处理剩下的问题。

换句话说,它们愿意签,是因为这套发布方式至少在部分模型和场景中已经具备技术可行性:不是把所有模型直接放出去,而是先评估能力,再决定哪些模型适合开放。

03

Anthropic 在担心什么

Anthropic 没有正式解释这次为什么缺席,因此不能把 Julian 的个人回应当作公司结论。不过,从 Claude 现有的安全设计看,它对开放权重的顾虑,主要集中在一个问题上:模型离开原厂服务器后,原来的安全措施还能保留多少。

Claude 上线后,安全并不只依靠模型训练时形成的拒绝行为。Anthropic 还会在服务器上检查输入和输出、识别异常请求、限制账户调用,并在发现新问题后更新分类器或替换模型版本。这些措施能够持续发挥作用,是因为模型仍然运行在 Anthropic 控制的环境中。

权重公开后,情况会发生变化。外部部署者可以移除分类器、修改系统提示词,也可以继续微调模型。Anthropic 无法掌握这些副本后来处理了什么请求,也难以要求所有使用者安装新的安全更新。

更麻烦的是,目前的大模型安全训练,通常是在控制模型什么情况下回答,并不代表相关知识已经从参数中消失。使用者拿到权重后,后续微调可能削弱原来的拒绝行为。因此,模型发布时通过安全测试,不一定意味着修改后的版本还会保持相同表现。

在线 API 出现问题后,原厂可以统一更新;已经公开的权重却很难召回。早期版本、量化版本和微调版本可能长期存在,原开发者也无法确认它们是否保留了原来的防护。

这可能是 Anthropic 与名单中多数公司较核心的技术差异。参与联署的公司更倾向于认为,可以先通过能力评测筛选适合开放的模型,再由外部部署者配置过滤、权限和监测。Anthropic 的公开技术路线则更重视原厂对前沿模型的持续控制,因为外部使用者可以自行决定是否保留这些安全措施。

MCP 可以开放,Claude 权重却不开放,也可以从这里理解。MCP 规定的是模型如何连接工具和数据,公开协议不会同时交出 Claude 的模型能力;公开权重则意味着使用者可以独立运行并修改模型,两者对原有安全控制的影响并不相同。

因此,这次分歧并或许不只是开放与封闭的立场差异。名单中的多数公司可能认为,经过能力评测后,部分模型可以作为权重交给外部使用;但 Anthropic 却可能认为,对于能力较强的模型,现有测试还不足以判断它在长期传播和后续修改中是否仍然可控。

双方需要回答的其实是同一个技术问题:发布前的评测,是否足以支持一份模型权重被长期交给外部使用。

再回到最初那场争论,Julian 把 CUDA、Windows 和 MCP 拉进来,恰好说明 " 开放 " 并不是一个统一开关。权重、协议、运行环境和应用代码,公开后带来的影响并不相同。

Anthropic 的缺席,更接近于它对开放前沿模型权重仍有保留,而不是对所有开放技术的否定。

这封联名信没有结束争论,只是把问题从 " 要不要开放 ",推进到了 " 开放哪一部分 "。

参考链接:

https://images.nvidia.com/pdf/Open-Weights-and-American-AI-Leadership.pdfhttps://x.com/jensenhuang/status/2080643682408321103?s=46

https://x.com/Mononofu/status/2080982310577738049

https://x.com/AtharvaIngle7/status/2081032195867910441

https://www.reddit.com/r/Anthropic/comments/1v62wou/anthropic_refuses_to_sign_letter_supporting_open/

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 黄仁勋 microsoft nvidia gpu
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论