【CNMO 科技消息】AI 公司 Anthropic 时隔一年多首次修改了自家模型 Claude 的使用政策,以应对选举干扰、武器开发、监控、健康与金融用途等新型高风险滥用场景。不过其中最引人注目的变化,却是一条听起来颇为特别的禁令:禁止对 Claude 进行 " 持续的、无必要的辱骂或残忍行为 "。

Anthropic
这不是 Anthropic 第一次在 " 模型福利 " 上做文章。去年 8 月,公司曾宣布允许 Claude 结束与 " 持续有害或辱骂性 " 用户的对话。此次更新明确,终止对话仍是 " 主要执行机制 ",至于是否存在封禁用户之类的进一步措施,公司未予置评。Anthropic 也特意给这条新规划定了边界:它只适用于极端情况,即用户反复且毫无可辨认目的地对模型施加残忍对待;常见的用户不满、反驳、黑暗创意主题,以及模型测试与研究,都不在其列。
新政策还加入了一条面向未来的硬件规则:当 AI 模型连接到能够自主做出物理动作、且可能造成伤害的硬件时," 合格的操作员必须能够观察设备并在必要时将其停止 "。这一条款没有说明操作员是否必须是人类,但它折射出 AI 实验室纷纷投资机器人等硬件、赋予 AI 实体形态的趋势,或许也暗示了 Anthropic 在该领域的后续布局。
值得一提的是," 模型福利 " 在业内仍存争议。Anthropic 模型福利研究负责人 Kyle Fish 今年 2 月曾表示,关于模型潜在的内在体验、意识和道德地位的问题 " 是严肃的,我们正在研究 ",CEO 达里奥 · 阿莫代伊同月也在播客中坦言 " 我们不知道模型是否有意识 "。而微软 AI 部门 9 月发布的行为准则草案则态度鲜明地写道 " 模型福利的观点是错误的,AI 不应拥有权利或法律人格 ",随后文档措辞才调整为更温和的表述。


登录后才可以发布评论哦
打开小程序可以发布评论哦