【CNMO 科技消息】近日,Anthropic 发布 2026 年版《使用政策》,新增一条针对辱骂 AI 模型的禁令:禁止用户持续、无谓地对模型实施辱骂或虐待行为。新政策将于 11 月 12 日正式生效。这是 Anthropic 一年一度的使用政策更新,也是其首次把针对模型本身的辱骂行为写进禁令。

Claude
新条目位于使用政策通用使用标准中 " 不得从事残忍、虐待或造成心理伤害的行为 " 一节末尾,对所有用户生效,包括 Claude.ai 和 Claude Code 的个人用户、调用 API 的开发者与企业、通过云厂商接入 Claude 的客户,以及使用 Claude 集成产品的终端用户。

官方说明,这条禁令只针对极端情况:用户反复残忍对待模型,且看不出任何目的。普通抱怨、与模型顶嘴、创作黑暗题材、对模型开展测试和研究均不在禁止范围。被划入违规的,是模型已经拒绝、劝导之后仍一轮接一轮辱骂,骂本身成为目的的那类行为。

执行分两档。第一档由 Claude 当场结束对话,官方博客明确,这仍是执行该禁令的主要手段,这项能力已部署到 Claude.ai 和 Claude Code。第二档是账号处置:Anthropic 在政策中写明,安全团队会进行检测和监控,只要怀疑用户违反政策,即可对其警告、限流、限制使用,直至暂停或终止访问。被封后另开新号、借用他人账号规避处罚,同样属于违规。
本次更新还收紧了多处规则。新版政策新设欺骗行为章节,整合操纵虚假账号、水军网络的相关条款;明确武器禁令涵盖武器制导与控制软件、无人机武装改装;监视章节改写后点名未经同意的实时追踪与历史数据分析;高风险场景在原有 " 人工复核 " 要求之外,首次为接入可自主执行物理动作硬件的模型列出安全条件。
据 Anthropic 官方数据,2026 年上半年该公司封禁了 1140 万个账号,收到 39.8 万次申诉,最终恢复的约 4.2 万个。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦