星途科讯 1小时前
Anthropic宣布:默认启用Claude Code自动审查
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

Anthropic 宣布,自 8 月 14 日起,面向 Pro、Max 和 Team 套餐的新会话将默认开启 Claude Code 的 " 自动模式 "。此前选择其他默认设置的用户,可能会收到一次性提示询问是否切换。

在一项针对 1,053 名付费专业测试人员的受控实验中,人工审查仅捕获了 13.6% 的危险命令,而自动模式的捕获率高达 89%。Anthropic 指出,开发者在 Claude Code 中批准了 97% 的权限提示,表明大量请求未经仔细审查即被放行,且许多用户已通过更改设置削弱或绕过权限检查。

自动模式机制与安全表现

自动模式下,系统会将每次工具调用路由至分类器,以阻止不可逆、破坏性操作或针对用户环境以外资源的行动。若分类器阻止某项操作,Claude 将寻找更安全的替代方案或请求用户批准。若在连续三次阻塞或会话期间累计 20 次阻塞后仍无法推进,系统将切换回手动审批模式。

尽管自动模式降低了大多数用户的风险,但并未完全消除隐患,因其依赖 AI 判断安全性。Anthropic 建议,在进行修改生产系统或关键基础设施等高风险更改前,用户仍应审查 Claude 的操作。

内部及独立测试显示,自动模式比手动审批更安全。除上述受控研究外,对真实世界会话的分析发现,手动审批导致用户未明确要求有害行动的可能性是自动模式的两倍以上。在与 AI 安全公司 Apollo Research 的合作评估中,经过改进的分类器对抗模拟网络攻击的漏报率从 12% 降至 7%。

防御提示注入与企业级部署

自动模式增加了一层针对提示注入攻击的保护,防止代理被隐藏在网站或文档中的恶意指令诱骗。Trajectory Labs 的独立评估显示,在运行自动模式的 Claude 模型上,720 次提示注入攻击均未成功。相比之下,OpenAI GPT-5.6 Sol(运行 Codex 自动审查模式)的成功率为 5.83%,Codex 全访问模式下为 19.03%。

目前,Claude Enterprise、Claude API、Anthropic Platform、Amazon Bedrock、Google Cloud Agent Platform 以及 Microsoft Foundry 等平台仍保留手动选项,以便管理员评估。Anthropic 计划在未来一个月内使这些平台上的自动模式成为默认设置,并停止收取运行安全分类器所需的额外计算费用。

Anthropic 已在所有内部 Claude Code 工作流中应用自动模式。该分类器曾成功防止一次离线数据泄露、一次破坏性批量操作及过度广泛的权限提升。公司还引入了硬性拒绝、数据访问规则、破坏性 Git 操作前的状态检查等功能,以增强生产环境安全性。

Gusto 软件工程师 Martin Emde 表示,自动模式在速度与控制之间提供了更安全的平衡,消除了重复提示并提高了生产力,同时确保了安全性。

【星途科讯 图文丨小林 首发于 ZAKER 科技,转载请注明出处】

评论
大家都在看