导语:OpenAI 公布针对 Atlas 浏览模型的提示注入防护方案。
摘要
OpenAI 公布针对 Atlas 浏览模型的提示注入防护方案。提示注入是指网页、文档或外部内容通过隐藏指令诱导 AI 模型执行非预期操作,尤其会影响具备网页访问和外部网络能力的浏览型 AI。OpenAI 表示,通过针对性训练、评估和防护机制,可以显著降低模型遵循恶意网页指令的概率。在相关测试中,经过加固的模型将提示注入成功率从两成以上降至不足 1%,同时尽量保持正常浏览任务能力。
正文(中文编译稿)
OpenAI 表示,随着 AI 代理开始浏览网页、读取文件并调用外部服务,提示注入已经成为影响代理安全的重要风险。攻击者可以把指令隐藏在网页文本、页面结构或其他外部内容中,诱导模型泄露信息、执行错误操作,或者偏离用户最初的任务目标。
Atlas 模型的防护工作重点包括训练模型识别不可信指令、区分用户意图与网页内容,以及在执行高风险操作前提高判断门槛。OpenAI 还通过模拟真实网页环境的评估方法,测试模型在不同类型提示注入攻击下的表现。
测试结果显示,加固后的模型在面对恶意网页内容时,遵循攻击指令的比例显著下降。OpenAI 表示,安全防护不能只依赖单一过滤器,还需要结合模型训练、系统设计、工具权限和持续评估。
这项工作主要面向浏览型 AI 和能够访问外部网络的代理系统。随着 AI 代理承担更多检索、执行和自动化任务,如何在保持可用性的同时限制外部内容对模型行为的影响,将成为产品部署中的长期问题。
(文章为作者独立观点,不代表艾瑞网立场)


登录后才可以发布评论哦
打开小程序可以发布评论哦