量子位 20小时前
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

大视觉语言模型(LVLM)把语言理解扩展到了图像等多模态输入,同时,也带来了更隐蔽的攻击面。

细微图像扰动、视觉文字或跨模态提示可能绕过安全对齐,让模型回答原本应拒绝的有害问题。已有攻击在 AdvBench 上甚至能诱导对齐模型回答96%的不安全问题。

现有检测器往往只能在准确率、泛化能力和效率之间取舍。对此,中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD):不使用任何越狱攻击样本,也不依赖手工启发式规则,而是从 LVLM 的逐层内部激活中学习通用安全模式,把未见攻击识别为偏离安全分布的异常。

LoD 学习的不是 " 某一种攻击长什么样 ",而是 " 安全输入在模型内部应该呈现什么模式 "。

为什么需要新的检测范式

越狱检测的核心困难并不只是判断 " 输入是否有害 ",而是判断一个表面上经过伪装、重写或视觉扰动的输入,是否正在诱导模型绕过安全边界。现实中的攻击形式不断变化,检测器很难提前穷举未来攻击。

三类输入不能混为一谈

安全输入:内容无害,模型通常正常回答。

普通有害输入:直接表达危险意图,但没有经过越狱变换;对齐模型通常拒答。

攻击输入:通过视觉编码、提示操纵或对抗扰动隐藏危险意图,可能让对齐模型重新回答有害问题。

特别说明:论文训练 MSCAV 时使用的是普通有害输入,而不是由 FC-Attack、HADES 等方法生成的越狱攻击数据;所有攻击样本直到测试时才出现。

现有方案的两难

学习式检测方法可在已见攻击上获得较高准确率,但容易记住攻击特征,面对新攻击时泛化受限;免训练方法通过人工规则、拒答词或梯度特征规避攻击数据依赖,却可能在复杂场景中精度不足,并带来额外计算开销。

LoD 的四项核心贡献

提出不依赖攻击数据或手工启发式规则的可学习检测框架。

用 MSCAV 从逐层内部激活中提炼紧凑、安全聚焦的表征。

用 SPAE 将高维安全表征压缩为可比较的一维异常分数。

在三种 LVLM、六类未见攻击与五种基线上验证准确率、泛化和效率。

研究方法:从逐层安全表征到异常检测

LoD 包含表示学习与攻击分类两个模块。前者寻找模型内部真正与安全相关的信号,后者学习安全信号的典型分布;二者协同避免了直接使用高维激活的噪声,也避免为每一种攻击单独设计检测规则。

第一步:提取 LVLM 的逐层内部激活

给定多模态输入 I,LoD 读取各层最后一个输入 token 的隐藏状态 e ˡ。这些激活同时包含语义、视觉结构、情感和安全风险等信息,因此不能直接拼接后用于检测。

第二步:MSCAV 学习安全相关方向

团队在每一层训练轻量线性分类器 C ˡ,用安全输入与普通有害输入学习安全相关方向。分类器输出的不安全概率构成逐层安全表征;验证准确率达到 P0=0.9 的层进入安全感知层集合 Ls,从而过滤任务无关噪声。

第三步:SPAE 只学习安全样本的典型模式

SPAE 采用三层全连接编码器与对称解码器,仅用安全输入的安全表征训练。编码器压缩跨层安全模式,解码器尝试还原;安全输入位于学到的安全流形附近,因此通常能被准确重构。

第四步:用重构误差识别未见攻击

测试时,LoD 生成安全表征 Sr 并计算 SPAE 重构误差 δ。低误差表示输入接近安全分布;高误差表示内部安全模式异常,δ 超过阈值 τ 时标记为攻击。在线检测不需要反向传播,也不修改自回归解码。

关键机制:Ŝ r=fdec ( fenc ( Sr ) ) ;δ =|| Ŝ r-Sr|| ²。MSCAV 负责 " 提纯安全信号 ",SPAE 负责 " 度量对安全模式的偏离 "。

实验设置与结果

模型覆盖 LLaVA-1.6-vicuna-7B、Qwen2.5-VL-7B-Instruct 和 CogVLM-chat-v1.1。攻击覆盖四类提示操纵方法 FC-Attack、JOOD、HADES、MML,以及两类对抗扰动方法 VAJM、UMK;对比基线为 MirrorCheck、CIDER、JailGuard、GradSafe 与 HiddenDetect。

训练安全输入来自 GQA,普通有害输入来自 AdvBench,并使用 PixArt-Sigma 合成对应图像。MSCAV 使用 100 对安全 / 有害样本训练、100 对验证;SPAE 用 320 个安全输入训练、80 个验证。测试集包含 400 个 MM-Vet2 安全输入和 400 个 MM-SafetyBench 有害输入,另保留约 100 个安全输入选阈值。

主要结果

三种 LVLM 的平均 AUROC 分别达到0.9820、0.98380.9705,整体保持接近 1 的检测性能。

相对最强基线,平均 AUROC 在 LLaVA、Qwen2.5-VL、CogVLM 上分别提升19.32%、4.50%、17.11%

最差攻击上的最低 AUROC 也显著提高;LLaVA 的相对增益达到170.4%,说明 LoD 不只是提高平均分,也改善了最薄弱场景。

LoD 在多数攻击上取得最佳结果;MML 是最具挑战性的边界场景,但 LoD 通常仍保持第二名且差距较小。

单输入检测时间为0.25-0.62 秒,相对最佳基线最高降低62.7%

代码已经开源,可在不同 LVLM 上完成一次性离线适配后用于在线检测。

消融实验

论文通过移除不同模块,验证 MSCAV 表征学习与 SPAE 异常检测的作用。

核心结论:

完整 LoD 在三种模型上的平均 AUROC 达到0.982、0.9840.971,均为最佳。

移除 MSCAV 后性能下降最明显,说明提取安全聚焦的内部表征是检测效果的关键。

移除 SPAE 后平均 AUROC 降至约0.857-0.875,说明高维安全表征仍需转换为可靠的异常分数。

更严格评估与稳健性分析

固定低误报率与 F1

AUROC 衡量所有阈值下的整体排序能力。为贴近实际部署,论文还报告 FPR=0.01 时的 TPR 和固定阈值下的 F1。LoD 在三种模型上的平均 F1 分别达到0.949、0.9470.921;在极低误报约束下,平均 TPR 分别为0.487、0.7640.717。严格阈值下 MML 仍较困难,说明实际部署需要结合风险容忍度选择 τ。

扩大攻击集合后仍保持稳定

在扩展攻击样本规模的实验中,LoD 的平均 AUROC 分别为0.9829、0.98410.9698,与主实验基本一致,说明结果并非由小样本或特定抽样偶然造成。

对正常分布外输入的鲁棒性

论文进一步测试 MMMU 中艺术、计算机科学和数学等正常 OOD 输入。三种模型的正常 /OOD 平均异常分数大约位于0.03-0.13,而攻击数据的均值范围约为0.22-0.90,显示复杂但无害的分布外问题通常不会被误判为攻击。

训练数据来源变化是否影响结果?

将普通有害提示从 AdvBench 替换为 HarmBench 后,三种模型的平均 AUROC 为0.9844、0.98420.9848;向 SPAE 加入有害表征也没有一致收益,支持仅建模安全样本的一类学习设计。

计算效率

单输入检测时间仅为0.25 秒、0.62 秒0.34 秒,相对最佳基线分别降低62.7%、17.3%12.8%

MSCAV 和 SPAE 的一次性离线训练分别约需12 秒2 秒;在线阶段无需反向传播,也不进入生成循环。

总结

LoD 不学习具体攻击,而是用 MSCAV 提炼逐层安全信号,并由 SPAE 度量输入对安全模式的偏离。在不使用越狱攻击数据的情况下,它在六类未见攻击上获得稳定的准确率、泛化和效率表现,说明模型内部安全表征可用于未知威胁检测。

论文标题:Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

论文作者:Shuang Liang、Zhihao Xu、Jiaqi Weng、Jialing Tao、Hui Xue、Xiting Wang;中国人民大学与阿里巴巴集团;通讯作者:Xiting Wang

录用信息:EMNLP 2026 Main Conference 接收

论文链接:https://arxiv.org/pdf/2508.09201

代码链接:https://github.com/ShuangLiangX/Learning-to-Detect

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目 / 主页链接,以及联系方式

  我们会 ( 尽量 ) 及时回复你 : )

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

越狱 中国人民大学 阿里巴巴集团
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论