量子位 昨天
至知研究院提出大模型可解释性新路线:直接拆权重,数据成本不到1%
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

大模型机制可解释性研究中,一直存在一个颇具反差的现实:

为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。

Transcoder、稀疏特征模块等方法会学习一组新的内部单元,用它们近似原模型某一层或某个模块的计算,再通过保留、移除这些单元来寻找任务回路。

这些方法推动了机制可解释性的发展,但也带来了一笔不小的额外成本:新的表示需要数据和优化,而且一旦替代模块没有充分复现原模块,后续分析就可能同时解释模型行为和替换误差。

说白了,研究者想打开一个黑箱,却往往需要先训练另一个 " 小黑箱 "。

问题不只是训练成本。任务回路需要找到一组可以独立干预的内部计算:只保留它们时,相关能力仍然存在;移除它们时,模型表现则明显下降。

训练型替代表示通常还需要针对不同模型、层和 checkpoint 分别拟合,使大规模、系统性的回路分析更加困难。

更理想的方案应当同时保持原模型行为、提供可独立干预的单元,并能以较低成本直接从已有权重中构造。

至知创新研究院(IQuest Research)与 Safe AI Forum、牛津大学、斯坦福大学、清华大学的合作者提出了一条更直接的路线:

不再训练一套独立替代网络,而是从现有的预训练权重中直接 " 拆 " 出可干预单元。

这套方法名为稀疏权重分解(Sparse Weight Decomposition,SWD)。

它把一个稠密权重矩阵分解为两个稀疏矩阵,并把二者共享的中间维度变成可独立评分、选择和消融的瓶颈单元。研究者由此可以直接在权重上抽取任务回路。

论文给出了三个值得关注的结果:

在匹配替换保真度的单矩阵实验中,SWD 使用的数据不到 Transcoder 等训练型基线的 1%

在 GPT-2、Qwen2.5 和 Qwen3.5-27B 的任务回路实验中,SWD 通常以更少的瓶颈单元和活跃连接达到相同的充分性、必要性目标;

方法不仅扩展到了 27B 模型,还覆盖了 GPT-2 Small全部 48 个注意力和 MLP 权重矩阵,并提供了完全不需要校准文本的 zero-data 版本。

论文地址:https://arxiv.org/abs/2608.03913

SWD 方法概览。预训练模型中的稠密权重被分解为两个稀疏因子,共享中间坐标成为可独立评分、选择和消融的瓶颈单元。直接把权重拆成 " 稀疏路径 "

SWD 的出发点很简单。对于预训练模型中的稠密权重矩阵 W,寻找两个稀疏矩阵 A 和 B,使得

W ≈ AB.

A 和 B 共享 m 个中间维度。第 i 个维度先通过 A 的第 i 列从输入中读出一个标量,再通过 B 的第 i 行写向输出。这样,一列和一行共同构成一个瓶颈单元,也就是一条固定的 rank-one 读写路径。

可以把它想象成在一张极其密集的交通网络中增加一组 " 中转站 ":每个中转站只连接少量入口和出口。研究者不仅可以看到一条路径从哪里读取、向哪里写入,还可以单独关闭它,观察模型行为会发生什么变化。

真正困难的地方,是如何在大幅减少连接的同时,仍然保留原权重对模型激活的作用。SWD 使用少量校准文本产生的层输入,优化分解前后的输出误差;求解过程中交替更新两个因子,通过硬阈值维持非零预算,并重新拟合保留下来的权重值。分解完成后,每个瓶颈单元都可以像稀疏特征一样参与任务归因、排序和消融,但不需要再训练一套独立的神经替代网络。

从权重分解到回路抽取。Step 1 将稠密权重分解为稀疏因子 A 和 B;Step 2 按任务归因对瓶颈单元排序,并选择 top-k 单元组成任务回路。已经有 SVD,为什么还需要 SWD?

既然目标是直接分解权重,一个自然的问题是:为什么不直接使用奇异值分解(SVD)?

SVD 同样可以把一个矩阵表示为 rank-one 成分之和,而且不需要训练数据。近期的 NaNA 等方法也已经证明,SVD 成分可以用于任务排序和干预。

但对回路分析而言,单元数量少,并不等于真正的计算路径少。

SVD 成分的读方向和写方向通常都是稠密的。即使只保留少数成分,它们仍可能连接几乎所有输入和输出维度。

SWD 则进一步把稀疏性施加到每个单元的读写连接上:少量单元对应的同时也是少量活跃连接。

团队还构造了两个能够精确还原 GPT-2 原权重的稠密对照:保留全部奇异值的 full-rank SVD,以及采用随机正交基的 Random-B。

两种分解都能在数值上精确复现原矩阵,但在相同的归因和消融流程下,需要更多活跃连接才能达到与 SWD 相同的任务表现。

这组对照表明,SWD 的优势并不是 " 把矩阵拆开 " 这么简单,真正关键的是每个单元都具有稀疏的读写结构

精确稠密分解对照。Full-rank SVD 与 Random-B 都能精确还原原始权重,但需要比 SWD 更多的活跃连接才能达到相同的充分性或必要性要求。不到 1% 的数据,仍能保持模型行为

在进行回路分析之前,首先要回答一个更基础的问题:把原权重换成稀疏分解之后,模型还是原来的模型吗?

团队使用留出文本上的交叉熵差值(CE delta)衡量替换保真度,并使用 KL 散度和替换位置的激活重构误差进行补充验证。CE delta 越接近 0,说明替换后的模型行为越接近原模型。

在 GPT-2 Small 第 8 层 mlp.c_proj 的单矩阵实验中,SWD 仅使用数千个校准 token 就进入低 CE 误差区间;Transcoder 和 VPD-Recon-CI 等训练型基线则需要约 10 ⁶量级的 optimizer-replay token 才能接近这一替换质量。同样的趋势随后出现在 Qwen2.5-0.5B、1.5B、3B 和 Qwen3.5-27B 上。

综合论文中的单矩阵比较,在达到匹配替换保真度时,SWD 使用的数据不到训练型替代表示的 1%。这意味着,大量数据和长时间替代模块训练并不是获得高保真回路单元的必要前提。直接从预训练权重出发,也可以构造足够忠实的干预表面。

GPT-2 Small 单矩阵替换的 CE delta 随数据量变化。SWD 使用少量校准数据即可进入低误差区域。

Qwen2.5-3B 与 Qwen3.5-27B 的单矩阵替换结果。横轴为构造替换表示所使用的 token 数,纵轴为相对稠密模型的 CE delta。保留时能支撑任务,移除时会破坏任务

高保真地复现原矩阵,只能说明所有瓶颈单元合在一起能够工作。真正的回路还必须满足两个更严格的条件:只保留少量选中单元时,任务行为仍然存在;只移除这些单元时,任务表现会明显下降。前者是充分性测试,后者是必要性测试。

团队先在独立训练划分上使用一阶任务归因对候选单元排序,再构造从 top-1、top-2 到 top-k 的嵌套回路,并在留出测试集上评估。回路成本同时使用两种口径衡量:选中了多少瓶颈单元,以及这些单元实际包含多少非零读写连接。

在 GPT-2 Small 的 GreaterThan、IOI、Docstring 和 Gendered Pronoun 四项任务上,SWD 达到相同充分性或必要性要求时,通常需要比 Transcoder 和 VPD-Recon-CI 更少的单元和活跃连接。

把平均激活消融替换为零消融之后,这一优势依然保持。

这一结果也扩展到了 Qwen2.5 和 Qwen3.5-27B。

换句话说,SWD 得到的不只是一种低误差矩阵近似,而是一组真正能够接受因果检验的任务回路单元。

GPT-2 Small 的任务回路结果。曲线越低,表示达到相同充分性或必要性要求所需的活跃连接越少。

Qwen3.5-27B 的任务回路结果。SWD 在大模型上仍能以较少活跃连接达到相应的因果测试要求。从单矩阵扩展到 27B、全模型和 zero-data

SWD 的验证并未停留在 GPT-2 的单个矩阵上。

在模型规模上,团队将相同的单矩阵替换和回路抽取流程扩展到 Qwen2.5-0.5B、1.5B、3B,最终进一步验证至 Qwen3.5-27B。

在 27B 模型的第 31 层 mlp.down_proj 上,SWD 依然以显著更少的数据达到低 CE delta,并以更少的活跃连接达到相当的充分性和必要性目标。

在替换范围上,团队进一步把 GPT-2 Small 12 个 Transformer block 中全部 48 个注意力和 MLP 权重矩阵替换为稀疏分解,同时保留 embedding、LayerNorm、非线性函数和输出头。

由于局部近似误差会跨层累积,团队将 SWD 作为稀疏初始化,固定所有非零位置,只微调已经保留下来的因子值。得到的 SWD-FT 在连接数量不变的情况下,将模型CE 从 3.90 降至 3.44,略优于相近非零参数预算下稀疏预训练基线的 3.45。

更值得注意的是,SWD-FT 总计使用约 2,060 万个 token,而稀疏预训练基线达到相近 CE 使用了28.84 亿个 token,前者同样不到后者的 1%。这使得从现有稠密 checkpoint 出发构造全模型稀疏干预表面,成为一条极具吸引力的路线。

SWD 还提供了一个更彻底的 zero-data 版本。在 GPT-2 Small 单矩阵实验中,它完全不使用校准文本,直接最小化原权重与分解权重之间的 Frobenius 误差。

结果显示,zero-data   SWD 在权重空间中更接近原矩阵;使用激活校准的 SWD 则在高稀疏度下更能保持典型文本上的模型行为。

即使完全不使用校准激活,zero-data   SWD 得到的瓶颈单元仍然能够抽取出有效任务回路。这为逐 checkpoint、逐训练阶段追踪大模型内部结构提供了新的可能性。

GPT-2 Small 全模型替换。固定稀疏结构并微调保留的非零值后,模型CE 从 3.90 降至 3.44,同时保持活跃连接数量不变。

Zero-data SWD。Zero-data SWD 在权重空间中更接近原矩阵;activation-calibrated SWD 在高稀疏度下更能保持典型文本上的模型行为。从曲线走向具体单元:它们到底在做什么?

回路曲线证明了这些单元在因果测试中有效,但机制可解释性还关心另一个问题:这些单元能否呈现出可理解的模式?

团队在 GreaterThan 任务上,对 GPT-2 Small 全部 9,208 个候选 mlp.c_proj 瓶颈单元进行归因排序,并从第 6、8、10 层展示六个高排名单元。

随后,他们在独立的 WikiText-2 文本上收集每个单元的高激活上下文,并由 GPT-5.5 总结重复出现的语义模式。

六个单元中,有四个集中响应数字、年份、数量或度量信息,另外两个更多对应标点、句法和命名实体。

这些语义模式并未参与单元选择,却与 GreaterThan 所需的数值比较能力形成了明显呼应。

团队还进行了一个独立的定向编辑实验。他们筛选出瓶颈单元 c205,并将该单元读方向诱导的 rank-one 更新施加到原始稠密 GPT-2 权重上。

在提示词 The opposite of up is 中,正确答案 down 相对干扰答案 left 的logit margin 提高了 0.216;在七条无关事实提示上,平均末 token KL 仅为 4.02 × 10 ⁻⁵

在相近的正向目标变化下,这个单单元方向测得的副作用低于随机单元和 rank-4 LoRA 对照。

一个从权重分解中得到的瓶颈方向,因此不仅可以被观察和消融,还能够成为精确操控模型行为的编辑手柄。

GreaterThan 回路的语义审计。六个高归因瓶颈单元中,四个与数字、数量或度量模式相关;语义假设来自独立文本中的高激活上下文。

单个 SWD 方向的定向编辑。纵轴为目标答案相对干扰答案的 logit margin 变化,横轴为无关提示上的平均末 token KL。直接从预训练权重中寻找大模型回路

过去,机制可解释性往往需要先学习一套新的特征字典或替代模块,再对这些新单元进行归因和干预。SWD 展示了另一种可能:预训练权重本身就可以被重新组织成稀疏、可寻址、可因果检验的计算路径。

从不到 1% 的数据成本,到更少的瓶颈单元和活跃连接;从 GPT-2、Qwen2.5 到 Qwen3.5-27B;从单矩阵、整个 Transformer 主干到完全不依赖校准文本的 zero-data 分解,SWD 正在把权重侧机制可解释性变成一条更轻量、也更容易扩展的技术路线。

更重要的是,这些稀疏路径不只存在于数值曲线中:它们能够响应具体语义模式、通过充分性和必要性测试,并被用于定向改变模型行为。

随着模型规模不断增长,直接从已有 checkpoint 中抽取和追踪回路,或许将成为理解大模型内部计算的一条重要路径。

论文信息

论文标题:Sparse Weight Decomposition for Efficient Circuit Extraction

作者:Chuanhao Yan、Xuhan Huang、Yawen Duan、Zhenfei Yin、Hang Zhao、Bryan Dai、Jie Fu

机构:IQuest Research、Safe AI Forum、University of Oxford、Stanford University、Tsinghua University

论文:https://arxiv.org/abs/2608.03913

代码:https://github.com/Veri-Safe/SWD

模型:https://huggingface.co/veri-safe/SWD

交互式博客:https://huggingface.co/spaces/veri-safe/SWD-Blog

* 本文系量子位获授权刊载,观点仅为原作者所有。

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

评论
大家都在看