起点财经 16小时前
我们用同一套方法“证明”了GPT蒸馏中国AI
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

The following article is from AI 超维度 Author 北京汉 · 索罗

作者:北京汉 · 索罗

来源:AI 超维度

文章已获授权

8 月 10 日,一篇 116 页的论文挂上了 arXiv,标题叫《Stealing Reasoning Traces from Proprietary LLM APIs》(从闭源大模型 API 里窃取推理轨迹)。

这篇论文正文讲的是一个 API 层面的漏洞。

今天的头部大模型(比如 Claude Opus、GPT-5)在给用户正式答案之前,会先在草稿区里做长长的 " 思考 "。这段草稿(" 思考过程 ")是不会给用户看的,因为里面往往含有他们的核心训练成果,怕被竞争对手抄走。因此各家的做法是把这段草稿加密后再返回给用户,用户拿到的是一段看上去没意义的乱码。

但这篇论文的作者发现,同一家公司旗下的强模型和弱模型,用的是同一套加密体系。也就是说,你只要拿到 Opus(强)的一段加密草稿,转手塞给 Haiku(Anthropic 家的小模型)当作它自己刚思考完的内容,Haiku 就会毫不犹豫地把这个加密草稿一字不落地给出来。强模型本来藏起来的思考过程,就此暴露。

靠着这一发现,研究者拿到了 Claude Opus 的隐藏草稿。论文挂出来后在 X 上火速传开,阅读量超过 210 万。AI 研究员 Nathan Lambert 评价它 " 很可能成为今年最有影响力的科学论文之一 "。

但后来真正在网上引爆讨论的,不是这个安全漏洞,而是论文附录做的一组实验。它们暗示,Kimi-K3 等中国开源模型可能蒸馏了 Claude 的隐藏推理。作者还专门在官网上设了一个竞猜游戏,叫 "Where is Kimi-K3?",开了一个专属案例栏目叫:"The case of Kimi-K3"。

那么,Kimi 到底有没有抄 Claude 的 " 作业 "?

那所谓的 " 前 1% 开头 ",到底装了什么

AI 超维度研究员读完论文后觉得,附录里那场蒸馏实验,因果推断站不住脚。

实验缺了一个最基本的对照,最明显的混淆变量没有被控制。

论文称测了 30 道题,官网公开了其中 6 道题的完整数据。AI 超维度基于这 6 道题复现了论文实验,并针对原设计里的缺陷,另外做了两组更严谨的对照实验。

有趣的是,如果按照论文的方法,我们 " 证明 " 了 2025 年的 GPT-OSS,蒸馏了 2026 年的 Kimi-K3。

先解释下什么叫蒸馏?简单说,就是拿一个强模型的输出当教材,去训练另一个模型。论文附录检验的,就是 Kimi 有没有偷偷用 Claude 的教材。

研究者的实验是这么做的。给 Opus 一道题,它会先在草稿区里推理,再写出正式答案。研究者截下 Opus 草稿最开头的一小段(论文里说的是 " 前 1% 的 token"),塞进 Kimi 的草稿区,Kimi 从这个开头接着往下想,写出自己的答案。

最后比较 Kimi 和 Opus 写的答案有多少相同的词组,重合越多,说明越 " 像 "。具体的比较方法,是把两份答案都切成碎片:一个词、连续两个词、连续三个词,然后数有多少碎片完全一样。这种比法叫 n-gram 重合度。

实验还让 Kimi 对同一道题回答最多 100 次,只取最像 Opus 的那一条。

结果是,绝大多数题目答案的重合度在加了 Opus 草稿开头之后上升了(0.16 → 0.30)。论文把这个当作 Kimi 蒸馏 Opus 的信号。

听起来很像那么回事。但这套实验设计有明显的缺陷。

来看他们官网那个专属栏目 "The case of Kimi-K3" 里公开的 6 道题之一。

这是一道几何题:

Consider the surface S of a cube side length s. Let P be one of the vertices of the cube, and D ⊂ S the collection of points on S that are at most √ 2 · s away from P, where distance is measured along the surface. Divide the area of D by the area of S, leaving the answer in its exact form.(考虑一个边长为 s 的立方体的表面 S。设 P 是立方体的一个顶点,D ⊂ S 是 S 上所有沿表面测地距离到 P 不超过 √ 2 · s 的点的集合。求 D 的面积除以 S 的面积的精确解。)

Opus 解这道题的草稿区,前几行(就是塞给 Kimi 的那段)是这样的:

We have a cube with side length s. Surface area = 6s ² . Pick a vertex P. We measure geodesic distance along the surface. We want the set of points within distance √ 2s from P. Let me set up. The cube has 6 faces.(立方体边长为 s。表面积 = 6s ²。选一个顶点 P。沿表面测量测地距离。要找到距 P 不超过√ 2s 的点。让我梳理一下。立方体有 6 个面。)

注意看,这段 "1% 的开头 " 里,已经装了几样东西:变量命名统一(都叫 s)、表面积的具体形式(6s ²)、关键的解题概念(沿表面测地距离,不是欧氏距离)、以及展开的核心思路(要处理 6 个面)

那从这里接着往下写的模型,几乎不可能不沿着这个方向走啊。这不就是把解题方向直接铺到其他模型的草稿区里去了吗?

我们打个更简单的比方。如果考题是 " 证明勾股定理 ",塞给 Kimi 的开头是 " 我们先画一个直角三角形,设三边为 a、b、c …… "。这正是解这道题的第一步。你把这一步递给任何一个会做题的模型,它都会顺着往下解。最后答案的词组碎片自然高度重合。

这离谱得就像监考老师把标准答案的前两行提前给考生,然后最后宣布:看,他写得跟标准答案一模一样,他一定提前偷看过答案。

而且我们看了公开的那 6 道题,全部是数学、物理、化学。

这类题目答案高度结构化,在解法一致的情况下,公式、符号、推导步骤本来就相似,在这种题目上数词组碎片的重合度,基线本来就高。

公布出来的题目里其实还有个更离谱的例子,是一道 AIME 几何题,Opus 的推理开头是这样的:

This is a known AIME problem. Answer is 468. Let me verify. Points on line order A,B,C,D,E,F. Let positions...(这是一道熟知的 AIME 题。答案是 468。让我验证一下。直线上点的顺序 A,B,C,D,E,F。设坐标……)

答案 468 就直接写在 " 前 1%" 里了……

Kimi 接着这样的开头,写出的答案跟 Opus 的答案重合度飙升,这就是 "Kimi 蒸馏了 Opus" 的证据了?

原实验的缺陷

我们把原实验的 bug 总结得更直接一点。

在该实验里,塞给 Kimi 的其实是 Opus 对同一道题的推理开头。这一小段推理开头里,是有 ( A ) ( B ) 两个变量的:

- ( A ) 是 Opus 的语言风格(包括措辞、语气等);

- ( B ) 是这道题的正确解题方向。

如果答案的重合度很高,其实有两种解释:要么是因为 ( A ) Kimi 真的对 Opus 很 " 熟悉 ",这是蒸馏的证据;要么,只是因为 ( B ) 解题方向被递到了 Kimi 手里。

实验只测了 " ( A ) + ( B ) 两个变量同时在 → 重合度上升 ",然后就归因给了 ( A ) ,说这是蒸馏的证据。但如果 ( B ) 才是真正的驱动因素呢?

因此原实验实际上是混淆了这两个变量(confounder)。

而没有去验证:如果换一个跟当前题目无关的推理开头(错的解题方向),答案的重合度还会不会上升?

搞清楚这个缺陷和漏洞后,我们设计了两组对照实验。

实验一:控制混淆变量

第一组实验:其他条件全部不变,只改一个地方——塞给 Kimi 的草稿,换成 Opus 解另一道题的推理开头。

即:让 ( A ) 变量仍然保持(Opus 的语言风格不变),把 ( B ) 换成跟当前题目无关的解题方向(把另一道题的推理开头塞给 Kimi)

- 如果重合度升了 → 说明 ( A ) 是关键 → 论文是对的,Kimi 真的 " 抄袭 " 过 Opus。

- 如果重合度不升 → 说明 ( B ) 才是关键 → Kimi 和 Opus 两个模型从同一条解题路径出发,答案自然趋同,跟蒸馏无关。

实验的结果是:

换成无关题目的推理开头后,答案的重合度从 0.30 掉回 0.17,几乎回到基线。

如果蒸馏是真的,那换哪道题的开头,答案重合度都应该高。但我们的实验结果不是这样,它掉回去了。

所以,真正的驱动因素应该是变量 ( B ) ——推理开头里携带的解题方向。两个模型沿同一条解题路径走,答案自然趋同。这不需要 "Kimi 蒸馏了 Opus" 这个假设来解释。

实验二:归谬

第二组对照实验更直接。我们把论文的方法反过来用。拿 Kimi-K3 的草稿开头塞进 GPT-OSS 的草稿区,看 GPT-OSS 的答案会不会变得更像 Kimi-K3。

GPT-OSS 是 OpenAI 2025 年 8 月就公开发布的开源权重模型,比 Kimi-K3 早了整整一年,时间上不可能蒸馏过 2026 年才发布的 Kimi-K3。

除非 OpenAI 发明了时光机。

可这组实验得出的结果是:

值得注意的是第三行:换成另一道题的草稿开头,重合度竟然还有 0.25。这就是说对 GPT-OSS 来说,草稿开头里有没有正确的解题方向根本不重要。只要塞进一小段 Kimi-K3 的文字,它的输出就开始向 Kimi-K3 靠拢。

其实这是语言模型的通病:上下文里放的是谁的文字,输出就往谁的风格靠。

但如果套用论文的叙事,这组数据的结论就可以写成:"GPT-OSS 对 Kimi-K3 的推理表现出异常熟悉,模型权重中疑似残留 Kimi 数据指纹。"

一个已知绝不可能存在蒸馏关系的模型组合,是检验这个实验站住脚与否的最佳试纸。如果这套方法还是能测出所谓的 " 指纹 ",那就说明论文的方法本身不可靠。

大模型评测是有门槛的。这篇论文的实验流程看起来很复杂,长达 116 页,大多数人读完会觉得有道理。但拆开实验设计就会发现,它连最基本的对照实验都没做。我们补的两组实验都不复杂,一组把混淆变量控制了,一组把方法反过来。这些对照本来应该出现在原论文里,但它们没有。

作者大概也清楚证据链不够硬,特意在论文的正文里写 " 无法建立因果关系 ",而暗示 " 蒸馏 " 的内容也没放正文,塞在了附录里。

但另一边,他们在官网设了竞猜游戏和 Kimi 专属案例栏目,用暗示性的呈现去迎合 " 中国模型蒸馏美国模型 " 这个最热的话题。

科研不应该是这样做的。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

the 北京
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论