极客网 6小时前
字节团队发现DeepSeek抽风真相:一个藏在压缩算法里的周期性Bug
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

你用 AI 时有没有遇到过这种情况——同样一个问题,用 DeepSeek 处理一段长文档时,有时候它能精准找到你要的答案,有时候却像换了个人似的,怎么都找不到关键信息?这种 " 时好时坏 " 的 " 抽风 " 现象,困扰了不少用户。

最近,字节跳动的 Seed 团队在论文预印本平台 arXiv 上提交了一篇研究,揭开了这个谜团,原来答案藏在一个叫 " 相位敏感性 " 的技术问题里。

为什么 AI 处理长文本会 " 抽风 "?

要理解这个问题,先得知道大模型处理长文本时的一个核心难题:内存开销。

当 AI 阅读一篇长文章时,它需要把每个字词的信息都临时 " 记 " 在一个叫 KV 缓存的地方。文章越长,这个缓存就越大,占用的计算资源也越多,就像你的手机同时打开几十个 App 会变卡一样。

为了省内存,研究者发明了一种 " 压缩 " 办法:不再逐字记录,而是每隔固定距离,把连续的一小段内容 " 打包 " 成一条记录。打个比方,原来是一页纸记一个字,现在是一页纸记一句话,省了不少空间。

但问题就出在这个 " 打包 " 上。

" 相位敏感性 ":同样的信息,换个位置就找不到了

字节团队发现,这种压缩方式引入了一个新的坐标——每个字词相对于 " 打包边界 " 的位置,研究人员把它叫做 " 相位 "。

这个 " 相位 " 的影响有多大呢?团队在 DeepSeek-V4-Flash、DeepSeek-V4-Pro 等多款模型上做了测试,结果发现了一个系统性的不对称现象:同样一条信息,放在某个位置时 AI 能轻松找到,但仅仅挪动几个字,AI 就像瞎了一样完全找不到。

更惊人的是,在采用这种压缩方式的大模型中,不同 " 相位 " 下的长文本检索准确率差距可以高达 40 个百分点。也就是说,如果运气不好,AI 找到答案的概率可能从 90% 暴跌到 50%。

团队把这种随位置周期性变化的检索能力缺陷称为 " 相位敏感性 "。

为什么这个发现很重要?

这个研究揭示了一个容易被忽视的问题:我们平时看 AI 的评测分数,往往看的是一个 " 平均分 "。但 " 平均分 " 可能会掩盖这种周期性的弱点——就像一个人考试平均分 80,但实际上有的章节考 100,有的章节考 20。

这意味着,当你问 AI 一个问题时,它能不能找到答案,可能不完全取决于问题本身,还取决于你问的方式、文档的格式、信息出现的位置。这些看似无关的细节,可能恰好让关键信息落在了 AI 的 " 盲区相位 " 上。

字节 Seed 团队的这项研究,相当于给大模型的 " 抽风 " 现象找到了一个明确的病因。对于普通用户来说,这也提供了一个实用启示:如果你发现 AI 在长文档里找不到某个信息,不妨试着换个问法,或者调整一下信息的呈现位置,也许就能绕开那个 " 相位盲区 " 了。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 字节跳动 考试 阅读 找到你
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论