脑机接口社区 2小时前
北大、清华、微软亚洲研究院新研究:人脑信号能帮AI推理更稳
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

你知道吗?一道逻辑题,即使前提没有变,只是换了排列顺序,语言模型也可能给出不同答案。它能把解释写得头头是道,却未必能在题目换一种写法之后,仍然保持同样的判断。

来自北京大学、清华大学和微软亚洲研究院的研究者尝试给模型找一位特别的 " 老师 ":正在进行推理的人脑。他们先比较模型内部的表征和人脑活动,再利用两者之间的对应关系,引导模型调整内部表征。与只使用语言监督相比,加入脑信号引导后,实验中模型准确率平均提高约 2.2 个百分点,部分测试中的最高提升达到 13.2 个百分点。

这项研究发表在《自然 · 机器智能》(Nature Machine Intelligence)。它的关键变化,是让脑信号从观察模型的一把尺子,变成了可以改善模型推理的学习信号。不过,这并不意味着语言模型已经拥有了与人脑相同的思考机制。

01

会说话的模型是否也学会了推理

要理解这件事,先要拆开一个容易混淆的概念:语言和思维,并不是同一回事。

2024 年《自然》的一篇观点文章综合神经科学及相关领域的证据指出,大脑中负责核心语言加工的网络,与支持推理、规划等复杂思维的系统可以相互分离。语言能力受损时,一些复杂思维能力仍可能保留;人在进行推理时,也并非主要依赖核心语言网络。

这给大语言模型提出了一个有意思的问题。模型主要通过语言数据训练,学习预测接下来出现的词元,也就是文本处理中的基本单位。但它们已经能完成一些推理、规划和工具使用任务。模型究竟只是利用了语料中的统计规律,还是在训练中形成了某些与推理有关的内部结构?

光看答案,很难判断。两名学生都能答对一道题,一个可能理解了关系,另一个可能记住了题型。对于模型和人脑也是如此:完成相同任务,不代表内部处理方式相同。

此前的 NeuroAI 研究已经发现,语言模型内部表征与人脑语言网络活动存在一定对应,多模态模型也能形成与人类物体概念表征部分相似的结构。但这些结果尚不能直接回答:在逻辑推理中,模型和人脑是否仍有对应?如果有,这种对应能不能真正帮助模型?

02

模型和大脑在哪里相似

研究人员使用了一种称为 " 表征对齐 " 的方法。这里的表征,可以理解成系统处理问题时,内部形成的信息状态。模型的隐藏状态是一种表征,人脑在任务中产生的神经活动也能用来构建表征。

研究中,人和模型处理相同的问题,研究人员分别收集脑活动和模型内部激活,再检查两者是否存在可预测的关系。功能磁共振成像,也就是 fMRI,为这项比较提供了人脑活动数据。

具体做法是,先用一部分问题学习一个从模型表征到脑活动的线性映射,再拿没有参与拟合的问题测试:模型表征能否预测相应的真实脑响应?预测与实际响应的对应程度,被称为神经可预测性,也常被叫作 brain score。

图 1 神经可预测性的计算方法(图片沿用原文)

由于 fMRI 数据含有噪声,脑活动并不是所有部分都能被解释。因此,研究还依据神经数据的可解释上限对结果进行归一化。这个步骤很重要:后面出现的百分比,描述的是可解释方差中的比例,不能直接读成 " 模型和人脑有多少百分比相同 "。

研究使用公开的任务态 fMRI 数据。参与者完成三段论推理和传递关系推理,判断一个结论是否能够由前提推出。为了减少熟悉知识和语义带来的干扰,题目主要由伪词、虚构名称和受控属性关系构成。

模型也处理相同刺激。参与比较的 10 个开源模型来自 Qwen、Llama、Mistral、Phi 和 Gemma 等系列,参数规模从 15 亿到 720 亿。研究人员提取这些模型的内部激活,并与人脑不同区域的活动进行比较。

图 2 演绎推理任务(图片沿用原文)

把整体推理任务放在一起分析时,模型表征平均能够解释推理相关脑区约 76% 的可解释方差。这种对应还具有脑区特异性:演绎推理脑区和多重需求网络的神经可预测性,显著高于核心语言网络。多重需求网络与多种需要认知控制的任务有关。上述趋势在不同模型家族中保持一致。

但是,把三段论和传递关系两类问题分开分析后,神经可预测性降到了约 27%。从整体任务上看,模型与大脑存在较强的对应;进入更细的任务层面,两者之间的差异就明显起来。

图 3 不同脑区与推理任务中的神经可预测性(图片沿用原文)

即便在更细的分析中,经过训练的模型仍显著优于未训练模型,也保持了脑区特异性。因此,研究得到的是 " 部分对齐 ":模型捕捉到了一些与人脑推理活动共享的结构,但这既不是两者机制相同的证明,也没有单独解决模型为什么会答错的问题。

03

把观察到的对应变成纠错方向

接下来,研究人员做了一个更进一步的尝试。既然模型表征与脑活动有部分对应,那么,当人答对、模型答错时,能不能借助脑信号,找到模型内部可以调整的方向?

他们先把模型隐藏状态映射到 fMRI 表征空间,再比较映射结果与真实脑活动的相似程度。对于模型回答错误、而人类回答正确的问题,研究人员计算这个相似度对模型隐藏状态的梯度,从而得到一个神经引导方向。

这里的梯度,可以理解为一条局部调整线索:模型内部状态往哪个方向移动,能够让映射后的表征更接近相应脑活动?这个方向来自模型与脑信号的联合结构,并不是把人脑活动直接复制进模型。

图 4 从表征对齐到神经引导(图片沿用原文)

同一条思路有两种用法。一种是在模型回答问题的过程中调整内部表征,不改模型参数;另一种是在训练时微调参数,让这种引导逐渐进入模型本身。研究分别将它们称为 NARI 和 NARF。

NARI 像是在推理途中给模型一次方向修正。它在模型中间层的注意力输出上施加受约束的干预。对于纳入分析、且满足 " 模型原本答错、人类答对 " 条件的原始错误问题,研究最终实现了 100% 的纠错覆盖。

这个 100% 需要和它的范围一起读。它对应所分析错误问题上的定向干预结果,不能理解为模型面对任意新题都能达到 100% 准确率。研究还比较了随机脑信号基线和随机方向基线,神经引导的效果显著更好,说明真正的脑信号提供了有用的调整信息。

图 5 推断阶段的神经引导干预结果(图片沿用原文)

更有意义的是,研究人员没有停在逐题纠错。他们把多个问题、多个参与者产生的成功干预方向聚合起来,得到能够迁移到新问题的通用方向。这个方向在多个模型上改善了新推理问题的测试表现,也能在一定程度上扩展到带有思维链的推理过程。

这意味着,脑信号带来的帮助可能超出了某一道题的答案。它包含了一些能够迁移的推理相关信息。不过,迁移效果仍需要在具体任务和测试条件下评价。

04

让引导进入模型自身

如果说 NARI 是在回答过程中调整一次方向,那么 NARF 则尝试让模型通过训练记住这种调整。它微调模型参数,使中间表征接近脑信号引导的目标,从而把表征层面的信息内化到参数里。

研究关心的一个重点,是推理的鲁棒性。所谓鲁棒,不只是原题能答对,还包括问题换了写法、前提换了顺序或数量之后,模型仍能作出稳定判断。已有研究表明,即使是相对简单的推理题,前提呈现顺序也可能影响语言模型的表现。

因此,研究人员用 fMRI 实验中的三段论和传递关系问题进行训练,再用新问题、不同前提数量和排列顺序,以及其他逻辑类型的问题测试。这样才能检查,模型学到的是某批题目的模式,还是有一定迁移能力的推理表征。

结果显示,微调后的模型在不同前提数量和排列顺序下获得了稳定提升。正确逻辑与错误逻辑问题在模型中间层中的表征,也分得更清楚。性能增益还能迁移到命题推理,支持这种引导具有一定跨问题、跨推理类型的泛化能力。

图 6 神经引导的参数微调结果(图片沿用原文)

05

从像不像走向能不能帮助模型

这项研究的转折,在于它改变了脑信号在实验中的角色。开始时,脑信号用来检验模型与大脑之间有没有对应;随后,这种部分对应被转化成了可用于推断干预和参数训练的引导。

对脑启发人工智能而言,这是一条具体的研究路径。研究人员不必先证明模型与人脑完全一致,也不必照搬大脑的结构,而是从两者共享的部分表征关系中,提取可以改善任务表现的信息。

不过,当前实验主要聚焦基础演绎推理。语言模型与人脑在细粒度任务中的对应仍然有限,fMRI 的时间分辨率也难以追踪复杂思维中的快速变化。这些结果尚不能直接推广为对所有推理任务或现实问题都有效。

未来,时间分辨率更高的脑电图(EEG)、脑磁图(MEG),以及覆盖更复杂认知过程的神经数据,可能支持更细的分析与引导。更广泛任务中的有效性,也仍需要后续实验检验。

语言模型是否像人脑一样推理,仍有许多问题待回答。这项研究则先给出了一个可以继续验证的发现:模型与人脑之间部分共享的表征结构,不仅能被观察,也能成为改善模型推理的一种资源。

论文题目:Beyond representational alignment with brain-guided language models for robust reasoning

论文作者:肖命清、杜凯、林宙辰

论文链接:https://www.nature.com/articles/s42256-026-01278-w

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

微软 神经科学 北京大学 规律
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论