
发表在《iScience》期刊的一项新研究显示,GPT-4 能够在人类开始回答问题之前,估算出人群对人格问题的集体反应模式。
来自希伯来大学和海达萨医学院的研究人员测试了该模型是否能仅从语言中推断人类反应规律。团队利用 GPT-4 基于两份截然不同的文本来源创建了人格问卷:一份源自全球精神病学标准诊断手册《精神障碍诊断与统计手册第五版》(DSM-5),另一份则提取自一本占星术教科书。
在 600 名参与者填写问卷前,GPT-4 使用五点李克特量表预估了单个问题的平均得分。结果显示,模型的估计值与实际参与者的平均分高度相关:基于 DSM-5 的问题得分为 0.71,而基于占星术的问题得分竟高达 0.85。
尽管基于 DSM-5 的问卷展现出良好的内部一致性,符合临床诊断逻辑,但占星术问卷在大多数人格特质上的内部一致性较弱。不过,GPT-4 对两类问卷中问题间关系的估计均表现出较高相关性,分别为 0.74 和 0.69。研究人员认为,这表明 GPT-4 能够捕捉嵌入在语言和问卷内容中的群体层面反应倾向。
极端测试:从烤箱说明书推导人格
为测试模型极限,研究人员还向 GPT-4 提供了一份博世烤箱的使用说明书及《指环王》中的景观描述。尽管这些材料不含明确的人格信息,GPT-4 仍生成了类似人格评估的问卷项目。这一结果暗示,模型已在训练过程中习得了语言模式、人格描述与问卷结构之间的强关联。
然而,研究也指出,使用不相关的源材料可能导致题目语义薄弱或连接性差。统计结构分析显示,传统的大五人格问卷最符合预期组织结构,而 DSM 和占星术问卷的验证性因子模型拟合度较弱。此外,虽然基于占星术的测量在预测多种生活结果方面表现相当,但在心理健康结果方面的预测能力较差。
研究人员特别警告,预测平均反应并不等同于能准确测量个体的人格差异。主要作者 Rotem Monsa 表示,鉴于人格特质反映在语言中,大型语言模型可能在其训练过程中自然习得了人类人格的结构,即便它们并未专门接受过心理学教学。
【星途科讯 图文丨王宇洲 首发于 ZAKER 科技,转载请注明出处】


登录后才可以发布评论哦
打开小程序可以发布评论哦