
ChatGPT 发布三年后,大语言模型(LLM)虽能生成流畅且看似权威的回答,但错误率依然居高不下。这种 " 一本正经胡说八道 " 的现象在各领域普遍存在:最新医学研究显示,模型在鉴别诊断方面的失败率超过 80%;智能体系统频繁调用不存在的工具;基准测试更揭示出,现有的准确性指标正在反向激励模型走向虚构。
" 灵媒效应 ":冷读术的数字化复刻
这一核心机制早在几年前便已被阐明。2023 年,一篇题为《LLM 灵媒效应》(The LLMentalist Effect)的文章指出,基于聊天的 LLM 本质上是在复制心理表演者的 " 冷读术 "。系统生成的回复在统计上具有合理性,营造出一种个性化且深刻的错觉,用户则主动填补其中的逻辑空白。怀疑者保持距离,而相信者则通过不断交互强化这种错觉。
冷读术依赖于看似具体实则宽泛的陈述,表演者通过观察反应进行调整,从而显得仿佛能读懂人心。LLM 的运行逻辑如出一辙:它们基于训练数据预测下一个词元(token),缺乏内部真理模型指导。当输出结果足够接近预期时,用户便误以为系统具备理解能力。
自我选择效应在其中扮演关键角色。质疑者很少花费大量时间进行提示工程,而被吸引的用户则会不断细化输入、提供上下文。模型将这些信号以精炼形式反馈,营造出协作式智能的假象。但实际上,主要是用户在提供信息,模型仅负责提供流畅性。
临床验证:高风险领域的系统性失效
随着模型规模扩大,这种效应并未消失。2026 年 9 月发表在《诊断成像》(Diagnostic Imaging)上的一项研究,测试了包括 GPT-5、Grok 4 和 Claude 4.5 Opus 在内的 21 个前沿模型。研究人员引入 PrIME-LLM 评分体系,评估模型在临床案例中的表现。
结果令人警醒:所有模型在鉴别诊断方面的失败率均高于 80%,最终诊断失败率也接近 40%。马萨诸塞州总医院布里格姆医院医疗工程解决方案孵化器负责人 Marc Succi 医生直言:" 关键不在于模型偶尔能否给出正确答案,而在于其能否在不确定环境和数据中可靠推理。" 他指出,在缺乏大量人类监督的情况下,当前的 LLM 尚不具备整合进临床实践的条件。
当数据清晰完整时,模型表现尚可;一旦信息杂乱或缺失,其猜测本质便暴露无遗。这再次印证了 " 灵媒 " 动态:给予足够线索,系统生成令人信服的回复;失去结构支撑,幻觉随即产生。
机制根源:训练目标与评估偏差
问题不仅在于个别错误,更源于深层的训练机制。2026 年 5 月,Adam Tauman Kalai 等人在《自然》(Nature)发表论文证明,下一词预测和以准确性为导向的评估奖励了 " 猜测行为 "。训练数据中仅出现一次的事实必然导致错误,而重复模式(如语法)则不会。作者通过学习理论形式化论证了这一点:幻觉率直接与单一事实的比例相关。
现有的评估体系加剧了这一困境。大多数基准测试采用封闭式评分,仅判定对错,不承认不确定性表达。在 SimpleQA 等测试中,一个回答所有问题但错误率高达 75% 的模型,得分可能高于一个在不确定时选择回避的模型。这种激励机制迫使系统倾向于自信输出,即便缓解技术降低了错误率,也可能因命中率下降而导致评分降低。
尽管学者呼吁采用开放式评分标准,明确奖励对不确定性的诚实表达,但行业仍依赖二元指标。排行榜优先考虑原始性能,专门针对幻觉的测试难以占据主导地位,制造虚假内容的压力依然存在。
智能体危机:工具幻觉与规模无效
工具使用引入了新的复杂性。2026 年 9 月 arXiv 发布的论文《对抗 LLM 智能体中工具幻觉的封闭世界解决》指出,模型会发明不存在的工具,并传递超出声明模式的参数。现有防御措施通常假设调用指向真实存在的事物,因此无法拦截完全虚构的调用。
研究人员在 10 个模型中记录了 322 次真实的工具幻觉。伪造调用在原始 JSON 接口上的频率远高于结构化接口。值得注意的是,规模并未带来显著改善:拥有 6750 亿参数的模型表现与 70 亿或 80 亿参数模型相似。当多个服务器合并为统一命名空间(如 Model Context Protocol)时,冲突和遮蔽甚至创造了新的幻觉表面,该论文统计了 154 例此类情况。
这些失败并非随机,而是源于相同的统计预测引擎。模型生成的文本看起来像有效的工具调用,仅因为训练数据中存在类似序列。由于缺乏对当前环境实际工具的接地理解,它只能捏造事实。正如心理表演者不知道你的秘密,模型也不知道 API 的真实状态,但它们都表现得自信满满。
现状与展望:风险持续上升
截至 2026 年 9 月,幻觉率依然高企。Artificial Analysis Omniscience Hallucination Rate 排行榜显示,即使是顶级模型的幻觉率也在 14% 或以上。Cohere 的 Command A+ 以 14.2% 的较低比率领先,其他模型多在 20% 以上。8 月份 ScienceDirect 的一份综合调查梳理了整个开发生命周期中的成因,指出尽管存在检测策略,但局限性显而易见。
多轮对话进一步恶化了问题。2026 年 8 月的 HalluHard 基准测试显示,在法律、医学等领域,即使配备网络搜索功能的 Claude Opus 4.5,其幻觉率也约为 30%;若无搜索功能,这一比率攀升至 60% 以上。错误在后续轮次中累积,早期失误引发连锁反应,导致推理链条断裂。
哲学界亦对此提出批评。2026 年 3 月《哲学》(Philosophies)期刊文章认为,LLM 缺乏将命题作为真值载体的内部表征,仅在词元层面工作。这导致事实话语无法有效约束生成过程,产生看似合理但现实中从未发生的组合。
面对现状,开发者正尝试多智能体设置、记忆系统及更严格的评估。一些精心编排的小模型在事实任务上已能匹配甚至超越大模型。但只要底层架构仍是下一个词元预测," 灵媒效应 " 便无法根除。
用户继续被流畅的输出吸引,假定其中包含推理;系统则验证用户的框架,反射其语言。双方信心同步增长,直到事实错误或工具调用失败打破幻象。行业内部深知这一点,但公共 discourse 仍滑向夸大。新的基准测试和排行榜层出不穷,数字虽有改善,核心问题依旧:这只是披着专家外衣的统计模式匹配,一个读取房间氛围而非现实世界的机械式 " 灵媒 "。
真正的进步将来自于更好的激励机制、透明的评估以及对局限性的诚实承认,而非假装错觉即智能。观众自我筛选,模型持续表演,演出仍在继续,但风险却在不断上升。
【星途科讯 图文丨 Patrick 首发于 ZAKER 科技,转载请注明出处】


登录后才可以发布评论哦
打开小程序可以发布评论哦