摸鱼算法 11小时前
只注入一半语义,Agent正确率反而低于不注入
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

 

给 Agent 加记忆,业界的主流做法是让它记住 " 用户说过什么 "。但工业场景里更缺的记忆,是 " 这家企业的数据语义 " ——指标的分子分母是什么,同一个工单号在不同表里有几种写法。

卡奥斯 COSMOPlat & 工业智能首席科学家余锦泽博士在 QCon 上海站 "Agent 自主进化:从记忆到持续学习 " 专题中,分享了一个反直觉的实测结果:只注入实体与关系、不带指标口径,回答正确率反而低于完全不注入。模型会更自信地选错表。

他的判断是:企业语义记忆是需要治理的资产——写入有裁决、冲突有消解、经验能沉淀、错误可撤销。

记忆不在对话流里,在数仓和代码里

Mem0、Zep(时序知识图谱)、Letta/MemGPT 等框架解决的是 " 跨会话记住用户 ",记忆主要来自对话与交互流。工业多智能体要记的不是用户偏好,而是 " 直通率的分子分母是什么、工单号在不同表里有几种写法 "。

这些语义不产生于对话,藏在数仓表结构、建表代码与工艺文档里,且没有外键、命名晦涩。学界正在讨论记忆污染(memory contamination),企业场景的代价是口径错账。

余锦泽给出的记忆结构包含六要素:对象、关系、事件、指标、动作、场景。每条记忆带证据等级——数据验证(verified)、人工断言(asserted)、缺口(gap)。与业界情景记忆 / 语义记忆分层的区别在于:置信等级由真实数据裁决产生,不由模型自评。

写入把关:大模型只提议,真实数据裁决

写入侧有四道判据,缺一不可:取值重叠度须过阈值、子键不唯一、父键接近唯一、列名有据可依。通不过的降为候选,不入正式记忆。

踩过的坑之一是时序假象。同一对字段在单日窗口下取值完全重合,看上去就是一条真关系,窗口拉长到一个月即崩塌。因此采样窗口不足一律不予写入。

冲突消解有三招:

时间轴校验,排除巧合性重合

双源融合,代码中的 JOIN 证据优先于命名推断

对抗评审,独立评审多数否决即打回重抽

另一个坑是人工断言冒充数据验证。早期实现允许把人工确认写成 verified,记忆置信被悄悄稀释。现在这条纪律写进接口签名——人审只产生 " 断言 ",verified 只能由数据裁决产生。

与业界方案的分工上,时序知识图谱记忆(如 Zep 的双时序边)回答 " 事实何时有效 ";这套方案在企业库场景回答 " 这条记忆该不该写入 "。两者是记忆生命周期的两端,可互补。

共享与调度:按对象锚定动态构建上下文

多个智能体读写同一套语义," 工单 " 在所有 Agent 中是同一个 " 工单 "。写权限唯一收口——大模型唯一的写路径是把自然语言翻译成带类型的受治理操作,预览、人审后落盘,全程可回滚。

使用侧按问句锚定对象,沿已验证关系召回子图,挂上指标口径与术语,成套注入。只注入锚定命中的子图而非全图,兼顾上下文长度与成本。

第三个坑是存而不用:数百条中英术语词典建成后,检索链路曾长期没有消费它。由此提出 " 消费方审计 " ——每新增一类记忆,必须答得出 " 它的消费方在哪 "。

记忆还用于指代消解,本体即实体注册表。多轮对话中的指代(" 它/该产线 ")显式回填上文命中的对象,不引入通用 NLP 组件。中文表名后缀剥离—— " 销售订单事实表 " 须按 " 销售订单 " 命中。

答案同屏给出指标口径卡(计算口径、出处表列、血缘入口);实体未在记忆中命中即明确拒答,不做无锚定的自由生成。

经验沉淀:教训固化为代码而非文档

把建模教训做成可插拔的提示词组件注入构建流程。对比实验显示:注入 " 建模规范 " 组件后,对象与关系候选大幅收敛、已验证占比明显上升、关系动词全部落入白名单。

踩过的坑各有归宿:时序假象固化为采样窗口判据,断言冒充固化为接口签名,存而不用固化为消费方审计清单,跨引擎模型名错配固化为运行时模型族校验,数据对不上账固化为分层对账检查项。

证据回流路径是:用户反馈→评审队列→记忆修订→下游即时生效。评审否决一条关系,引用它的查询立即被拦截。版本快照与一键撤销保证记忆修订可逆。

持续学习的度量靠自建金标评测集—— Spider、BIRD 等公开基准覆盖不了企业口径与脏数据,金标先在库上实跑校准。评测暴露的 " 记忆的病 " 往往是数据的病:汇总层与明细层对不上账,处置是把分层对账固化为数据质量检查项。

边界与取舍:什么时候不需要这套记忆

写入把关有覆盖率代价。宁缺勿滥会把部分真知识挡在正式记忆之外,选择是 " 缺口透明 " 而非 " 虚假完整 ",代价是冷启动阶段记忆覆盖有限。

前置条件是:指标口径要有人拍板,这是管理问题不是技术问题。单表能答、口径唯一的场景,一条 SQL 就够。

共享记忆的写治理成本同样存在:写权限必须唯一收口、高风险改动必须人审,换来一致性与可追责,代价是写入吞吐受限,不适合高频自动写入的场景。

遗忘与审计之间存在张力。错误记忆要能撤销,但审计要求留痕,采用 " 降级候选+版本快照 " 而非物理删除,存储与检索都要为历史版本付成本。

判据阈值是工程经验值。取值重叠度、父键唯一性等判据的阈值来自实践调优而非理论最优,跨行业迁移时需要重新标定,且每条判定都要留下依据供复核。自建合成基准可复现、金标可校准,但规模有限,不等于真实客户库表现。

收束成一句:记忆不是缓存,是需要治理的资产。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

上海 gap 污染
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论