给 Agent 加记忆,业界的主流做法是让它记住 " 用户说过什么 "。但工业场景里更缺的记忆,是 " 这家企业的数据语义 " ——指标的分子分母是什么,同一个工单号在不同表里有几种写法。
卡奥斯 COSMOPlat & 工业智能首席科学家余锦泽博士在 QCon 上海站 "Agent 自主进化:从记忆到持续学习 " 专题中,分享了一个反直觉的实测结果:只注入实体与关系、不带指标口径,回答正确率反而低于完全不注入。模型会更自信地选错表。
他的判断是:企业语义记忆是需要治理的资产——写入有裁决、冲突有消解、经验能沉淀、错误可撤销。
记忆不在对话流里,在数仓和代码里
Mem0、Zep(时序知识图谱)、Letta/MemGPT 等框架解决的是 " 跨会话记住用户 ",记忆主要来自对话与交互流。工业多智能体要记的不是用户偏好,而是 " 直通率的分子分母是什么、工单号在不同表里有几种写法 "。
这些语义不产生于对话,藏在数仓表结构、建表代码与工艺文档里,且没有外键、命名晦涩。学界正在讨论记忆污染(memory contamination),企业场景的代价是口径错账。
余锦泽给出的记忆结构包含六要素:对象、关系、事件、指标、动作、场景。每条记忆带证据等级——数据验证(verified)、人工断言(asserted)、缺口(gap)。与业界情景记忆 / 语义记忆分层的区别在于:置信等级由真实数据裁决产生,不由模型自评。
写入把关:大模型只提议,真实数据裁决
写入侧有四道判据,缺一不可:取值重叠度须过阈值、子键不唯一、父键接近唯一、列名有据可依。通不过的降为候选,不入正式记忆。
踩过的坑之一是时序假象。同一对字段在单日窗口下取值完全重合,看上去就是一条真关系,窗口拉长到一个月即崩塌。因此采样窗口不足一律不予写入。
冲突消解有三招:
时间轴校验,排除巧合性重合
双源融合,代码中的 JOIN 证据优先于命名推断
对抗评审,独立评审多数否决即打回重抽
另一个坑是人工断言冒充数据验证。早期实现允许把人工确认写成 verified,记忆置信被悄悄稀释。现在这条纪律写进接口签名——人审只产生 " 断言 ",verified 只能由数据裁决产生。
与业界方案的分工上,时序知识图谱记忆(如 Zep 的双时序边)回答 " 事实何时有效 ";这套方案在企业库场景回答 " 这条记忆该不该写入 "。两者是记忆生命周期的两端,可互补。
共享与调度:按对象锚定动态构建上下文
多个智能体读写同一套语义," 工单 " 在所有 Agent 中是同一个 " 工单 "。写权限唯一收口——大模型唯一的写路径是把自然语言翻译成带类型的受治理操作,预览、人审后落盘,全程可回滚。
使用侧按问句锚定对象,沿已验证关系召回子图,挂上指标口径与术语,成套注入。只注入锚定命中的子图而非全图,兼顾上下文长度与成本。
第三个坑是存而不用:数百条中英术语词典建成后,检索链路曾长期没有消费它。由此提出 " 消费方审计 " ——每新增一类记忆,必须答得出 " 它的消费方在哪 "。
记忆还用于指代消解,本体即实体注册表。多轮对话中的指代(" 它/该产线 ")显式回填上文命中的对象,不引入通用 NLP 组件。中文表名后缀剥离—— " 销售订单事实表 " 须按 " 销售订单 " 命中。
答案同屏给出指标口径卡(计算口径、出处表列、血缘入口);实体未在记忆中命中即明确拒答,不做无锚定的自由生成。
经验沉淀:教训固化为代码而非文档
把建模教训做成可插拔的提示词组件注入构建流程。对比实验显示:注入 " 建模规范 " 组件后,对象与关系候选大幅收敛、已验证占比明显上升、关系动词全部落入白名单。
踩过的坑各有归宿:时序假象固化为采样窗口判据,断言冒充固化为接口签名,存而不用固化为消费方审计清单,跨引擎模型名错配固化为运行时模型族校验,数据对不上账固化为分层对账检查项。
证据回流路径是:用户反馈→评审队列→记忆修订→下游即时生效。评审否决一条关系,引用它的查询立即被拦截。版本快照与一键撤销保证记忆修订可逆。
持续学习的度量靠自建金标评测集—— Spider、BIRD 等公开基准覆盖不了企业口径与脏数据,金标先在库上实跑校准。评测暴露的 " 记忆的病 " 往往是数据的病:汇总层与明细层对不上账,处置是把分层对账固化为数据质量检查项。
边界与取舍:什么时候不需要这套记忆
写入把关有覆盖率代价。宁缺勿滥会把部分真知识挡在正式记忆之外,选择是 " 缺口透明 " 而非 " 虚假完整 ",代价是冷启动阶段记忆覆盖有限。
前置条件是:指标口径要有人拍板,这是管理问题不是技术问题。单表能答、口径唯一的场景,一条 SQL 就够。
共享记忆的写治理成本同样存在:写权限必须唯一收口、高风险改动必须人审,换来一致性与可追责,代价是写入吞吐受限,不适合高频自动写入的场景。
遗忘与审计之间存在张力。错误记忆要能撤销,但审计要求留痕,采用 " 降级候选+版本快照 " 而非物理删除,存储与检索都要为历史版本付成本。
判据阈值是工程经验值。取值重叠度、父键唯一性等判据的阈值来自实践调优而非理论最优,跨行业迁移时需要重新标定,且每条判定都要留下依据供复核。自建合成基准可复现、金标可校准,但规模有限,不等于真实客户库表现。
收束成一句:记忆不是缓存,是需要治理的资产。


登录后才可以发布评论哦
打开小程序可以发布评论哦