虎嗅APP 13小时前
给健忘的“天才”装上灵魂,成了一门值上亿的生意
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

出品|虎嗅科技组

作者|陈伊凡

播客整理|刘煊琦

编辑|苗正卿

头图|AI 生成

"AI 原生 100" 是虎嗅科技组推出针对 AI 原生创新栏目,这是本系列的第「65」篇文章,点击这段文字或扫描二维码收听 " 虎嗅 AI 100" 完整播客内容。

人工智能行业有一个不太体面的公开秘密:模型越来越聪明,却始终健忘。

今天的基座模型可以在奥数竞赛里拿金牌,写出让资深工程师汗颜的代码,但要它记住用户上周说过的话,它多半力不从心。每一次对话都像初次见面。业界给这种毛病起过许多体面的名字:上下文限制、会话隔离、无状态设计。这个行业造出了智商超群的天才,却没给它配一份像样的记忆。

技术上的根源在   Transformer   的注意力机制:上下文一旦拉长到几十   k,模型兼顾不同位置关键信息的能力便急剧衰减。把窗口从二十万字拉到两百万字,相当于给病人加大剂量,治不了病。行业真正缺的是一套独立于基座模型的记忆处理能力,这一层在今天的技术栈里几乎是空白。

过去三年,这件事一直被容忍,因为一个既写不了代码也办不成事的模型,记性好坏无关紧要。变化发生在最近两年:Coding Agent   能独立干完一个工程师一周的活,Agent   应用开始真正接管工作流。用郝建业的比喻,以前这个人连手脚都没有,记忆的价值无从体现;如今他已经能干很多事,人们才发现他缺的是灵魂。记忆从锦上添花变成了瓶颈本身。2026   年很多人认为是 " 记忆的元年 ",理由是在这一年,记忆这件事终于被人们看见。

资本已经闻到了味道。从   2025   年秋天到今年夏天中美欧至少有五家记忆公司拿到了新钱。

虎嗅根据公开信息整理

这几家里面只有   Engram   有公开估值,融的钱最多,走的是训练模型的路;Mem0、Supermemory、Cognee   不训练模型,靠调用现成大模型做抽取,再用数据库做存储和检索,差别只在存储结构。训练模型方面,Engram   和忆纪元的所采用的技术主张都是把记忆和推理分成两层,先解耦。

忆纪元(MemoraX AI)是这张名单里最年轻的一家。公司   2026   年   3   月在深圳成立,4   月完成千万美元种子轮,5   月又完成数千万人民币的种子 + 轮,7 月份完成数亿元种子 ++ 轮,半年不到三轮融资,累计数亿元人民币。两个月前,它与华为云签署战略合作,成为目前唯一在华为云上提供第三方记忆模型服务的公司。

忆纪元要解决的问题,用创始人郝建业的话说只有一件:训练一个记忆模型。用后训练得到一个专门的记忆模型,与基座模型解耦,对开发者只是多了一个可以调用的   API,对用户则是几百轮对话之后,人物设定和剧情逻辑依然不乱。这个位置还有一层商业上的合理性:记忆是   Agent   最核心的资产,涉及用户的个人数据和隐私,没有开发者愿意把它绑死在某一家基座模型上,一个中立的第三方记忆层因此有了存在的理由。

值得此时关注它的另一个原因,是这个赛道的混乱。钱涌进来的速度,远快于行业对 " 记忆 " 这个词达成共识的速度。一家公司说自己在做记忆,可能是外挂知识库,可能是拉长上下文窗口,也可能只是把最近几轮对话缓存下来再塞回去,三件在工程上几乎没有共通之处的事,挂着同一块招牌。

爱分析   8   月发布的《2026   爱分析 · 记忆市场研究报告》调研了二十多家记忆厂商,把它们分成五类,结论是它们做的是完全不同的生意:云厂商的记忆产品大多诞生在数据库部门,本能地把问题理解为存和取;模型厂商把记忆视作让自家模型多消耗   token   的增强件,从第一天起就锁在自己的生态里;企业应用公司从客服和营销的转化率倒推记忆该长什么样;消费级产品索性让用户直接为记忆付费。第五类是独立记忆平台,报告认为这一类最大的价值在于中立,不绑定任何一家模型或云,数据飞轮也因此转得更完整。

郝建业的履历横跨了两代   AI   技术。他读博时研究的是深度学习兴起之前的传统强化学习。2015   年到   2019   年在天津大学任教期间,他与网易、阿里等大厂合作,把深度强化学习落进了游戏   AI   和推荐搜索。2019   年他加入华为,此后六七年先后主持决策推理实验室和大模型算法实验室,并担任医疗军团技术总裁。他所在的团队是国内最早训练大规模   Transformer   的队伍之一,做了当时最大中文语料的盘古大模型预训练和后训练。2023   年起,他又从零孵化了华为的具身智能团队。他至今保留天津大学的教职,近两年在   ICML、NeurIPS、ICLR   三大会议上的论文产出进入全球前十,谷歌学术引用超过   1.5   万次。

2023   年的基座模型创业潮里,他没有出来。三年后他出来了,选了记忆,没选更热的具身,他说他更看重商业化闭环。

在长达两个小时的集中交流里,我们试图弄清三组问题,它们也是任何一家押注 " 记忆层 " 的公司迟早要回答的。

第一组关于技术:记忆能不能绕过去?拉长上下文窗口,或者对基座模型做后训练,为什么解决不了?基座模型的长上下文能力持续改善,解耦的记忆层会被增强,还是被吞掉?

第二组关于壁垒:训练一个记忆模型,稀缺的到底是什么?记忆数据属于个人隐私,数据飞轮如何转动?大厂做了,初创公司怎么办?

第三组关于生意:客户凭什么为记忆付费?一个单独的记忆模型,如何形成闭环的商业模式?

以下为虎嗅和郝建业的对话,虎嗅进行了精选和编辑:

记忆绕不过去:解耦是现在,一体化是终点

虎嗅:解决 " 记忆 " 这件事,不能通过模型自身的后训练实现吗?

郝建业:基模的注意力机制决定了上下文过长时,它难以兼顾不同位置的关键信息,更无法正确调取和利用。面对几百轮的超长上下文,不能将原始数据直接交给基模处理,必须分两步:先在数据流接收过程中完成自适应的高效压缩与记忆处理,再将处理后的记忆信息输入基模进行推理。

虎嗅:你们在技术路线上有哪些选择?为什么优先选了现在这一条?

郝建业:记忆的重要性已成共识,基模公司和大厂都在预研,但尚未出现公认收敛的技术方向。市面上主流的记忆解决方案是走数据库 + 规则的路径,基于   workflow   与规则调用大模型完成记忆全周期管理。但记忆管理本质是复杂优化问题,规则驱动自适应与泛化性均不足,无法做到 scaling。我们的核心特色是数据驱动,通过后训练的方式提升记忆模型的能力,谷歌、Meta、Engram   的主导路径与我们类似。

我们内部有三条技术路线并行推进:一是短期内可快速工程化落地的路线,在基模之外独立训练记忆模型并与基模协同推理,该路线已落地且效果显著;二是将记忆参数化或压缩至隐空间,实现更高效的记忆编辑、生成与管理,目前已取得阶段性正向结果;三是记忆模型与推理模型融合的统一架构,打造记忆与推理一体化的端到端大模型,由于注意力机制难以处理超长上下文,该路线可能需要采用线性甚至   RNN   架构,目前仍偏学术探索阶段。

无论解耦还是融合,背后均采用数据驱动、模型内生的后训练路线。核心能力有两方面:一是面向记忆能力的高效后训练架构,尤其是   Agent RL   推理训练架构;二是面向记忆模型训练的数据生产管线与训练和评估方法。三条路线均构建于这一基础之上,模型架构上遵循先解耦、后逐步融合的路径。

虎嗅:解耦和一体化相比,牺牲了什么?现在的记忆上限在哪里?

郝建业:  从最终上限看,一体化模式更高,推理效率、最终性能和规模化潜力都更强,现在的解耦方式也具备规模化能力,也能大幅降低推理成本。我们内部目前还没看到模型的记忆上限,过去几个月模型能力一直在持续提升。

虎嗅:这个记忆模块是嫁接在基模之上,还是单独的一套?基模在不断迭代,甚至可能出现颠覆   Transformer   的新架构,你们要一直跟着跑吗?

郝建业:  是单独的一套,和基座模型解耦,可以适配不同的基座。用户是无感的,只是多了一个可以调用的记忆模型 API。不同基模会有一定差异,但不大,因为记忆能力和基模本身的推理能力是相对正交的。

全新架构未来有可能会出现,我们内部也在探索,一旦颠覆性技术出现,现在的基础模型范式和市场格局都会变,但这不意味着推翻重来。最核心的还是怎么构造记忆数据、怎么做到高效的训练架构,以及背后训练的   know-how,至于模型是 Transformer   还是   RNN,是一个模型还是两个模型,本身并不重要。这些积累是我们团队最核心的技术竞争力,而且会基于 C 端产品打磨和 B 端行业应用,通过数据飞轮持续提升我们的能力壁垒。

虎嗅:你在内部最关注的一个 Benchmark 是什么?如何衡量一个记忆模型的好坏?

郝建业:记忆的评测非常重要,目前评测生态并不是太成熟。一方面我们在积极推动和一些高校和企业合作,打造不同行业(如 coding、金融、医疗等)的记忆评测标准。另外我们最近也在参与业界比较关注的 AML 榜单,它涵盖语言和 coding 两大类记忆能力评测,我们在第一届评测中也取得了第一名。我们也注意到最近南京大学、浙江大学和 Datawhale 等机构依托中国 CSIG 学会,也刚刚推出了第二届 AML 比赛,学术界和工业界都开始更加关注和积极推动记忆模型评测的生态构建。

壁垒:如何面对基础模型厂商的竞争

虎嗅:你在华为做过盘古大模型的训练,也做过医疗等行业的落地。这些经历和现在做一家专门针对记忆的公司有什么关联?

郝建业: 我们是国内最早一批做大规模   Transformer   训练的团队,但   ChatGPT   出来之前,业界尚未形成共识,没人敢说这条路一定能跑通。后来做行业大模型落地,又碰到一个现实问题:很多行业数据无法公开获取,比如医疗数据,只能在医院内部封闭环境中完成后训练与本地部署。

做记忆面临的是同样的问题。我们的目标是打造一套记忆基模,希望它能泛化到不同行业,但很多数据属于用户隐私,无法直接整合进统一的基座模型。为此,我们一方面构建了高效的自动化记忆数据合成管线,用于生产多样化训练数据;另一方面通过   C   端产品的用户反馈,以数据飞轮持续迭代记忆模型。面向行业应用时,则可按客户需求提供定制化记忆模型。过去在行业大模型落地与基模后训练中积累的   ——   从数据生产、模型后训练到工程化的整套能力,都可直接复用于记忆模型。

虎嗅:做内生记忆模型对团队的要求是什么?为什么是你们可以做,稀缺性在哪里?

郝建业:  最核心的有两点。第一,必须具备扎实的大模型训练能力与工程   know-how,真正完整做过基模后训练,覆盖从数据、训练到   infra   的全栈能力。从这个角度看,国内真正具备这一能力的团队可能只有个位数。第二,我们不止于模型本身,还要面向多场景完成产品化与落地,因此工程和产品能力同样关键。我们是一支复合型团队,既有来自头部大厂基模团队的核心成员,也有具备丰富工程化与产品落地经验的同学。

虎嗅:数据飞轮什么时候能转起来?转起来之后是什么样?

郝建业:  数据飞轮已经启动,目前处于数据规模持续积累的阶段。以   C   端产品为例,用户可基于日常使用对记忆模型的输出标注正负反馈,这些反馈类似基模训练中的偏好样本,我们通过强化学习将其反向用于模型更新,每日产生的大量反馈持续驱动模型迭代。整体逻辑与基模的数据闭环类似,区别在于训练目标聚焦于记忆任务的持续优化。

飞轮真正转起来之后,会形成一个正向循环:数据越多,记忆越精准,用户体验越好,用户规模越大,进而产生更多高质量数据。内部核心记忆模型研发、C   端产品、B   端应用三支团队共用同一套记忆引擎,产品侧的反馈数据输入模型团队,迭代后的模型再反哺各业务场景。

虎嗅:记忆这件事,基础模型厂商做了你们怎么办?未来的竞争对手来自哪一类公司?

郝建业:基模公司肯定也会做自己的记忆能力,我们也看到一些基础模型产品已经具备基本的记忆能力,但更多还是通过文件和规则化的方式来做记忆管理。我们认为记忆是一个独立的 AI 基础设施层,而不是基础模型的附属功能。初创公司和大厂都在布局,最关键的是先把生态做起来,抓住先发优势,找到自己的市场位置。

但我们是从第三方的视角建立一个相对中立的、统一的记忆基础设施层。基础模型公司做记忆,必然会绑定自己的基础模型。但实际上,很多   Agent   公司不会只使用某一个基础模型的   API,它会用不同类型的基础模型去自适应地完成任务。

所以对我们来讲,最大的价值在于保持记忆模型的中立性。记忆模型承载的是用户或   Agent   产品最核心的数据资产,所以做一个第三方中立的记忆模型公司,它的重要性是不可替代的。云厂商方面,两个月前我们和华为云签署了战略合作,是目前唯一给华为云提供记忆模型服务的公司,赋能它下游的各类   agent   行业客户,双方互惠互利。国外的 AWS,微软 Azure 也都在和我们积极推进战略合作。

虎嗅:开源还是闭源?

郝建业:  会考虑开源,因为记忆模型领域不是短期能成熟的,我们希望把生态做起来,但高阶模型版本不会马上开源;工具和平台侧的内容会开源,也可能开源   memory   训练的架构,就像   DeepSeek   之前开源部分推理架构。

生意:先记住程序员和玩家,再向行业收 token 费

虎嗅:商业化路径在创业之前就想好了吗?先从哪些场景切入?为什么   C   端选了   coding   和泛娱乐?

郝建业: 我们选择的核心原则是哪些场景对记忆能力是刚需,而且有成熟的商业模式和可预期的用户增长空间。一个是面向 coding agent   的记忆产品,解决程序员项目开发过程中上下文超出上限的问题,通过沉淀开发者的历史经验、编码规范与编程习惯,提升个人及团队开发效率并降低成本。选 coding 场景有两个原因:它本身是对记忆能力刚需的场景,也是目前商业化最成熟的场景。另一个是面向泛娱乐场景的记忆引擎。用户可以在非常复杂的剧情里和不同角色自由交互、改变剧情,记忆引擎实时做在线剧情推演,这是现在市面上所有产品都做不到的,我们认为有望打造出具有跨代效应的交互式 C 端产品。这个引擎我们自己在做产品探索,也会开放给创作者使用。

虎嗅:当时去融资,给投资人讲的故事是什么?To B   和   To C   怎么平衡?

郝建业:ToB 目前我们不会铺开做海量定制业务,现阶段优先和行业头部大   B   做标杆性落地,待数据飞轮成熟后,再将通用记忆能力向中小客户规模化辐射。

去年融资时,资本市场对记忆技术还没有形成共识。今年大家基本达成了共识,很多人认为今年是记忆元年。投资人、各行业的开发人员、产品人员等,都不需要再解释为什么要做记忆,大家更关心的是到底怎么做、怎么解决背后的问题。

虎嗅:B   端和   C   端的付费模式有什么不一样?和现在大众普遍采用的方案相比,成本更贵还是更便宜?

郝建业:  C   端主要采用基础月费加额外订阅付费。B   端分两种:中小   B   端按   token   付费;大 B 端更灵活,可以是   SaaS   模式,也可以是研发费加   API   调用费的组合,部分大 B 的业务数据差异很大,往往需要做定制化训练。

我们的方案成本上更低。现在常规方案是规则加调用大模型,用大模型效果好但成本和延迟高,用小模型效果很差。我们经过后训练的记忆模型,可以用更低的成本实现更好的性能。

虎嗅:在记忆模型商业化的过程中,最难的一个环节是什么?

郝建业:首先最核心在于能否让记忆能力持续 scaling。这不是靠单一算法的突破,而是涉及数据生产、模型架构到 infra 的全栈技术协同 ——任何一个环节的瓶颈,都会限制模型能力的上限。其次是场景选择,必须优先找到对记忆需求最强的场景切入,才能在真实使用中形成数据飞轮,让模型越用越好。除此之外,还有信任与隐私的问题:记忆存储的是用户的长期行为和偏好,用户愿不愿意把记忆交给你、企业客户的合规要求如何满足。

虎嗅:除了记忆,你最近关注什么?它和记忆模型有什么关系?

郝建业:  物理   AI   和世界模型。华为的具身团队是我孵化出来的,在学校也有一个专门做世界模型的科研团队。这两件事关联性很强:记忆模型现在主要解决语言模型和多模态模型的上下文爆炸问题;世界模型在视觉空间里做物理规律的预测,现在只能生成比较短的视频,生成不了较长的物理世界预测,就很难完成稳定可靠的任务。世界模型可能还处在   GPT   之前几年的阶段,一旦到了   GPT   的阶段,它同样会面临超长上下文的管理问题,可以用记忆模型加世界模型的方式来解决。

虎嗅:那万一这个具身的   GPT   时刻没办法来怎么办?做业务是要做没法证伪的事,还是商业化闭环更重要?

郝建业: 任何一家技术公司都需要平衡 " 技术理想 " 和 " 商业生存 ",两者不是二选一。具身智能的长期价值毋庸置疑,但它的 "GPT 时刻 " 何时到来存在较大不确定性。而记忆模型则不同 — 它的需求是当下即可验证的,商业模式是清晰的,技术壁垒也是真实存在的。记忆对具身场景本身也是刚需:具身智能体要在物理世界中长期运行、持续学习,必然依赖长期记忆能力。我们选择了一条商业确定性更高、同时天花板足够高的路径 —— 即使具身的 "GPT 时刻 " 到来,记忆也会是不可或缺的核心基础设施。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 纪元 虎嗅 华为云 工程师
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论