量子位 昨天
中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

2026 年夏天,注定是自进化 AI的历史一刻。

当海外 NeoLab 还忙于靠叙事拿下数亿美元融资时,一家中国团队用连续三篇论文,交出了自进化 AI 领域第一份全栈答案。

它就是EverMind,由盛大集团孵化,延袭当年创新院研究基因。

其实回顾中国互联网史,盛大创新院的存在几乎算得上「异类」。

2008 年,陈天桥在盛大集团内部创立该机构,其定位不是做产品、也不追 KPI,就是纯粹地探索技术前沿。

这在那个流量为王、变现至上的互联网时代,其实是一种极为罕见的企业内研究文化。

彼时,这种模式在中国企业界几乎是开创性的。

十余年后,时代的底色已经从互联网切换到了 AI。

而盛大集团的战略布局,也已经集中到更为前沿的脑科学和人工智能方向——

近三年来,盛大 All in AI,在原有风险投资体系基础上,通过内部孵化机制在全球范围内广泛吸引顶尖 AI 人才,陆续孵化出多支专注于不同 AI 方向的研究型团队。

EverMind,正是其中一支。

如果说盛大创新院开创了中国企业内研究型组织的先河,那么 EverMind 的出现,则是这一基因在 AI 时代的延续与升华。

也正因如此,这支团队从一开始便选择了一条在商业上看似 " 最难 "、在技术上却 " 最根本 " 的路:

解决 AI 的长期记忆问题,并在此基础上,探索 AI 的自进化之路。

放至 2026 年的 AI 版图上,这个模式有了一个更为响亮的名字——NeoLab(新一代 AI 实验室)。

海外团队纷纷下注,NeoLab 浪潮狂飙

NeoLab这个词,最早是被用来描述那批从 OpenAI、Google DeepMind、Meta 等顶级 AI 机构出走、押注前沿技术方向独立创业的研究型团队。

他们的共同特征是:面向下一代 AI 技术、研究驱动和长期主义。

2026 年,这股浪潮已经汹涌到了无法忽视的程度:

比如,前 Salesforce 首席科学家 Richard Socher 与前 Meta FAIR 科学家总监田渊栋联合创立的Recursive Superintelligence(RSI)。

其在团队不足 30 人、尚无任何产品的情况下,拿到了 6.5 亿美元融资,估值高达 46.5 亿美元,并随即与 AWS 签署了 4.1 亿美元的多年算力合作协议。

DeepMind 的 AlphaGo 之父 David Silver 带着Ineffable Intelligence以 51 亿美元估值杀入战局。

Engram以 6 亿美元估值完成了 9800 万美元 A 轮融资,Adaption Labs以 10 亿美元估值拿到了 5000 万美元种子轮,Core Automation的估值目标直指 40 亿美元……

这些团队押注的核心命题,都指向同一个方向:如何让 AI 在部署后不再是一成不变的静物,而是能够通过自我迭代实现持续进化

这个方向,在学术上被称为递归自我改进(Recursive Self-Improvement),在产业上被称为自进化 AI(Self-Evolving AI)。

然而,当我们仔细审视这些估值惊人的 NeoLab 时,会发现他们大多仍停留在单点突破的理论探索阶段:

RSI:初步分享了先进的理念和路线设计,但尚未公布具体方案或成果;

Engram:专注于参数化权重记忆,但缺乏脚手架层的灵活进化机制;

Adaption Labs:主攻推理时适应,但没有长期技能沉淀体系;

Core Automation:方向最为接近,但也还没有公开的论文和开源生态。

就在海外团队还在各自的细分领域摸索时,EverMind 悄然完成了一件令人瞩目的事:

连续发布三篇重量级论文,从技能层脚手架层模型权重层,系统性地给出了一套完整的自进化 AI 技术答案。

一次对话,两个入口:当 RSI 遇上 EverMind

在深入这三篇论文之前,有一个细节值得单独记录。

今年四月,EverMind 主办了一场名为" 记忆起源 "(Memory Origins)的 Hackathon 活动。

在这场活动上,出现了一位特别的嘉宾—— Recursive Superintelligence(RSI)的联合创始人之一,田渊栋

田渊栋在活动上分享了他对 AI 记忆工作的深度理解,而彼时 RSI 融资的相关进展尚未披露。

在活动结束后,田渊栋与 EverMind 负责人邓亚峰共同接受了「硅谷创见汇」播客的采访,两人就 AI 行业的发展走向和记忆相关技术的前景进行了深入对谈。

在这次对话中,邓亚峰提出了一个核心判断,也透露了 EverMind 技术战略的脉络:

从长期记忆,结合持续学习,走向自我进化是下一代 AI 的核心技术路线。

这句话值得细细品味。

记忆,是 Agent 积累经验的载体;自进化,是把经验转化为能力跃升的路径

没有高质量的记忆,自进化就是无源之水;没有自进化作为目标,记忆就只是一个越来越大的档案馆。

EverMind 从 EverOS(记忆操作系统)到 Raven(自进化 Agent 框架),再到三篇自进化论文所构建的完整技术栈,正是这一判断的系统性实践。

田渊栋与邓亚峰在同一个舞台上的相遇,某种程度上也是一个隐喻:

当海外最顶尖的自进化研究者,与中国最具研究深度的记忆 AI 团队相遇,他们发现彼此正在从不同的入口,攀登同一座山峰。

为什么「自进化」重要且难?

在深入 EverMind 的技术细节之前,还需想清楚一件事:为什么 " 让 AI 自我进化 " 既是必答题,又是一道难题。

传统大语言模型一旦完成训练并部署,能力就被冻结了,不再随使用而增长。可人类智能最迷人的地方恰恰相反——每一次交流、每一次思考,我们都在悄然进化。

下一代 AI也理应如此:能够通过持续学习不断变得更聪明,而不是停在出厂那一刻。

而且这条路正在变得现实。

随着大模型能力的跃升,越来越多的案例表明,"AI 自主改进 AI"已经从设想走向可行,在某些环节甚至开始超越人类专家。

一旦 AI 能够稳定地自我改进,随之而来的很可能是一场生产力的跃迁。

但要真正做到这一点并不容易。业界通常有三条路径,每一条都横着一道难关。

脚手架(Harness)的自我改进,是第一道关卡。

一个 Agent 的实际表现,不仅取决于模型本身,更取决于包裹在模型外围的「脚手架」——提示词、注入的知识、运行时控制逻辑等。

让模型自己修改这些代码看似简单,真正的难点却在于如何避免过拟合:模型自我生成的反馈往往充满噪声,一个看似有效的修改,可能只是针对特定测试集的过拟合,换个场景就会导致灾难性崩溃

技能(Skills)的规模化管理,是第二道关卡。

当 Agent 把成功经验固化为可复用的技能文件,技能数量会爆炸式增长,那么如何管理这些碎片化、冗余、质量参差不齐的技能?又如何在一个数十万量级的技能库中,精准检索出当前任务真正需要的那几个?

这类工程问题长期被学术界忽视,却恰恰是产品能否落地的关键

模型权重(Weights)的训练信号分配,是第三道关卡。

在最底层的模型训练阶段,同策略自我蒸馏(On-Policy Self-Distillation,OPSD)是提升推理能力的有效手段。

但传统 OPSD 在处理长序列推理时,会把相同的监督权重均匀分配给每一个生成步骤,完全忽略了错误发生的时序上下文。这就像长跑时,无论你在起跑摔倒还是在终点前摔倒,教练的惩罚都一模一样。

如此粗颗粒度的信号分配,严重拖累了模型的学习效率。

EverMind 的三篇论文,正是分别瞄准这三道难关,各自给出了严谨的解法。

HarnessBank:让 Agent 学会安全改写「脚手架」

在实际部署中,模型权重往往是冻结的,修改 Agent 外围的 Harness成为了提升性能的最直接手段。

EverMind 在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》(https://arxiv.org/abs/2607.13683)一文中,提出了一套全新的框架:

它能够让 Agent 自主诊断失败并重写自己的运行逻辑,同时从根本上解决了自我改进中的过拟合问题。

这套框架的核心创新在于将" 提出变更 "" 归因变更 "彻底分离。

在过去的研究中,模型既当运动员又当裁判,自己写代码自己评估,极易产生幻觉式的性能提升。

而在 EverMind 的方案中,语言模型只负责诊断失败原因并提出补丁(Patch),所有的采样、测量和显著性检验全部交由确定性的代码逻辑来控制。

这一设计确保了每一个被系统认可的性能提升,在统计意义上都是绝对可靠的,而非测量误差或随机波动。

更有创新性的是其引入的装备基因库(Harness Gene Bank, HGB)机制

传统的自进化系统往往以 " 任务 " 为键(Key)来存储改进,这极易导致系统只学会了如何解决特定的几道题,换一个场景便原形毕露。

EverMind 则将每一份高性能脚手架以"WHERE × WHY"(改动作用在哪个环节、又是为何被引入)作为语义坐标存档,并支持通过故障诊断进行 " 重新发明 ",或跨单元进行 " 机制重组 ",防止搜索过程陷入崩溃或原地打转。

这种设计引入了强大的抗过拟合归纳偏置——系统学到的不是 " 如何解决这道题 ",而是 " 如何修复这类病理 "。

为了从大量候选后代脚手架中高效挑出真正有效的改进,团队还设计了分级装备筛选(Gated Harness Screening)机制,用有效性、激活、配对显著性、增益四道顺序闸门层层过滤,兼顾了评估成本与结果的可信度。

实验结果证明了这一设计的有效性。

团队默认以 Qwen3.6-27B 作为任务 Agent、Claude Opus 4.8 作为进化 Agent,在 Terminal-Bench-2、LiveCode、Omni-MATH、BrowseComp+、GDPval、AppWorld、SWE-bench 七个多样化基准上评测,并与 GEPA、DGM(Darwin G ö del Machine)两种当前最先进的自进化方法对比。

结果显示,在冻结任务 Agent 权重的情况下,HarnessBank 在全部七个基准上取得了5.1%15.4%的一致性能提升。

同时所有增益均通过了配对显著性检验(z ≥ 1.96),证明这些提升在统计意义上绝对可靠,而非测量误差或随机波动。

论文中还有一个极具启发性的发现:

跨模型实验证实,这些性能提升来自模型特异性的自进化过程,而不是存在某个放之四海而皆准的 " 万能脚手架 "。

获胜的补丁追踪的是模型的主导 " 病理 ",而不是模型的大小或家族。

也就是说,当你更换一个不同的基础模型时,主导病理会改变,对应的最优脚手架也会随之改变;但同样的病理 - 补丁匹配关系,会在不同的模型家族中重复出现。

这意味着,EverMind 构建的这套" 诊断 - 归因 " 循环机制,是一种可以跨模型迁移的元能力,证明了 AI for AI 的技术可行性。

SkillCorpus:10 万技能库背后的工程与科学

如果说 Harness 的自进化赋予了 Agent 重写逻辑的能力,那么" 技能 "(Skills)则是 Agent 沉淀经验的具体载体。

在 EverMind 的 Raven 框架中,内置了高达10 万项开箱即用的技能。

这并非简单的数量堆砌,其背后的工程与科学支撑,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》(https://arxiv.org/abs/2607.15557)。

随着开源社区中技能文件(如 Skill.md 格式)的爆发式增长,这些资产呈现出严重的碎片化、冗余和质量不均。

EverMind 团队构建了一个名为SkillCorpus的框架,首次在规模化层面上对开放技能生态进行了聚合、策展、匹配和评估。

这个过程堪称一场浩大的数字淘金。

团队从爬取的大约 82.1 万个原始技能中,通过多阶段多维度策略过滤,最终精选出 96401 个高质量技能。

为了管理这些技能,他们建立了一个包含 16 个类别的分类法,并从实用性(Utility)、鲁棒性(Robustness)和安全性(Safety)三个维度进行了严格的质量控制。

仅仅有库还不够,关键在于检索

EverMind 配合这个庞大的语料库,微调了一套专门的检索与选择技术栈,确保 Agent 在执行任务时能够精准匹配到相关的技能。

SkillsBench、GDPVal 和 QwenClawBench 三个基准测试中的端到端评估显示,自研的 Raven Harness 集成 SkillCorpus 后,Agent 在所有基准上均获得了稳定的性能提升,其中在 SkillsBench 上的提升最大,达到了 7.5 个百分点。

通过深入的运营分析,团队还识别出了技能带来的增益边界——

覆盖边界(技能库是否覆盖了任务所需的知识)和Harness 边界(Agent 的脚手架是否能有效调用技能),这为未来如何进一步优化技能检索和应用指明了方向。

这篇论文不仅是对 Raven 10 万技能库的技术解密,更是业界首个关于 " 经过策展和检索服务的社区技能库如何在真实 Agent 任务中发挥作用 " 的端到端系统性研究。

更进一步,技能并非一入库就固定不变。

无论是人工编写的技能,还是 AI 自动生成的技能,EverOS 都能依据任务执行的成败经验对其持续打磨。

用得好的被强化、被复用,用得差的被修正、被淘汰。

技能库因此不是一份静态清单,而是一个随任务不断自我进化、越用越强的资产,这也正是技能沉淀归属于任务层的原因所在。

DASH:让模型看清哪里出了错

自进化的最深层,是模型权重的自我迭代

EverMind 的最新论文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》(https://arxiv.org/pdf/2608.06243v1),展示了其在底层算法上的深厚功底。

传统的同策略自我蒸馏(OPSD)存在一个致命的时间盲区:

它对所有局部散度(即学生与教师的差异)分配相同的系数,完全忽略了错误发生的时间顺序和上下文。

EverMind 的研究团队通过对大量真实推理轨迹的分析,发现了一个关键现象:在一个推理序列中,局部散度值的大小与未来散度的演变之间,存在极弱的关联

这意味着,用同一个系数来处理所有时间步的散度,本质上是在用一把尺子量所有不同形状的错误,必然导致监督信号的严重失真。

为了解决这一问题,EverMind 提出了DASH(Divergence-Adaptive Supervision Horizons)。

DASH 的核心思想是将每个局部蒸馏信号与序列级均值之间的差距,转化为一个自适应的传播门(Propagation Gate),然后利用这些门控制向后的多步聚合。

当一个时间步的局部散度高于序列均值时,说明这里是一个高风险分叉点,DASH 会打开一个更大的传播门,让这个时间步的监督信号向前传播更远;反之,传播门收窄,避免无关紧要的步骤干扰整体学习。

实验结果令人印象深刻。

在 AIME 2024、AIME 2025 和 HMMT 2025 三个极具挑战性的数学推理基准上,DASH 在 Qwen3-1.7B、Qwen3-4B 和 Qwen3-8B 三个模型规模上均取得了所有对比方法中的最高分

在 Qwen3-1.7B 上,DASH 将三个基准的平均得分从 vanilla OPSD 的 41.87 提升至 45.07;在 Qwen3-8B 上,从 65.00 提升至 66.40。

更重要的是,DASH 不需要引入任何额外的教师或学生前向传递开销,这意味着这种性能提升几乎是免费的

EverMind 的自进化框架全景

EverMind 的自进化之路(四层框架)

在长期记忆领域已经贡献了数篇 ACL、KDD 等顶会高质量论文,并取得开源库 1.8 万 star 后,EverMind 继续分享对自进化演进的研究成果——

将自进化的完整路径,概括为一个从任务层到元改进层的四层递进体系

上述三篇论文构成的技术栈,与 EverMind 内部的产品和研究框架之间,存在着精密的映射关系:

1、任务层:

任务层是最直接的进化层次,进化在单次任务中即时发生。

优化对象是单次任务的执行质量,既包括记忆的提取与回写,也包括技能(Skills)的即时沉淀与复用;经验来源是 Context、Trace 与用户反馈,更新动作是即时回写,验证方式是结果与反馈。

这一层的能力复利是" 记得更牢、用得更顺、单次任务做得更好 ",价值定位是沉淀任务级、可复用的记忆与技能资产。

这正是 EverOS 与 SkillCorpus 所覆盖的核心场景。

2、脚手架层:

脚手架层(Harness)优化对象是Code 与 Policy,即 Agent 外围的运行逻辑与控制策略;经验来源是 Eval 与 Reflection,更新动作是脚手架的版本迭代,验证方式是 Agent Evals 复盘。

这一层的能力复利是" 更会执行 ",价值定位是可复用行为资产的持续积累。

这正是 Raven 框架与 Self-Evolving Harness 论文所对应的工作。

3、模型层:

模型层优化对象是模型本身,经验来源是高价值轨迹、偏好与失败样本,更新动作是 LoRA 与端侧模型的验证后灰度,验证方式是离线集加灰度测试。

这一层的能力复利是" 更准、更省 ",价值定位是个性化的专属模型能力。DASH 论文正是这一层的核心算法支撑。

4、元改进层:

元改进层是整个框架最令人兴奋的顶层。

优化对象是EvaluatorDataTraining Recipe本身,经验来源是多轮实验与 Benchmark,更新动作是优化 " 提出—选择—验证 " 的整个循环,验证方式是版本门槛加评测体系。

这一层的能力复利是" 下一轮进化更快、更可靠 ",价值定位是让改进能力本身也持续升级。

这个四层框架的深刻之处在于,它把自进化拆成了四个层层递进又彼此支撑的环节,并为每一层都配备了具体的技术路径与验证机制。

它不是一张空洞的愿景图,而是一个有工程细节、有学术支撑的完整路线图。

其实在今年 4 月,团队就率先提出了针对 Agent 自进化的评测基准EvoAgentBench,当月在 Hugging Face 同类 benchmark 上下载量第一。

这是一套用于衡量智能体从既往执行中提取并迁移能力效果的评测方法,为技能沉淀、脚手架迭代和模型优化提供统一、可比较的验证框架。

结合三篇论文从技术、脚手架到模型权重的系统性探索,EverMind 已将自进化能力建设由方法研究延伸至评测体系,形成更完整的技术闭环

对比海外坐标系,EverMind 走到了哪一步?

要理解 EverMind 这套完整技术栈的领先性,我们不妨将目光投向海外那些估值令人咋舌的 NeoLab。

Recursive Superintelligence(RSI)提出了宏大的 " 自动化 AI 研究闭环 " 理念,并拿到了 6.5 亿美元融资和 AWS 的 4.1 亿美元算力合作协议。

其第一阶段目标是训练一个具备 "5 万名博士 " 能力的系统来自动化 AI 科学研究本身。

然而,RSI 目前仍处于纯研发阶段,尚无成型的产品或框架落地,其公开结果仅限于在 GPU 内核算法优化基准上超越了人类两年的优化记录。

Engram以 6 亿美元估值完成了 9800 万美元 A 轮融资,其核心技术是基于稀疏记忆模块的参数化权重记忆(如 LoRA 微调)。

Engram 在降低推理成本和解决灾难性遗忘方面做出了出色工作,但其路径过于依赖底层权重的更新,缺乏在 Agent 脚手架(Harness)和外部技能库层面的灵活进化机制,且需要白盒访问模型权重,这在实际部署中是一个重大限制。

Adaption Labs(估值 10 亿美元)主攻无梯度推理时适应,试图通过动态解码和适配器组合来消除微调和提示词工程。

这在思路上与 EverMind 的 Harness 自进化有相似之处,但 Adaption Labs 缺乏如 SkillCorpus 这样庞大且经过策展的外部经验沉淀体系,也没有在底层训练算法上进行深度优化。

Core Automation(估值目标 40 亿美元)由前 OpenAI 研究副总裁 Jerry Tworek 创立,其旗舰项目 Ceres 专注于持续学习模型,目标是将训练数据需求降低 100 倍。

这是与 EverMind 方向最为接近的项目,但 Core Automation 目前仍在早期研发阶段,缺乏 EverMind 这样完整的技术栈和开源生态。

相比之下,EverMind 的独特之处在于其" 三层并发 "的战略纵深。

它没有陷入「参数化记忆」与「非参数化记忆」的非此即彼的争论,而是通过 EverOS(非参数化长期记忆)、Raven(Harness 自进化)和 DASH(底层权重训练优化)构建了一个全栈生态。

更重要的是,EverMind 坚持开源优先,通过在 GitHub 上积累的超过 1.2 万颗 Star(同期 mem0 为 7 千),正在迅速建立起类似Android的底层开发者生态护城河。

属于中国 NeoLab 的时刻到了

再往前,EverMind 团队相信:

下一代 AI,必然是一个能记住用户偏好、越用越聪明的 AI。

以长期记忆累积经验,以持续学习改进模型,真正走向 AI 的全栈自我进化,将是这一代 AI 最重要的技术路线。

这条路线一旦被打通,无论是数字世界里的 Agent、物理世界中的具身机器人,还是整个 AI for Science 领域,都将被深刻改变。

在互联网时代,盛大创新院曾是中国企业内研究文化的先行者,被后来的互联网及各领域巨头纷纷效仿;在 AI 时代,EverMind 也正在成为中国 NeoLab 浪潮中最具研究深度的代表之一。

仅仅一年间,团队就在长期记忆与自进化领域产出9 篇高质量论文,其中数篇被 ACL、KDD 等顶会录用。

这意味着 EverMind 的自进化不只是一个工程化产品,更有扎实的底层技术与严谨的学术支撑:

DASH让模型在训练时 " 看清自己错在哪里 ",Self-Evolving Harness让 Agent 在运行时安全地重写自身逻辑,SkillCorpus让 Agent 的成功经验被规模化地沉淀与复用。

三者合一,构成了一个从「感知错误」到「修改逻辑」再到「沉淀记忆」的完整自进化闭环。

但这条路,EverMind 并不想独自走完,团队诚挚邀请各领域的伙伴与之同行,一起共同构建 AI 长期记忆的基础设施,把持续学习与自我进化推向科学、具身、金融、智能硬件等更广阔的场景。

在定义「数字生命」下一个形态的道路上,中国的研究型团队,已经来了。

至于更精彩的部分,才刚刚开始。

HarnessBank 论文链接:https://arxiv.org/abs/2607.13683

SkillCorpus 论文链接:https://arxiv.org/abs/2607.15557

DASH 论文链接:https://arxiv.org/pdf/2608.06243v1

* 本文系量子位获授权刊载,观点仅为原作者所有。

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 互联网 kpi 融资 人工智能
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论