2026年夏天,注定是自进化AI的历史一刻。


当海外NeoLab还忙于靠叙事拿下数亿美元融资时,一家中国团队用连续三篇论文,交出了自进化AI领域第一份全栈答案。


它就是EverMind,由盛大集团孵化,延袭当年创新院研究基因。


其实回顾中国互联网史,盛大创新院的存在几乎算得上「异类」


2008年,陈天桥在盛大集团内部创立该机构,其定位不是做产品、也不追KPI,就是纯粹地探索技术前沿。


这在那个流量为王、变现至上的互联网时代,其实是一种极为罕见的企业内研究文化。


彼时,这种模式在中国企业界几乎是开创性的。


中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷


十余年后,时代的底色已经从互联网切换到了AI。


而盛大集团的战略布局,也已经集中到更为前沿的脑科学和人工智能方向——


近三年来,盛大All in AI,在原有风险投资体系基础上,通过内部孵化机制在全球范围内广泛吸引顶尖AI人才,陆续孵化出多支专注于不同AI方向的研究型团队。


EverMind,正是其中一支。


中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷


如果说盛大创新院开创了中国企业内研究型组织的先河,那么EverMind的出现,则是这一基因在AI时代的延续与升华。


也正因如此,这支团队从一开始便选择了一条在商业上看似“最难”、在技术上却“最根本”的路:


解决AI的长期记忆问题,并在此基础上,探索AI的自进化之路。


放至2026年的AI版图上,这个模式有了一个更为响亮的名字——NeoLab(新一代AI实验室)。


海外团队纷纷下注,NeoLab浪潮狂飙


NeoLab这个词,最早是被用来描述那批从OpenAI、Google DeepMind、Meta等顶级AI机构出走、押注前沿技术方向独立创业的研究型团队。


他们的共同特征是:面向下一代AI技术、研究驱动和长期主义。


2026年,这股浪潮已经汹涌到了无法忽视的程度:


比如,前Salesforce首席科学家Richard Socher与前Meta FAIR科学家总监田渊栋联合创立的Recursive Superintelligence(RSI)。


其在团队不足30人、尚无任何产品的情况下,拿到了6.5亿美元融资,估值高达46.5亿美元,并随即与AWS签署了4.1亿美元的多年算力合作协议。


DeepMind的AlphaGo之父David Silver带着Ineffable Intelligence以51亿美元估值杀入战局。


Engram以6亿美元估值完成了9800万美元A轮融资,Adaption Labs以10亿美元估值拿到了5000万美元种子轮,Core Automation的估值目标直指40亿美元……


这些团队押注的核心命题,都指向同一个方向:如何让AI在部署后不再是一成不变的静物,而是能够通过自我迭代实现持续进化


这个方向,在学术上被称为递归自我改进(Recursive Self-Improvement),在产业上被称为自进化AI(Self-Evolving AI)。


然而,当我们仔细审视这些估值惊人的NeoLab时,会发现他们大多仍停留在单点突破的理论探索阶段:


  • RSI:初步分享了先进的理念和路线设计,但尚未公布具体方案或成果;
  • Engram:专注于参数化权重记忆,但缺乏脚手架层的灵活进化机制;
  • Adaption Labs:主攻推理时适应,但没有长期技能沉淀体系;
  • Core Automation:方向最为接近,但也还没有公开的论文和开源生态。


就在海外团队还在各自的细分领域摸索时,EverMind悄然完成了一件令人瞩目的事:


连续发布三篇重量级论文,从技能层脚手架层模型权重层,系统性地给出了一套完整的自进化AI技术答案。


一次对话,两个入口:当RSI遇上EverMind


在深入这三篇论文之前,有一个细节值得单独记录。


今年四月,EverMind主办了一场名为“记忆起源”(Memory Origins)的Hackathon活动。


在这场活动上,出现了一位特别的嘉宾——Recursive Superintelligence(RSI)的联合创始人之一,田渊栋


中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷


田渊栋在活动上分享了他对AI记忆工作的深度理解,而彼时RSI融资的相关进展尚未披露。


在活动结束后,田渊栋与EverMind负责人邓亚峰共同接受了「硅谷创见汇」播客的采访,两人就AI行业的发展走向和记忆相关技术的前景进行了深入对谈。


在这次对话中,邓亚峰提出了一个核心判断,也透露了EverMind技术战略的脉络:


从长期记忆,结合持续学习,走向自我进化是下一代AI的核心技术路线。


这句话值得细细品味。


记忆,是Agent积累经验的载体;自进化,是把经验转化为能力跃升的路径


没有高质量的记忆,自进化就是无源之水;没有自进化作为目标,记忆就只是一个越来越大的档案馆。


EverMind从EverOS(记忆操作系统)到Raven(自进化Agent框架),再到三篇自进化论文所构建的完整技术栈,正是这一判断的系统性实践。


中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷


田渊栋与邓亚峰在同一个舞台上的相遇,某种程度上也是一个隐喻:


当海外最顶尖的自进化研究者,与中国最具研究深度的记忆AI团队相遇,他们发现彼此正在从不同的入口,攀登同一座山峰。


为什么「自进化」重要且难?


在深入EverMind的技术细节之前,还需想清楚一件事:为什么“让AI自我进化”既是必答题,又是一道难题。


传统大语言模型一旦完成训练并部署,能力就被冻结了,不再随使用而增长。可人类智能最迷人的地方恰恰相反——每一次交流、每一次思考,我们都在悄然进化。


下一代AI也理应如此:能够通过持续学习不断变得更聪明,而不是停在出厂那一刻。


而且这条路正在变得现实。


随着大模型能力的跃升,越来越多的案例表明,“AI自主改进AI”已经从设想走向可行,在某些环节甚至开始超越人类专家。


一旦AI能够稳定地自我改进,随之而来的很可能是一场生产力的跃迁。


但要真正做到这一点并不容易。业界通常有三条路径,每一条都横着一道难关。


脚手架(Harness)的自我改进,是第一道关卡。


一个Agent的实际表现,不仅取决于模型本身,更取决于包裹在模型外围的「脚手架」——提示词、注入的知识、运行时控制逻辑等。


让模型自己修改这些代码看似简单,真正的难点却在于如何避免过拟合:模型自我生成的反馈往往充满噪声,一个看似有效的修改,可能只是针对特定测试集的过拟合,换个场景就会导致灾难性崩溃


技能(Skills)的规模化管理,是第二道关卡。


当Agent把成功经验固化为可复用的技能文件,技能数量会爆炸式增长,那么如何管理这些碎片化、冗余、质量参差不齐的技能?又如何在一个数十万量级的技能库中,精准检索出当前任务真正需要的那几个?


这类工程问题长期被学术界忽视,却恰恰是产品能否落地的关键


模型权重(Weights)的训练信号分配,是第三道关卡。


在最底层的模型训练阶段,同策略自我蒸馏(On-Policy Self-Distillation,OPSD)是提升推理能力的有效手段。


但传统OPSD在处理长序列推理时,会把相同的监督权重均匀分配给每一个生成步骤,完全忽略了错误发生的时序上下文。这就像长跑时,无论你在起跑摔倒还是在终点前摔倒,教练的惩罚都一模一样。


如此粗颗粒度的信号分配,严重拖累了模型的学习效率。


EverMind的三篇论文,正是分别瞄准这三道难关,各自给出了严谨的解法。


HarnessBank:让Agent学会安全改写「脚手架」


在实际部署中,模型权重往往是冻结的,修改Agent外围的Harness成为了提升性能的最直接手段。


EverMind在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》(https://arxiv.org/abs/2607.13683)一文中,提出了一套全新的框架:


它能够让Agent自主诊断失败并重写自己的运行逻辑,同时从根本上解决了自我改进中的过拟合问题。


中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷


这套框架的核心创新在于将“提出变更”“归因变更”彻底分离。


在过去的研究中,模型既当运动员又当裁判,自己写代码自己评估,极易产生幻觉式的性能提升。


而在EverMind的方案中,语言模型只负责诊断失败原因并提出补丁(Patch),所有的采样、测量和显著性检验全部交由确定性的代码逻辑来控制。


这一设计确保了每一个被系统认可的性能提升,在统计意义上都是绝对可靠的,而非测量误差或随机波动。


更有创新性的是其引入的装备基因库(Harness Gene Bank, HGB)机制


传统的自进化系统往往以“任务”为键(Key)来存储改进,这极易导致系统只学会了如何解决特定的几道题,换一个场景便原形毕露。


EverMind则将每一份高性能脚手架以“WHERE × WHY”(改动作用在哪个环节、又是为何被引入)作为语义坐标存档,并支持通过故障诊断进行“重新发明”,或跨单元进行“机制重组”,防止搜索过程陷入崩溃或原地打转。


这种设计引入了强大的抗过拟合归纳偏置——系统学到的不是“如何解决这道题”,而是“如何修复这类病理”。


为了从大量候选后代脚手架中高效挑出真正有效的改进,团队还设计了分级装备筛选(Gated Harness Screening)机制,用有效性、激活、配对显著性、增益四道顺序闸门层层过滤,兼顾了评估成本与结果的可信度。


实验结果证明了这一设计的有效性。


团队默认以Qwen3.6-27B作为任务Agent、Claude Opus 4.8作为进化Agent,在Terminal-Bench-2、LiveCode、Omni-MATH、BrowseComp+、GDPval、AppWorld、SWE-bench七个多样化基准上评测,并与GEPA、DGM(Darwin Gödel Machine)两种当前最先进的自进化方法对比。


结果显示,在冻结任务Agent权重的情况下,HarnessBank在全部七个基准上取得了5.1%15.4%的一致性能提升。


同时所有增益均通过了配对显著性检验(z≥1.96),证明这些提升在统计意义上绝对可靠,而非测量误差或随机波动。


中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷


论文中还有一个极具启发性的发现:


跨模型实验证实,这些性能提升来自模型特异性的自进化过程,而不是存在某个放之四海而皆准的“万能脚手架”。


获胜的补丁追踪的是模型的主导“病理”,而不是模型的大小或家族。


也就是说,当你更换一个不同的基础模型时,主导病理会改变,对应的最优脚手架也会随之改变;但同样的病理-补丁匹配关系,会在不同的模型家族中重复出现。


这意味着,EverMind构建的这套“诊断-归因”循环机制,是一种可以跨模型迁移的元能力,证明了AI for AI的技术可行性。


SkillCorpus:10万技能库背后的工程与科学


如果说Harness的自进化赋予了Agent重写逻辑的能力,那么“技能”(Skills)则是Agent沉淀经验的具体载体。


在EverMind的Raven框架中,内置了高达10万项开箱即用的技能。


这并非简单的数量堆砌,其背后的工程与科学支撑,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》(https://arxiv.org/abs/2607.15557)。


随着开源社区中技能文件(如Skill.md格式)的爆发式增长,这些资产呈现出严重的碎片化、冗余和质量不均。


EverMind团队构建了一个名为SkillCorpus的框架,首次在规模化层面上对开放技能生态进行了聚合、策展、匹配和评估。


中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷


这个过程堪称一场浩大的数字淘金。


团队从爬取的大约82.1万个原始技能中,通过多阶段多维度策略过滤,最终精选出96401个高质量技能。


为了管理这些技能,他们建立了一个包含16个类别的分类法,并从实用性(Utility)、鲁棒性(Robustness)和安全性(Safety)三个维度进行了严格的质量控制。


仅仅有库还不够,关键在于检索


EverMind配合这个庞大的语料库,微调了一套专门的检索与选择技术栈,确保Agent在执行任务时能够精准匹配到相关的技能。


SkillsBench、GDPVal和QwenClawBench三个基准测试中的端到端评估显示,自研的Raven Harness集成SkillCorpus后,Agent在所有基准上均获得了稳定的性能提升,其中在SkillsBench上的提升最大,达到了7.5个百分点。


通过深入的运营分析,团队还识别出了技能带来的增益边界——


覆盖边界