RSI(递归自我改进)已经热了一段时间。从 OpenAI、Anthropic 到谷歌,头部实验室都在探索如何让 AI 参与下一代 AI 的研发,创业公司也开始围绕它做产品、搭环境、建评测。
但当越来越多事情都被称作 RSI,一些基本问题反而需要重新回答。RSI 究竟是什么?模型已经能执行不少研发任务,但它能自己找到值得改进的目标吗?评测分数提高了,怎么证明它是真的变强,不是学会了刷分?创业公司在这条赛道上,和模型厂商抢的是同一块蛋糕,还是在做不同的事?
9 月 19 日,AGI House 在上海举办「AGI Frontier · The Recursive Loop」主题活动,围绕这些问题展开连线和圆桌讨论。参与讨论的嘉宾包括 Google DeepMind 主任资深研究科学家姚顺宇、Recursive Superintelligence 联合创始人施天麟、NeoCognition 联合创始人谷雨、Evolvent AI 联合创始人孟繁青,以及上海交通大学助理教授、Theseus Labs 创始人周煊赫。活动由 AGI House 创始人 Rocky Yu、合伙人 Jason Liao,以及红杉中国董事总经理张馨苑主持。
一些核心观点是:
- RSI 不等于 RL。模型用自己生成的数据训练自己,只是 RSI 非常初级的婴儿阶段,能自己设计整套训练流程,才算超出 RL 的范畴。
- RSI 绝对不只是模型单方面的问题,是系统工程。调度层、上下文管理层、硬件优化层要全部打通。
- 模型执行能力很强,但短板在于很难自己定义评估标准、找到正确的优化目标。定义问题比解决问题更难。
- Benchmark 刷榜是经济和人性的结构性问题,一个公开 benchmark 能活三五个月已经不容易。
- 真实世界无法无限试错。发错一封邮件可能就失去下一次机会,Agent 需要学会用更少的反馈积累经验。
以下内容转载自 AGI House,经 Founder Park 编辑整理。
01
不是所有「自我改进」,
都能叫作 RSI
Rocky Yu:我们先定义一下什么是 RSI。
姚顺宇:如果只是让模型自己生成数据,再拿生成的数据去训练,那就是最基础的强化学习。就是模型拿自己的在线策略产出的合成数据训练自己而已,这能算 RSI 吗?
RSI 和 RL 本质其实不一样。有些事一旦做到了,那就是 RSI,不再是普通 RL。举个例子,如果模型能自己设计整套训练流程,这就已经超出 RL 的范畴了。传统 RL 里,整套训练方案是人定好的,模型只负责产出训练数据。
所以我也不会说两者完全割裂。某种程度上讲,模型用自己生成的数据训练自己,只是 RSI 非常初级的婴儿阶段,未来还会演化出更深层的形态。
Rocky Yu:我们 AGI House 内部也讨论过这个定义:智能并非单指模型,而是一套完整系统。向 RSI 过渡的中间态是自我改进闭环,需要外围框架配合权重更新共同完成。仅权重更新,并不等于 RSI 闭环。
姚顺宇:没错。真正终极形态的 RSI 绝对不只是模型单方面的问题,而是系统工程。模型要能管好自己和人类、和环境交互的接口,就要涉及外围调度层、上下文管理层;想要掌控底层优化逻辑,还得吃透硬件优化层,像 CUDA、Triton 这样。所以自我改进最终一定是整套系统共同运转。
谷雨:RSI 是一个很大的概念。如果一定要找共性,我觉得有几个元素:首先它需要 AI 自己去找到自己的提升目标;接下来它需要自己找到方案去不断接近这个目标;同时它的目标往往会对应一个长程的任务,这个长程任务往往需要迭代或者递归来完成。其实大家怎么看待长程就决定了大家怎么看待 RSI,我们觉得长程不止是埋头做推理很长时间,而是一个持续学习和推理交叉耦合的过程。
孟繁青:RSI 就是在我们给定一个 environment 和 verifier 的情况下,在里面持续迭代某些东西。这些东西可能是不一样的,但最终的目标都是在这个环境中拿到一个更高的 verifier 得分。目前大家做的工作可能分成三个层级:
第一层:AutoResearch,修改某些 artifacts,比如改训练代码以降低 loss,环境是 repo,可改的是一个文件。
第二层:改模型权重,训练另外一个模型,可用合成数据、改算法、自己写 infra 等各种训练手段。
第三层:绝对意义的 RSI,模型优化自己,系统内只有自己、环境、verifier。
周煊赫:我在两位的观点上做一些补充。现在模型训练的边际收益越来越不明显,我们更需要 AI 自己去探索。特别是大家其实缺数据:不缺简单的数据,甚至不缺人去标数据,缺的是真正高价值、高质量的 corner case 数据,这背后的 RSI 其实就是一种 post-training 的好的解决方案。
对于一个 AI 系统来说,最本质的层面应该是 AI 参数、架构设计;再往外第二层是 code、workflow;再往外是环境,各种各样的文件、工作区。递归地从内部改,改不了、或者这个变量不让我改,就往外面改,递归地去解决问题。
施天麟:RSI 其实是很多科研人员长久以来的理想。今年才逐步看到落地苗头,很大程度归功于代码智能体迎来能力拐点。RSI 要解决的核心问题:怎么让 AI 自动化训练下一代 AI。很关键一环,代码智能体要能把 AI 自己的想法落地实现,迭代优化自身架构、数据集、训练算法。正是代码智能体变得足够通用,RSI 才有落地基础。
Jason Liao:我从反面来追问。三位对于目前行业里关于 RSI 的阐述中,最不认可或不能理解的观点或定义是什么?
孟繁青:我最不理解「专门做 RSI model」这个说法;我认为 RSI 能力本身是被上游模型厂训练时内化的。
所谓 RSI model 形态上只是一个自动化训练任务的模型,强调「方法是 RSI」并不成立:在 RSI 过程中,Agent 的行为 pattern 可形式化为 in-context BFS / DFS,选路径与回溯从代码逻辑变为通过 LLM 的 In Context Learning 原生完成。
系统上限取决于模型 long context 能力(回溯的长程性与精准性)和选 path 能力(降 cost、提 efficiency),选 path 本质是 world model + value model(类似 PPO 加 world model),这种能力已内化在基模训练目标里。
周煊赫:针对繁青的观点,我举一个反例,真实部署时往往必须到场景里训模型。
孟繁青:我说的不是垂域定制,而是声称用某种训练算法训出的 RSI 模型在环境中迭代 reward 的斜率更高。
周煊赫:我们的观点似乎是异曲同工的。我最不信的是做 RSI 的预训练模型 / 从头训模型;但我相信的是落地千行百业的垂域 RSI。
谷雨:最不理解的是为什么你们国内基金给 RSI 创业公司投那么多钱(开个玩笑)。我觉得从定义层面上我不太理解的是在 RSI 这个词出现之后,之前很多大家不称为 RSI 的东西都成了 RSI,比如 AutoResearch,比如 loop engeering,甚至 MLE。这是一个很不好的现象,定义本身的目的应该是让话题更明确而不是更 confusing,这样会增加大家去了解一个领域的难度。
02
模型越来越会执行,
难的是自己找到正确目标
Rocky Yu:近几个月,Oriol、Jeff Dean 创立了 Discovery Loop,Jerry Tworek 创办 Core Automation,来自 OpenAI 的 Benjamin 也成立了 Mirandao,各家都在冲刺 RSI 赛道。但抛开融资喧嚣,站在业内视角,你看到了哪些真正落地的成果?
姚顺宇:近几个月确实冒出来一大批初创公司,但我更看重真正落地的成果。很多内部落地案例不方便对外公开,包括我们自己和其他企业的工作。能公开说的是 Gemini 3.8 Flash,它后训练的核心流程,是模型自己摸索出来的。这是个很好信号:RSI 已经不再只是遥不可及的空想目标,近两三个月已经开始落地变成现实。
Rocky Yu:我跟 Sergey(谷歌联合创始人)聊过这件事,他几乎全部把重心都压在 RSI 上,我感觉这已经是谷歌的核心战略。
姚顺宇:不止谷歌,几乎所有头部实验室都把它当成重要方向。
Rocky Yu:怎么证明系统能自我迭代?有没有真切感受到它发生的时刻?去年 12 月 Claude Code 能力快速跃升,我们看到了自改进闭环的苗头。其他 RSI 项目是否也会出现类似信号?
姚顺宇:可以从两个维度看。从业务效果来看:对 AI 公司来说,当你不断扩大数据、模型规模、服务客户体量,却不需要同步扩张团队人力,这会是一个非常明确的标志。
从技术层面说:现在还有短板。现在模型执行能力很强,哪怕需求说得很模糊,它也能落地干活。但短板在于,它很难自己定义合理的评估标准、找到正确的优化目标,这是目前缺失的一块。不过我不认为这是无解的底层难题,说不定很快就能解决。
现场提问:「模型担任研究员」是 RSI 非常关键的一环。如果模型真的能够独立开展科研,会不会存在一些无法绕开的本质瓶颈?还是说,只要收集足够多科研思维链数据,它就能自主设计实验、排查问题,完整跑通科研闭环?
姚顺宇:我并不认为存在什么根本性的硬障碍。在我看来,科研本质上更多是经验的沉淀,没有什么玄乎的魔法,就是合理地积累经验。如果说当下还有短板,那就是模型生成想法的多样性不足,但这不属于原则性难题,未来是可以解决的。
现场提问:头部实验室把 AI 研究员落地,很重要一点是沉淀海量实验经验——哪些方案有效,哪些会失败。这些经验后续会不会内化为模型科研能力的一部分?另外,AI 研究员可以在已知搜索空间内批量做对照消融实验、 挖掘新洞察,但完全未知的探索空间,模型要怎么去发现?
姚顺宇:第一,过往科研数据、完整实验轨迹价值极高。但难点不在于拿到数据,而是怎么从海量原始数据里提取真正高价值信息,这会是未来一大挑战。
第二,这点和前面话题相通。模型执行能力很强:只要搜索空间边界清晰、方便探索,从中找到更优方案并不难。真正难的是找到合理的搜索空间本身,这也对应现在模型想法多样性不足的现状。
现场提问:我们实验室主攻通专融合,聚焦科学自主发现。科学场景能不能带来代码场景给不了的能力增益?如果代码训练已经足够激发模型智能,科研场景还能补充什么?
施天麟:做科研离不开写代码、实现实验,但科研还有大量能力超出代码本身。类比博士生:自主学习能力、好奇心、文献调研、读论文复现实验、原创提出新想法,这些都有待模型进一步突破。
03
最难的不是变强,
是证明自己变强了
现场提问:模型既要输出答案,又要自己评判答案,怎么避免它自我麻痹,越觉得自己做得很好?尤其是没有标准答案的开放性任务。如果基准评测集本身也被 AI 持续修改迭代,那这套评测还能证明模型真的变强了吗?RSI 最难的到底是实现自我改进,还是证明自己确实改进成功?
姚顺宇:最难的恰恰是证明自己真的取得进步。实现自我迭代反而没那么难,验证迭代有效才是最大难点。 这也呼应了前面聊的内容。很早之前就有相关研究,当时还不叫自我改进,叫自我博弈:一个 AI 出题,另一个 AI 答题。最常见的坑就是奖励投机,直接掉进局部最优:要么出题方一直出简单题,答题方永远答对;要么一直出超难题目,永远答不对。
核心难点就在于,模型如何真正客观评估自身的进步。也正好回应之前的问题:到底是定义问题更难,还是解决问题更难?一定是定义问题更难。
现场提问:我们来聊聊 long-horizon task。目前这类任务大多依靠多智能体推进,那单智能体路线该如何在执行过程中获取有效反馈?长周期任务最大的痛点,就是反馈链条过长。
姚顺宇:这是当下非常火热的前沿研究方向,开源社区已经有不少相关尝试。大家会搭建基于过程的奖励模型,但最大的难题是很难规模化落地。
目前主要有两种思路:第一种是设定明确规则,比如写代码就统计测试用例的通过数量,把通过率作为过程奖励。但这很容易让模型陷入局部最优。第二种是直接用大模型自身充当过程奖励。可一旦扩大规模,就很容易出现奖励投机、钻规则漏洞的现象。所以这个问题至今依旧棘手。
想要实现突破,我们需要弄清楚,过程奖励放到完整上下文当中会产生哪些连锁效应,同时还要让模型具备自我分析的能力。这是潜在的突破口,不过目前还没有标准答案。
Jason Liao:verifier 作为 RSI 得以持续演进的卡点,三位能否分享关于 verification 的定义和思考?
谷雨:verifier 与目标、不断迭代相关。RSI 的定义前提是要有一个目标,并在这个目标上不断把自己做得越来越好。
这必然涉及一个「verify 自己做得怎么样」的过程——这就是 verification 存在的意义。现在 verifier / grader 很受关注,原因在于做 RL 时需要泛化到那些没有天然 verifier 的场景(不像数学、勾股定理那样有明确的验证过程)。
但这类 verifier 本质上验证的是什么?是完成一个 task 后的 task trace。比如让模型写一个游戏、做一道数学题,去看这中间的执行过程对不对。放到 RSI 视角下,目标就是解决这个 task,verifier 的目标也就是评估这个 task 做得如何。可以进一步泛化。我们 evaluate 的目标未必只是「把这个账单填好」,而是「如何变成一个更好的会计」。
这时会有一种更 meta-level 的理解:不只是评估这一个具体任务,而是审视模型在成为更好的会计之前,到底存在哪些能力缺陷。AI research 里有个经典词叫 meta-cognition,现阶段其实没有被足够重视。人类智能很大程度来自元认知:能够思考自己的思考、意识到自己缺什么,再基于对自己的反思去提升自己。
周煊赫:非常认同谷雨的观点。补充一点,reflection 很重要,而 reflection 的关键在于利用好环境里那些非常冗杂、非常多的信号量。用好环境里的这类 evidence,是核心。
孟繁青:谈谈我对 rubric 的看法。大家普遍觉得设计 rubric 很难:题目复杂、要完成的点很多,rubric 也随之复杂;而且很难检验 rubric 与题目是否 alignment——像谷老师他们做的各种专业领域 bench,我们其实也很难去检测。但我认为,这些复杂的 rubric 都是一个中间态。它的复杂性来源是当前的环境和题目。
像 coding 场景就几乎没有鲁棒性问题——环境简单朴素、目标一致,最后的衡量就是性能本身(加速比)。如果说 benchmark 最终应该去评测人做不到的领域;那当人都做不到时,bench 的目标就是这件事的经济价值。如果还是以人的视角做环境、rubric 和题,是不是都是中间态?
如果换成端到端视角——把 agent 放进环境里跑十天半个月,只看它最终产生的净价值——整个问题就没有 rubric 了,又会归结到怎么搞到这样一个环境。比如炒股,直接放进真实市场成本高、还难以回测,所以关键是怎么建一个不会被 hacking 的 mock 环境。总之,复杂 rubric 可能都是中间态;回到最本质的经济价值,问题又回到环境这一侧。
张馨苑:你们认为 verification 未来都应该由 AI 接管,还是 human-in-the-loop 必不可少?
周煊赫:短期内 AI 完全取代人不现实。当前设计需要跟着需求走,执行任务的 pass 判定很重要。上来就靠 AI 解题的事在做,但为稳定质量仍需人保障。
谷雨:AI 确实能做一部分,但很多事情上仍需要人。一是 AI 的准确率还很难保证; 二是很多场景下人比 AI 更便宜——比如 ApprenticeBench 最近做的 human evaluation,人比 AI 还便宜,那为什么不用人?
孟繁青:我的观点跟两位老师都类似,近阶段和中短期来看,还是要去找人类专家,以及工具去调用的。整体来说,长期来看,我还是刚才那样的观点:长期来看 verifier 会简单化,但环境会很复杂。
现场提问:不少国内模型厂商都提到,除代码、数学之外,金融、法律、医疗这类生产力场景,模型输出质量很难自动核验,仍然依赖人工筛选。你刚才提到评估并非底层死结,那在这类非标业务场景下,如何搭建闭环,让模型实现自我评测?
姚顺宇:我要是有完整答案,早就动手落地了。恰恰因为这件事很难,大家都还没摸透,所以至今没有成熟方案。过往方案也都是基于奖励模型,和刚才说的过程奖励模型困境一模一样:规模上来之后,模型很容易投机取巧。法律、医疗我本身并不深耕。
如果谈直观感受:最好先扎进这些垂直行业,搞懂现实世界里人类是怎么搭建奖励体系、怎么评判成果好坏的。代码领域能跑通,本质是做 AI 的人本身就是程序员,非常懂这个行业的评判标准。但实话实说,我并没有针对法律、金融的成熟解法,我本身不做这两块。