
RSI(递归式自我进化),正在成为今年AI圈最热的概念之一。
RSI,即Recursive Self-Improvement,核心是让AI训练AI,完成自我改进。RSI可以包含三个层面:Artifacts(产出物),自我评估并优化产出物;Harness(脚手架),优化Agent在执行任务时使用的Prompt、Memory、Tool、Skill等;模型,自主优化模型参数或训练下一代模型。
上个月,Thinking Machines Lab联合创始人翁荔官宣离职,并回到了OpenAI,负责领导RSI团队。此前,她发了一篇备受关注的博客,名为《Harness Engineering for Self-Improvement》。她判断,RSI可能先从Harness Engineering爆发。
CREAO也快速将目光转向了Harness的RSI。面向B端市场,CREAO提供云端的Infra服务,企业客户可以在这一平台上创建、运行和管理自己的Agent,用户通过一次简单对话,就能生成并部署一个功能完备、可反复使用的应用。其中,AI可以生成工具、自主执行并使用工具,人则只需提出需求、进行审批。
如今,CREAO聚焦在用AI来自我改进,加速、优化乃至自动化Agent构建的过程。CREAO想解决的问题是,在实际场景中,AI能否从自身的执行、反馈和纠正中积累经验,并反作用用于自身的自我改进中,让AI下一次执行任务时表现更好。
需要厘清的是,现有的Agent已有记住用户的上下文、历史任务与偏好的能力,能让同一用户越用越顺手,但这并不会改变Agent能力的上限;而自我改进指的是Agent能从大量真实任务的执行与反馈中,去迭代自己的模型权重或Harness,让自身能力更强。
目前,CREAO既做前者的个性化记忆能力,又做后者的探索。现阶段,国内外的前沿实验室在模型的自我改进上均没有取得显著成果。CREAO已跑通的是在某一商业场景内的、由高质量数据驱动的Harness有限自我迭代。
《智能涌现》独家获悉,近日,CREAO已完成新一轮战略融资,金额为千万级美元。本轮资金主要用于扩大真实业务工作流以及高质量反馈数据规模,加速基于开源模型后训练的垂直模型迭代,并进一步完善供Agent自我进化的运行环境。此前,CREAO累计融资总额已超3000万美元。
CREAO的核心成员来自Meta(Llama团队)、Apple、LinkedIn、TikTok、MiniMax、阿里、字节等企业,CREAO目前主要客户集中于中小企业,主要场景是数字营销、电商和地产,在对留存用户分析后,65.2%的任务来自商业与金融相关场景。
在提供云端服务之后,CREAO也在探索如何在企业端的商业环境中更好地本地化部署。他们即将推出针对企业场景的新版本产品,以解决用户对数据安全需求、合规要求、私有化部署等方案。
CREAO AI联合创始人兼CEO程凯判断,“当下整个B端企业市场战斗还没有真正开始”,从SMB客户切入并不是终点,CREAO正在把市场重心逐步往更大的客户倾斜,他们希望能让企业Agent的自我改进能力在更大体量的场景中延展与落地。
做Harness层自进化,其ROI高于做基模
近半年来,关于Harness的讨论一直没有停歇。有人认为,Harness的作用是提升模型的智力。对此,程凯给出了一个不同的判断,Harness的本质是一层环境,其更重要的价值,是解决模型应用的可行性问题。
打个比方,把一个博士生扔进只有纸笔、没有电脑的空房间,他的智商再高也没有办法做出高质量的产出;而把一位初中生扔进一个有网络、有各种工具的房间里,他能做出的成绩有可能比博士生更多。
程凯认为,Harness就是这个房间以及房间里的各种工具。没有足够好的Harness架构和能力,在应用场景里,纯粹的大模型和Agent难以发挥出最好的效果。
如果,这个“房间”还可以持续自我改进就更好了。
在RSI这一命题上,CREAO率先对Harness的自进化展开尝试。具体而言,就是通过真实生产任务和反馈机制实现Harness层的自我改进:进入真实生产环境的AI,在每一次执行、反馈和纠正中积累经验、自我改进,把这些经验变成下一次更好的执行。
而CREAO拥有真实用户、行业工作流以及专业用户的评估,这成为CREAO驱动Harness自我改进的数据。每完成一轮真实任务后,系统可以根据这些数据优化Agent的规划方式、工具调用、记忆、任务剧本、模型路由与故障恢复机制,在Agent和Harness层直接改进。
程凯告诉我们:“比起在基模上做微调,在Harness上做自我迭代的ROI更高,解决运营层面的问题,远比模型智商层面的问题快。”
不过,仅在Harness上下功夫是完全不够的,AI的自我迭代与自我进化包含两个层次:一是,根据连接数据库、读取文档时犯的错自我改进,这些是客观性错误;二是,根据任务执行结果的好坏自我改进,这些是主观性的错误。
做Harness层面的自进化,只能实现客观性错误的自我修正。但要自我纠错主观性的错误、实现真正的自进化,还需在基模层上做探索。因此,CREAO正着手推出基于业务数据进行持续后训练的基础模型。
很多前沿实验室都在进行基模自我进化相关的研究,CREAO并不打算沿着技术探索的叙事走,他们的目的不是训出越来越聪明、能打败所有模型的模型。随着开源模型质量越来越高,他们看到了模型自我迭代更快的落地场景——垂直场景的商业化能力以及对应的优质场景数据。
因此,他们目前在做的是,基于数据的自我迭代,不断训练出能在真实生产中持续学习、持续验证、持续改进的模型。这一模型可以实现以下目标:一是,让用户使用成本更低,即减少Token消耗,让Token更耐用;二是,以实际运营指标为主导去训练模型,在某一具体场景中,能用更高效、更低成本的模型,实现接近前沿模型能力的任务。
未来几个月,CREAO将率先推出针对一个核心场景、基于开源模型后训练的基础模型。他们还将持续推出平台上的重要场景,如电商、地产、物流运输、数字营销等,推出更多能自我迭代的模型。在此基础上,用户可以用更高效、更低成本的模型,实现接近前沿模型能力的任务。
“很多企业都用不起最前沿的模型。”程凯说,“我们做后训练的核心目的也是降低用户成本。”
自进化的核心是真实场景数据的质量
上线4个多月以来,CREAO AI累计新建27万个Agent,由于主要面向SMB和专业用户,平台天然积累了大量真实垂直场景、高质量数据。程凯认为,数据的质量相当重要,如果没有高质量数据,单有技术上的自我改进,最后也未必实现想要的结果。
而这些数据的价值在于,能解决AI产品商业化的三个核心命题:如何更好地解决任务、更快地解决任务、更稳定高效地解决问题。CREAO从这三个方面给出了解决方案。
首先是模型和Harness的自进化的结果。基于这些由真实业务场景沉淀出来的数据以及用户反馈数据,CREAO能将其模型的后训练与Harness的迭代,形成一套能自我进化的生产系统。系统由此能自己判断,什么时候该调用最强的前沿模型,什么时候该用自己的垂直模型,哪些经验只留在Agent层,哪些值得训进模型参数里。
这一做法最直接的好处是,极大的降低了成本并提高了效率。据其内部基准测试,CREAO系统部署的微调模型比调用外部API更快,成本也更低。程凯告诉我们,目前CREAO平台内,越来越多的任务开始用开源模型来跑,用户在得到同样质量的任务结果的同时还节约了成本和时间。
其次是稳定性。程凯认为,在GPT-3.5时期,很多任务已经能实现自动化了,但一直没办法实现商业落地,是因为彼时模型还无法保证稳定性和安全性。
他们实际统计过,现在,CREAO平台上95%以上的Agent会被每日重复运行,同样的任务可能会跑成百上千次,这个时候,平台能否稳定、减少出错,在商业化的角度相当重要。而CREAO的解法,做好Harness的自我修复和自我优化,用同类型的数据沉淀出更优的Harness能力。
电商场景就是一个很典型的例子。在完成电商场景的任务中,很多用户都会提出一些相似的要求,因此平台积累了大量相似的工作流。比如,用Agent优化SEO(搜索引擎优化),尽管每个人优化SEO的方式有细微差别,但大家做的事情大致方向是一样的。这种情况下,平台能从宏观层面积累大量用户反馈数据,提升整体的Harness的自我改进能力,甚至从整个平台层面优化所有用户的Agent能力。
Harness实现自我改进的结果是,当新用户想再构建出关于SEO的Agent时,不会像第一批用户一样需要反复调优才能达到满意的结果。
第三是长期的高质量的业务数据。程凯告诉我们,在留存用户中,有93.4%的操作是系统自己触发完成的,不仅如此,超过六成的自动化流程任务已经持续运行超过一个月了。AI真正进入用户工作场景中,这也天然为CREAO带来了持续性的、可比较的业务执行数据。
值得一提的是,和他们的产品一样,CREAO团队也带有很强的AI-First(以AI为核心)属性。CREAO联合创始人兼CTO Peter曾在X上发布了一条累计阅读量近200万的帖子,他提到,CREAO团队的产品开发速度非常快,99%的代码由AI完成,一天就能实现传统开发6周的工作量。
在程凯看来,这种AI-First不止表现在开发方式上,更是产品的终局所在。“未来生产力工具的使用者不是人,而是AI。只有AI是生产力工具的使用者,整个社会或企业的生产力效率才能真正成指数倍提升。”CREAO想做的不只是一个能自我进化的产品,而是企业的自进化基础设施,即Agent OS,让企业的Agent在这套操作系统上反复运行、管理和迭代。
文章来自于微信公众号 “智能涌现”,作者 “智能涌现”