你相信,我们其实生活在一个虚拟世界中吗?
马斯克曾在Lex Fridman的采访中被问到:如果有一天人类实现AGI,并且只能向它提出一个问题,他会问什么?
思考了十秒之后,他给出的答案是:
“What's outside the simulation?”——模拟之外是什么?
这是马斯克对于这个世界的终极追问。早在2016年,他就曾表示,人类生活在真实世界里的概率或许不到十亿分之一。当然,这种近乎科幻的理论,目前还没有任何科学证明。
但非常有趣的是,随着最近AI的发展,在硅谷,人们已经开始尝试扮演“造物主”,去创造一个AI的“模拟世界”。而这,也催生出了一个新的赛道——AI Simulation(AI模拟)。
最近,这个领域不断升温。李飞飞、Andrej Karpathy同时押注的Simile,最新估值达到20亿美元;由00后团队创办的AI模拟预测公司Aaru,估值也已接近10亿美元。由哈佛大学与MIT联合发起、200多位研究者共同参与的MatrAIx项目,更是构建了83亿个AI虚拟人格,相当于把全人类都镜像到了数字空间。

这篇文章,我们就来聊聊正在升温的AI Simulation。
AI究竟已经可以把一个人模拟得有多像?当成千上万个Agent被放进同一个虚拟世界,它们真的会形成类似人类社会的关系和规则吗?企业又为什么愿意花钱,让这些“数字分身”替消费者测试产品,甚至提前预测一个还没有发生的未来?
以及,当这些Agent开始拥有自己的记忆、性格和关系,甚至产生一些创造者都没有预料到的行为时,我们究竟是在模拟一个世界,还是正在创造一个新的世界?

今天很多领域都在谈Simulation,但不同领域所说的“模拟”其实并不相同。机器人和自动驾驶领域有物理仿真,世界模型研究的是对物理世界的模拟,而我们这次想讨论的,是一个维度更大、也更加复杂的概念:模拟人类与社会,并借此去理解、甚至预测现实世界。
孟醒
五源资本合伙人
在世界模型或者物理世界模型里,最小颗粒度理想情况下可能是世界中的某个分子,或者某一个原子,模拟的是某些物体。但在智能体社会里,我们模拟的最小颗粒单位是一个人的个体。
我其实并不关心这个人的手怎么动、往哪里跑,关心的是这个人作为一个整体,会采取什么样的行动,最后输出什么样的行为。如果把它映射到大学学科,物理世界可能对应的是自然科学,而智能体社会对应的则是人文学科、社会学科、政治学和心理学。

关于模拟人类与社会这件事,最早引发广泛讨论的,其实是一篇20多年前的哲学论文。2003年,牛津大学哲学家Nick Bostrom在《Are We Living in a Computer Simulation?》中提出了一种推演:如果一个先进文明拥有足够强大的算力,并且有意愿通过模拟重现文明的发展过程,那么,模拟世界中的意识数量可能远远超过真实世界。从概率角度来看,人类也就有可能身处一个模拟世界中。这就是后来广为流传的Simulation Hypothesis(模拟假说)。
由于技术条件的限制,二十多年来,这个假说一直更多停留在哲学讨论和科幻作品中。直到近年来,大语言模型的发展迎来了突破。
2023年,斯坦福大学与Google联合发布了一项后来对AI Agent研究产生广泛影响的实验——Generative Agents(生成式智能体)。研究团队搭建了一个像素风虚拟小镇Smallville,里面有街道、房屋、咖啡馆,还有25个穿梭其中的虚拟居民。这些居民都是由大语言模型驱动的AI Agent,拥有各自的记忆、性格和行为逻辑。

这些Agent的活动并没有预先写好的“剧本”。研究者只是把它们放进小镇中观察,结果发现,它们不仅会自己生活、工作和建立关系,还能够自主思考和规划行动。比如,一个Agent准备举办派对,消息传开后,其他Agent会根据自己的安排重新规划时间,决定是否参加。“斯坦福小镇”让很多人第一次直观地看到,Agent可以拥有持续的记忆、规划和社交能力,并在互动中自然出现一些群体行为。
高森泉
WorldVac CEO
这个研究的意义,就是让大家认识到语言模型是可靠的,它真的可以去复现人类社会的一些现象。更多人开始关注这个领域,也让大家开始相信这件事情是可以做的。

25个Agent只是一个开始。随着模型能力不断提升、推理成本持续下降,研究者开始有能力进行更大规模的模拟,也逐渐形成了几种不同的探索方向。
其中一条路线,是在模拟精度上尽可能与真实的人对齐。2024年,斯坦福团队把实验扩大到了1052个Agent。这一次,每个Agent背后都对应一个真实的美国成年人。研究人员先对真人进行大约两小时的深度访谈,了解他们的成长经历、家庭、工作、价值观和生活经验,再把这些信息交给大模型,生成相应的AI“数字分身”。
这样得到的Agent,不再只是一个符合“平均画像”的虚拟人物。实验中,这些Agent回答社会调查问卷的结果,与真人两周之后给出的答案达到了85%的相似度。也就是说,在一定程度上,AI开始能够复现真实个体的部分想法和选择。
孟醒
五源资本合伙人
访谈也是有技巧的,不是随便访谈。它会用一些最高效的方式去“榨取”你是谁,本质上其实就是在“蒸馏”你是谁,而且蒸得比较细。
它的好处是,针对每一个个体,个体的特异性都会影响整个仿真进入的场景。
另一种研究思路,则不再过分关注某个Agent是不是与真人高度一致,而是把重点放到Agent之间的关系,以及一个社会会如何演化。
前MIT教授Robert Yang团队发起的Project Sid,就曾直接使用大语言模型生成1000多个Agent,并将它们放入《我的世界》中运行12天。结果,这些智能体逐渐形成了经济、文化、宗教和法律等结构,一些社会关系开始自己“长”出来。

不久前,Emergence AI也进行过一项类似实验。他们分别基于Claude、GPT、Gemini、Grok以及混合模型建立了5个平行世界,每个世界中放入10个Agent,用来观察不同模型驱动的智能体社会长期运行后会发生什么。在这一实验设定下,不同世界最后走出了明显不同的轨迹:有的迅速陷入混乱,有的因为协作不足逐渐崩溃,也有的形成了相对稳定的治理秩序。
Satya Nitta
Emergence AI CEO
如果只看静态基准测试,就认为这些系统应该是安全的,很可能会犯错。因为Agent会运行在非常复杂的环境中,无论是物理世界还是数字世界。它们会和其他Agent互动,也会受到环境噪声和变化的影响。
所以,我们正在逐渐把Emergence World发展成一个用于研究长周期自主性的基准测试。

还有一条研究路线,是专门从“评估”入手。比如MatrAIx,就试图为AI模拟建立一套评估基础设施。这项研究由哈佛大学、MIT等机构牵头,汇集了200多位来自学术界与产业界的研究者,其中还包括40多位来自OpenAI、Anthropic等前沿AI实验室的参与者。
MatrAIx构建了一个包含83亿个独特人格的数据集,每一个人格由心理特征、生活习惯等1290个维度定义,再通过大模型将这些人格变成可以行动的Agent。这些Agent随后进入问卷调查、AI聊天、网页浏览和App等四种环境,完成超过1.8万次测试。研究团队通过400次受控实验发现,91.5%的情况下,Agent都能够遵循预设的人格和行为特征。
Xiaomin Li
MatrAIx联合创始人、微软高级研究科学家
我们做基础设施评估、提高最低能力水平,是希望先通过用户群体的多样性,在产品真正出来之前,就可以在各种情况、各种使用方式之下去评测它。
它可能会踩中很多边缘场景。这些边缘场景的分析非常有用,Agent可以告诉你哪一步错了、哪一步它不喜欢,以及它背后的推理为什么会形成这样的偏好和选择。
所以我们首先想要一套方法论,知道怎么样构建事实基准,然后下一步再说怎么样提高。

当AI模拟开始在研究层面被证明具有一定可行性之后,一个更加现实的问题也随之出现:如果AI真的能够在数字世界里复现人类行为、推演社会运行,它能够产生什么真实的商业价值?

▍第一种生意:卖“模拟”
从目前的探索来看,AI模拟首先出现的一类商业模式,是直接把“模拟”本身变成一种产品。
它的核心逻辑,是把现实世界中的人、消费者,甚至社会关系,变成可以被反复调用的数字替身。比如,一家公司可以按照自己的具体需求,快速生成一批拥有不同年龄、背景、偏好和行为特征的Agent,让它们提前体验产品,在虚拟环境中反复测试,再观察这些Agent会怎么选择、怎么对话、在哪里流失,以此为产品设计和迭代提供参考。
这和传统市场调研一个很大的区别在于,企业想看的不只是一个“喜欢”或者“不喜欢”的答案,而是Agent为什么会形成这样的判断。
Yuexing Hao
MatrAIx联合创始人、MIT EECS博士后
并不是说他们喜不喜欢这个产品,或者喜不喜欢可口可乐涨价两块钱,而是看他的推理。他在这个过程中遇到了什么样的波折,或者什么样的想法,导致他最后在预测过程中发生了转向。
我们不仅要看到一个人怎样做这样的决策,也希望看到群体层面的结果。如果是百万级、数亿级,甚至83亿级的人格,他们最终会出现怎样的结果,我觉得这些都是非常有意义的。
所以,这种思路本质上是把模拟本身作为一种产品评估和观察手段。Emergence AI告诉我们,他们进行Emergence World实验,一个重要目的也是为了测试自己所提供的Agent产品,在进入复杂环境后是否依然安全。
Satya Nitta
Emergence AI CEO
我们会用Agent去做一些事情,比如帮助改善半导体良率。Emergence World这个实验非常重要,因为我们需要理解,我们构建的Agent真正运行起来以后是否会采取安全的行动,能不能持续遵守我们设置的安全护栏和基本规则。
更重要的是,它们能不能给出真正值得信任,而不是来自幻觉的输入、建议和洞察。

这种单体模拟的能力,也可以继续扩展到整个“社会”。比如英国创业公司Artificial Societies,主打的就是“社会关系”测试。他们让大量拥有不同人格的AI Agent彼此互动,形成一个可以进行实验的虚拟社会。企业可以把产品、品牌或者营销策略放入其中,再观察不同Agent之间如何交流、影响和做出反应。
MatrAIx的下一步,也准备让这83亿个人格真正“动起来”。
Xiaomin Li
MatrAIx联合创始人、微软高级研究科学家
我们会在新版本中加入动态人格属性,这些东西是可以变化的。还有一个假设是,如果现实生活中发生一些重大事件,它也会对人格和行为产生影响。
而且,这些合成人格未来也不一定只能存在于数字世界。MatrAIx团队正在尝试把人格放到机器人等现实载体中,让不同的思维模式和行为模式从虚拟环境进入现实世界。
Xiaomin Li
MatrAIx联合创始人、微软高级研究科学家
我们会把人格加到机器人上,让它不只是存在于虚拟世界、存在于Matrix里,甚至可以在现实生活中跟我们互动。
这样,我们可以真正感受到不同人格背后代表的思维模式和行为模式是不一样的。
从这个角度来看,AI模拟未来或许不只是一种市场调研工具,也可能成为人机交互的一层基础能力。但现在很多人认为,只停留在“模拟”还不够。在这个基础上,更有意思、也更有挑战的事情,是预测。
▍从“模拟”到“预测”
在商业中,“预测”往往是昂贵的。企业要不要进入一个新市场?产品价格上涨10%之后会发生什么?如果政府调整一项政策,会对整个社会产生什么影响?这些问题的答案,往往只有等事情真正发生之后才能知道。
AI模拟如今提供了一种新的可能:先把这个还没有发生的未来,在虚拟世界里跑一遍,再把结果作为现实决策的参考。目前,在更侧重“预测”的AI模拟公司中,两家比较有代表性的企业是Simile和Aaru。
Simile由“斯坦福小镇”项目的一批核心研究者Joon Sung Park、Michael Bernstein、Percy Liang等人创办,它的思路是从“模拟一个人”开始进行预测。在2024年“数字人格”研究的基础上,Simile尝试通过深度访谈等方式,尽可能高精度地还原一个人的记忆、经历、反思和决策过程,再把这些AI Agent放进不同环境中持续行动。
这样一来,模拟回答的问题不再只是“这个人现在怎么看”,而是可以进一步观察:当价格、政策等外部条件发生变化后,这个人会怎么做,会不会改变原来的选择。Simile想建立的,是一个“人类行为基础模型”,通过模拟人的行为过程,推演现实世界可能出现的结果。

因为这条路线追求的是尽量“真实”,所以更适合消费者研究、产品测试、客户体验和投资者关系等需要深入理解特定人群的场景。Simile今年2月正式亮相,目前估值已经突破20亿美元。根据公司披露的信息,自上线以来,Simile已经为财富100强企业运行了数千万次模拟。美国大型连锁药房CVS也已经和Simile合作一年,通过真实用户数据构建了多达40万个数字分身,用来研究患者按时服药、测试消费者体验和辅助产品设计