
推荐语
从正式运行到登顶全球榜单,只用了两个月。一支中国创业团队,闯进了巨头扎堆的交互式世界模型第一梯队。
在WBench最新公开评测中,XGEN的交互世界模型JING拿到81.0分,综合排名全球第一。目前榜单已经覆盖约50个模型,包括NVIDIA、Google DeepMind等主流玩家。在更强调交互和导航能力的Navi子榜中,JING以81.9分位列全球第二,高于Google DeepMind Genie 3的73.9分。

当然BENCHMARK其实没那么重要,更值得深思的应该是:为什么一支刚刚起步的创业团队,能够在这个当红赛道里迅速跑到前列?
XGEN没有沿着已有路径继续外推,而是试图把“主观交互体验”与“客观世界建模”放进同一套系统里:后台持续建模一个客观存在、不断演化的世界,前台则根据智能体所处位置与状态,生成它此刻合理的主观体验。
放到今天全球World Model的版图里,这也是一条极其非共识的路线。Google DeepMind持续推进Genie,李飞飞的World Labs试图构建可生成、可探索的空间智能,杨立昆押注JEPA,希望在latent representation中学习世界更抽象的规律;字节也正在向实时、空间化、可交互的视频生成继续推进。而XGEN想构建的,更像是一个持续发生的主观世界——它将“世界机制”与第一视角生成无缝拼接:后台维持人物、关系、规则与状态,前台只实时生成你此刻真正能看到、听到和交互到的部分。
这种判断并不是World Model成为热词之后才出现的。XGEN创始人车昊轩早就在沿着这条路线探索。他三年修完西工大本科学业,后因美国总统令10043政策转赴港科大攻读博士。在此期间及随后的职业生涯中,他穿梭于学术与工程前沿,先后在腾讯、可灵、字节及华为(任华为香港Principal Researcher)持续探索视觉生成与交互视频——从腾讯IEG实习期间主导发布GameGen系列工作,到在华为带队打造出Hugging Face Model Trend排名第六的“卡皮巴拉(Capybara)”大模型,他一直在技术最前沿迭代。
但比起光鲜的学术与大厂履历,真正促使他下场创业的,是在持续深耕这条路线的过程中产生的前瞻认知:他开始意识到现有路线的局限——真正的世界之所以成立,是因为背后存在持续的状态、关系、规则和历史。
于是,XGEN选择继续往前走一步:把世界模型继续推进到一个持续存在、能够保存状态与因果的世界。在其架构中,最上层首先是一套“世界机制”:每个角色都是一个自主行动的Agent;系统持续记录人物关系、状态与规则,再由交互世界模型生成智能体真正能够感知到的世界。
更关键的是,XGEN 的定位并不是一家单纯的世界模型公司,而是围绕“主观体验”构建世界——生成式世界模拟。让不同的人或智能体进入其中后,都能获得与自身位置、状态、关系和历史相匹配的合理体验。这听起来很像《西部世界》与《头号玩家》的早期雏形:进入其中之后,你所体验(Experience)的一切都由系统实时生成,且你的每一次行为都会引发世界的后续演变。
它最终指向两个方向。一边是人的互动,例如游戏、娱乐、教育、培训,让内容从“观看”变成“进入”;另一边是智能:在进入真实任务之前,AI可以先在持续运行的世界中行动、试错、观察结果,并从中积累经验。
这个判断已经从车昊轩个人的技术选择,变成了一支顶尖团队的共同押注:XGEN目前规模二十多人,团队90%以上由名校博士与一线大厂专家构成。要想构建拥有“持续状态、关系与规则”的复杂系统,单靠单一算法突破远远不够——团队中既有深谙底层生成的算法专家与清华背景的物理专家,也有精通高并发工程落地的系统专家;既有能为世界模型注入逻辑骨架的游戏行业最大知识图谱打造者,也有洞察用户交互需求的即梦创始产品经理。这种在算法、系统、知识逻辑与产品感知上的高度互补,正是他们敢于将这一前瞻判断转化为现实的底气。
当字节试图用世界模型重新定义PICO、Google DeepMind持续推进Genie的此刻,仍有一批创业者选择从完全不同的起点,逼近同一个终点。XGEN选择的这条路线同行者屈指可数。这才是令人兴奋之处——在World Model的范式尚未完全定型之前,中国创业团队不只是追赶已有路径,也正在试图参与定义下一阶段的技术路线。

以下是Z Potentials整理的对话实录,经编辑修改,enjoy~
Z Highlights
- 「我一直是一个非常坚定的技术乐观主义者。我真正感兴趣的是,AI 最终能不能解决一些今天人类还解决不了的复杂问题。
- 未来可能会有两个圈。第一个圈,是以语言为中枢的模型。叫LLM、DLM、VLM都可以,本质上负责理解、思考、推理,然后决定自己到底要完成什么任务。另一个圈,就是多模态为中枢的模型,比如world model。它更像一个“缸中之脑”,决定你看到什么。
- 我觉得今天Genie-like world model最大的问题是:它还是一个片段,而不是一个真正持续存在的世界。
- 很多world model偏虚拟世界展示。这个能力我们当然也可以做,但不是我们最强调的东西。「我们不仅关心眼前生成了什么,更关心画面背后那个持续存在、不断演化的世界。当一个人或Agent进入其中,它的位置、状态、关系和历史,会共同决定它此刻到底看见什么、听见什么、能够做什么。所以我们先通过世界机制对整个世界建模,然后再让world model生成egocentric experience。
- 世界模型需要具备能力关键词动态、长程、多模态、多智能体。
- 我现在日常其实有两重身份。一重有点像“奥本海默”——我要想清楚这个东西到底怎么造出来,它为什么成立,大方向到底是什么。另外一重更像“刘备”。独木难支。你得知道怎么把一群很强的人放到一起,怎么用人,怎么让不同的人最后能够往同一个方向走。
01 从西工大到世界模型创业:兴趣、不安全感与失控感
ZP:请您先简单介绍一下自己之前的经历。
车昊轩:我本科在西北工业大学读航空航天。2016年AlphaGo出来以后,于是决定转向AI方向,用三年提前修完了本科。也正是在不断推演模型如何真正理解并泛化真实世界的过程中,我开始对模型的本质与局限有了全新的理解。之后也经历过波折:第一次读博时,和导师的研究理念产生了分歧,他希望做偏理论推导的Mathematical方向,而我更想做Data-driven、更RL的Learning路线,最终我选择退学;第二次申请到了美国一所名校博士,因美国政策对西工大的禁令而无法入学。
无论外部环境怎么变,在博士间,我始终专注于更Data-driven、更注重Learning与泛化能力的研究路线。
2021年6月,第三次申请博士去了香港科技大学。前两年一直研究模型泛化:到底什么才算一个好的模型?我的理解是,一个好的模型应该能进入现实世界,面对各种突发情况依然有效完成任务。但2021到2023年,模型都比较小,那时泛化最大的卡点就是data:数据不够diverse,模型没有真正理解现实世界的分布。
2024年Sora出来时,我印象特别深。它把video generation和world simulation联系到了一起。当时我就想,如果真的存在一个world simulator,多模态视觉里很多过去依赖know-how解决的问题,是不是都有机会被解掉?后来我去了腾讯IEG实习。2024年9月,我们发布全球第一个genie-like路线的工作GameGen。
之后我又去了可灵。当时开源基础模型已经能生成40分钟、持续交互的视频,但保真度、动态表现等问题,本质上还是受限于基础模型能力。我们把数据和技术链路在可灵模型上做复现,做出了一些有启发的survey paper和position paper。我也开始意识到:如果真的想做一个world simulator,它不是单一模型的问题。
再后来,我去了字节和华为。今天我们团队里的很多核心成员,都是我当年在字节实习时认识的,后来连当时的mentor也被我挖了过来。毕业后我去华为香港研究所AI lab担任principal researcher,负责video generation和world model方向,带着十几个同学一起,也取得一些成果,当时Huggingface Global Trend第六的卡比巴拉模型就是那时候训练出来的。
ZP:从航空航天专业转到AI方向,纯粹是兴趣驱动吗?
车昊轩:最直接的冲击还是来自2016年AlphaGo和李世石下棋。我当时的想法其实很简单:如果 AGI真的存在,它是不是能够解决一些今天的人和制度都解决不了的问题?比如,能不能找到更好的药,让人延缓衰老?能不能解决一些非常复杂的社会和政策问题?
我一直是一个非常坚定的技术乐观主义者。我真正感兴趣的是,AI最终能不能解决一些今天人类还解决不了的复杂问题。
ZP:专业方向上你后来选择世界模型,而不是纯语言模型?
车昊轩:我最早做machine learning,且一直相信基础突破会牵引一大批效果层面的突破。但今天来看,视觉一直没有出现一个特别好的基础模型。很多视觉task,某种程度上都像是在给语言模型“打边角料”。
可如果AI真的要进入这个世界,视觉非常重要。因为如果AI看到的世界和我们看到的完全不同,它看到的东西我们无法解释,它表达出来的东西我们也无法理解,那彼此之间就缺少一个共同界面。所以我一直觉得,视觉是人和AI之间的一个common table。
后来我逐渐形成一个判断:未来可能会有两个圈。第一个圈,是以语言为中枢的模型。你叫它LLM、DLM、VLM、VLA都可以,本质上负责理解、思考、推理,然后决定自己要完成什么任务。
另一个圈,就是多模态为中枢的模型,比world model。它更像一个“缸中之脑”——通过对物理与逻辑的实时预测,模拟出了你所能看到的一切。我认为视觉是孕育AGI的一个非常重要的途径——视觉是人类接收环境信息最核心的通道,而环境其实一直在塑造着智能的进化:如果没有地球,没有我们所处的环境,我们今天这样的智能还会存在吗?
人类的知识演进,本质上是眼睛看、耳朵听,把感知到的世界凝练成knowledge,再通过教育传递下去。今天AI正在极速吞噬人类积累的所有知识,甚至行业里已经在挖掘那些只存在于人脑中、尚未连网的隐性知识。可如果这些既有知识最终被挖完了,AI下一步该怎么办?它必须像人类一样,真正进入真实世界自行探索。
而进入世界的前提,是得先拥有强大的视听能力去获取信息,才谈得上凝练新知识。视觉的核心价值,恰恰在于对真实世界进行高精度的拟真——只有让AI观察并拟真出最符合物理规律与真实逻辑的演进,它才能从中提取出最接近现实本质的知识。从这个角度看,视觉是通往真实世界的必经之路。但坦白讲,今天从语言模型、VLM到多模态agent,在这项能力上都还远远不够。
我们内部做了一个多模态Agent Benchmark叫DUAL EXAM,马上要release了,目前看到最好的模型也只有20分左右,今天所有的多模态Agent都还不qualified,距离真正投入使用还有非常大的gap。但如果你拥有一个world,就可以 生成大量不同类型的多模态数据,去弥补这个gap。
ZP:几段大厂经历里,哪一家公司对你后来创业,或者对你理解AI的方式影响最大?
车昊轩:说实话是腾讯。当时我们在游戏部门做GameGen,本质上就是用视觉模型去模拟游戏。模型发布以后其实非常成功,Twitter上的浏览量破了千万,有有很多 KOL 转发,CDPR、R 星等游戏公司和腾讯股东也都主动来问。后来Genie 2出来以后再回头看,会发现我们其实比Genie 2还早了几个月。
积极的一面是,我们确实从0到1突破了这个技术。但另外一面是,在大公司内部,一个探索性的研究项目要正式发布,还需要回答数据来源、合规边界和组织共识等一系列问题。最后我们在发布路径上没有形成一致。为了让这个工作问世,我选择离开,把GameGen作为独立研究继续推进。今天他们又在做这件事。如果当时我继续留在那里,我觉得故事会不一样。
这段比较negative的经历,其实一直影响着我后来的很多选择。我之后有一个很强烈的感受:不能再把自己命运的喉咙交给别人。
ZP:腾讯之后,你还是继续去了字节、华为这些大公司。为什么?
车昊轩:哪怕后来去了华为,我做选择时也非常在乎一件事:谁愿意让我带队,而不是只让我做一个IC。因为带队意味着我会拥有更大的自主权,也可以做更多更好的技术。在华为时我已经开始带团队,是team leader。
真正创业以后,我发现大厂带队和创业的区别,最后其实就是三个东西:人、钱、事。你能带多少人?这些人是不是你自己筛选的?你做的是不是自己真正相信的事情?这个事情最终的决策权,到底在不在你手里?在大公司里,这些东西最终都不完全由你决定。你要先提proposal,再让别人来资助你。有了资助以后才可以开工,但别人既然给了你钱,也一定会影响这个事情最后往哪里走。尤其后来,我自己写了四万行代码,把我们现在想做的事情先做出了一个demo。
做完以后,我问了自己一个问题:这玩意儿对业务到底有什么用?我回答不上来。那我就觉得,旧的路线不能再这么走下去了。但这个Demo并没有白做,它反而成为了我重新思考技术终局、也是我们现在这套新路线的灵感点。
ZP:你很多东西其实都是靠自学?这种驱动力是什么?
车昊轩:除了兴趣之外,另外一个很重要的驱动力,我觉得是忧患意识与危机感。我读博的时候总有一种紧迫感,甚至到了毕业前的最后一个月,还会反复推演oral defense可能会遇到的卡点。这种深层的危机感其实是一种原动力,它会鞭策你更快、更好、更狠地把一个目标啃下来。虽然过程确实很痛苦,但它能让你始终保持敏锐。
02 世界模型不是一段视频,而是一个能持续演化的世界
ZP:你什么时候有创业这个念头?
车昊轩:2016年转专业以后,我其实就已经开始想自己以后到底要走一条什么样的路。当时自己设计的路线很明确:先读博,再回国当教授,然后创业。因为我读书那个年代,商汤、旷视这些公司非常火,也有很多教授出来创业。像汤老师,对当时的我影响都很大。所以创业这颗种子,其实本科的时候就已经埋下来了。后面无论去腾讯、可灵、字节还是华为,某种程度上也都在积累。我一直在想一件事:怎么用有限的资源和时间,去撬动更广阔的世界。world model是一个非常fundamental的问题,而且今天真正沿着我们这条路线持续往前推的人其实很少。
有一个和我们比较像的“镜像团队”就是Genie团队。2024年12月他们发了Genie 2,我们是在9月发了自己的模型。今年也挺有意思,我们9月会发新的技术,只是我不知道他们什么时候发。至少到今天,我觉得真正意识到这件事情的fundamental importance,并且持续沿着这条路线往前推的人并不多。所以我们