世界模型牌桌上,昆仑万维已连出五张牌,一张比一张大。


世界模型的热度,终究还是烧到了今年的 WAIC。


整场大会,论坛、展台、发布会,世界模型几乎成了“灵魂”一般的存在。


因为具身落地元年——AI 要迈向现实世界,世界模型必不可少。


不同于资本场中,创业公司频频用零产品、零营收撬动百亿估值,大家在 WAIC 上追问的是更朴素也更直白的技术问题:世界模型如何真正理解物理世界?如何走向真实世界?


7月19日,昆仑万维举办的“世界模型与多模态范式革命”专场论坛,用硬核的技术细节,回应了这些问题。


昆仑万维董事长兼 CEO 方汉在论坛上进一步宣布:“2026年为世界模型元年。”


世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界

昆仑万维董事长兼CEO方汉


 Matrix-Game 3.5,便是昆仑万维在这个“元年”里,打出的一张王牌。


世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界

真实开放世界,Matrix-Game 3.5 实现效果


01

“物体恒存”这道基础题,到底怎么解?


查看 Matrix-Game 3.5  发布的技术突破细节,会发现“物理恒存”是被单独拎出来重点攻克的问题。


为什么?


因为这道物理世界最基础的题,曾让世界模型集体翻了车。


翻车这事,要从一个评测基准说起。


哈佛、MIT、IBM、谷歌联合发布的一个评测基准,叫做 MemoBench,考的是“物体恒存”——东西离开视野再回来,还在不在?长什么样?位置变没变?


三岁孩童都能拿满分, 十个主流世界模型集体不及格——满分 1 分,最高分 0.58 分。


原因藏在 Matrix-Game 团队曾对世界模型给出的定义框架中——理解当下状态、预测下一个状态、将预测结果渲染呈现。


而大多数模型只做到了第三层。“物体恒存”测试不及格,便是它们跳过了前两层,直接“渲染”所付出的代价。


MemoBench 给的“评语”也很直白:现有模型即使能生成视觉上完全连贯的画面,也几乎无法在物体重新出现时,正确恢复它在消失期间本该经历的状态变化。


“物体恒存”问题,可以拆成三道更具体的题:


  • 记不住:无法维持对物体身份的持续表征。
  • 认不出:无法在物体重现时准确识别其身份。
  • 变不对:无法正确推演并还原物体在消失期间发生的状态变化。


Matrix-Game 3.5 一道一道,给解了出来。


“记不住”?Matrix-Game 3.5 :把“时间相册”升级为“三维地图”。


模型为什么会“记不住”?


这源自于 Transformer的结构性缺陷:注意力窗口越大,早期信息被稀释得越严重。记住了新的,旧的就被挤出。


即便行业标杆谷歌 Genie 3,也只能保持约一分钟的一致性,之后场景逐渐崩坏。


问题出在记忆方式上。模型记的是“第5帧左上角有个方块”——时间索引。人类记的是“沙发在客厅角落”——空间索引。


时间索引随序列线性增长,记忆容量爆炸。空间索引只随场景复杂度增长,与时长无关。


Matrix-Game 3.5 实现业内首个几何对齐的 Patch 级长期记忆,把记忆从时间索引切换为空间索引,将历史观察提升至三维Patch Memory。


世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界


记忆单元从“整帧”降到“局部图像patch”——每个Patch独立存储、独立检索,通过几何对齐按需调取和复用历史内容。


模型记住的是“坐标(x,y,z)处有个物体”,不是“第5帧左上角”。


世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界


无论你离开多久、从哪个方向回来,地图都在。


“认不出”?Matrix-Game 3.5 :从“认像素”升级到“认空间”。


认不出,两个原因。


第一个:视角变了。同一个物体,正面看和侧面看像素完全不同。


传统模型用的是3D RoPE位置编码,编的是时间 t 和二维坐标 (x,y)。模型知道“像素在画面上的位置”,却不知道“这个位置为什么在这里”——不知道相机转了30度后像素该位移多少,也不知道这个像素对应真实世界的哪个点。


世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界


Matrix-Game 3.5 引入PRoPE,把相机投影矩阵直接编码进时空位置。模型学的不再是“这个像素在(x,y)”,而是“这个像素来自哪个视角、对应空间哪个点”。


再加上Warped RoPE,记忆 Patch 的位置从“来自第5帧左上角”升级为“在当前视角下应出现在三维空间的哪个坐标”。


第二个:背景乱了。镜头在动、物体在移、光影在变,如果动态变化和静态背景混在一起处理,背景表征被污染,模型连位置都搞不清,更别说认出物体。


Matrix-Game 3.5 的做法是动静解耦记忆:Patch Memory 负责记住稳定的静态场景结构,主体参考 Token 负责维持动态主体的身份和外观一致性。动态物体在写入记忆前被过滤掉,避免“一个移动的人”被误认为“多个不同的人”,减少重影与时序混淆。


世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界


背景是坐标锚点,动态内容是前景事件。物体重现时,先定位空间位置,再对齐视角,让模型认得准。


“变不对”?Matrix-Game 3.5 :把因果推理写进训练目标。


物体消失期间状态在变。模型既要感知“变了”,还要推演出“变成什么样”。


传统做法两步走:先理解状态,再生成动作。分开训练。


Matrix-Game 3.5 则打破传统,提出了新的因果推理范式——状态与动作联合生成。


世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界

真实场景中,动作主体在运动过程中,画面生成始终符合物理规律


状态预测与动作生成联合训练,放在同一个损失函数下共同优化。模型学的不只是“下一帧长什么样”,而是“如果我做这个动作,世界会怎样改变”。


Matrix-Game 3.5 进一步通过实验证明:联合训练后,状态理解和动作预测能力双双显著提升。


这种技术范式下,因果推理不是从数据里涌现的,它被直接写进训练目标,实现内生的因果推理能力。


三道题,三个对应解法,本质上是在做同一件事:让模型从“复现像素”到“理解因果”,从“感知表象”到“洞悉物理规律”。


世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界

超 1 分钟生成画面切换不同视角,环境等细节始终连续、合理存在


02

从游戏走向真实世界,三关怎么过?


攻克“物体恒存”难题,只是起点。


但昆仑万维在世界模型牌的野心不止于此,而是“推动世界模型跨越游戏边界,迈向机器人控制与物理世界交互。”


从游戏沙盒到通用物理世界,中间隔着三大难关。每一关,都决定了世界模型能不能真正走到真实场景里。


第一关:数据——给视频数据装上“物理标尺”


游戏是可控的物理世界,真实世界是失控的。


互联网视频没有深度标注,无法体现相机视角、运动轨迹。用这些数据训练,模型学到的永远是相对几何关系,画面在动,但不知道动了多少米、朝哪个方向。


真实数据稀缺,成为世界模型最大的瓶颈之一。


昆仑万维采用的解法很重,但绕不过去:给视频数据自动重建物理尺度。


他们搭建了三套自动化管线——


系统通过多Agent自动调研数千款游戏,筛选高价值数据源;


自动化离线标注管线估计每条视频的相机位姿、米制深度、相机内参;


Scene-Quality 自动评估系统从几何可重建性和生成训练价值两个维度评估数据质量。


世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界


三条自动化数据管线,产出 500 万以上高质量视频切片、1 万以上有效训练小时数,覆盖 1200 多个游戏场景和真实物理场景。


别人喂模型的是“视频”。昆仑喂模型的是带物理尺度的世界观测。


有了物理尺度,模型第一次能够理解空间中的“距离”和“速度”,而不是仅仅识别像素的排列方式。


这是世界模型从“看像素世界“到“懂真实世界”的第一步。


第二关:交互——速度逼平实时,输出直译指令


数据问题解决了,下一个难题是:延迟。


机器人控制场景里,延迟不是性能指标,是安全红线。卡一下,机械臂可能直接摔了碗,碰了人。不是“体验不好”,是“会出事故”。


生成速度必须逼近实时。


Matrix-Game 3.5用三件事把推理推到极限。


先是 3 步采样蒸馏。传统扩散模型生成一帧要几十步去噪,Matrix-Game 3.5 把它压缩到3步,画质不打折。


世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界


然后是 DiT 推理优化。做FFN INT8 量化来压缩权重,用 KV Cache 缓存已生成的键值对,避免重复计算。


最后是 MG-LightVAE 剪枝。对视频编码器做约 75% 的结构化剪枝,轻量化编解码。


三管齐下,5B 参数模型在单张 GPU上跑出了 720P 分辨率、约 20FPS 的实时生成。


世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界

复杂场景交互、视角切换流畅自然


交互关打通之后,世界模型从“观察世界”进化到了“精准、实时干预世界”。


世界模型从虚拟世界走向真实场景,又迈进了一步。


第三关:算力——用架构设计替代堆参数


速度上去了,算力也要可持续。


即便是处理离散的 token 序列的大语言模型,也深陷算力黑洞。


世界模型处理的是连续视频流,每一帧都要做完整的扩散生成,几十步去噪,每步都要过Transformer。计算量跟大语言模型,完全不是一个量级。


最直接的路是堆算力:更大的集群,更多的GPU。但这不是可持续的路。


Matrix-Game3.5 做了一个根本性突破:除角色Reference Adapter外,核心功能几乎不需要新增参数,即可实现交互世界建模,并可快速适配不同视频基础模型。


所有交互能力都靠架构设计本身实现,不靠堆参数硬撑。


这意味着什么?在引入交互、长时记忆和相机控制能力的同时,模型能够最大程度保留基础视频模型原生的生成能力,无需牺牲开放内容生成质量。


这套交互框架可以快速嫁接到不同的视频基础模型上。不用重写底层,不用为了加交互而牺牲画质。开放内容生成、多风格切换、复杂场景建模——这些能力不会因为交互的加入而打折。


这种轻量化的交互框架设计,让世界模型“真正可迁移、可落地”,从理想变成现实。


数据关,昆仑万维给视频装上了“尺子”;交互关,把生成速度推过实时红线,把输出从“画面”变成“指令”;算力关,用架构设计替代了参数堆叠。


昆仑万维系统地打通了数据、交互、算力三个瓶颈,让世界模型第一次具备了走进真实物理场景的完整条件。


这不是某个单点的工程优化和升级,是世界模型整个底层能力的系统化跃迁。


03

为什么是昆仑万维?


世界模型的牌桌,英伟达、谷歌等全球巨头抢先落座,Yann LeCun、李飞飞等学术大牛亲自下场,创业公司扎堆涌入。


玩家众多,座次未定。


而昆仑万维已经连出五张牌——Matrix-Zero、1.0、2.0、3.0、3.5,一张比一张大。


凭什么?


第一,它起步最早,技术路线最清晰。


2022年,宣布“All in AGI 与 AIGC”;2024年, Matrix-Zero 开启空间智能的体系化探索;2025年,Matrix-Game 1.0、2.0 接连发布;2026年,Matrix-Game 3.0、3.5 相继炸场。


当同行还在摸索技术路径,昆仑万维已经用一次次技术迭代,验证了一条清晰、完整的开发路线:双向DiT预训练→Self-Forcing/Causal Forcing蒸馏为因果模型→KVCache流式推理+记忆注入→25FPS的实时交互水平。


当行业还在争论“世界模型到底是什么”,Matrix-Game 团队已经给出了清晰的定义框架:理解当下状态、预测下一个状态、将预测结果渲染呈现。


当创业公司还在拿零产品、零营收讲百亿估值的故事,昆仑万维已经发布了“一箩筐”的世界模型产品,而最新发布的 Matrix-Game 3.5,则率先完成“具备因果推理与行动能力的底层引擎”的转身。


第二,它开源最坚决,拿下标准定义权。


昆仑万维 Matrix-Game系列模型“一次发布一次开源”的节奏,足以证明它对开源的态度和决心。


2025年5月,Matrix-Game 作为工业界首个10B+空间智能大模型正式开源。


三个月后,SkyWork AI技术发布周