
一个不会停下的世界。
这几天,世界模型又突然热闹了起来。
9月1日,李飞飞创办的World Labs发布了新一代世界模型Atlas。
它可以同时处理文本、图像、视频和三维信息,根据相机运动补出新的视角,也可以重建真实空间,进一步用于机器人训练与测试所需要的模拟环境。

World Labs依旧在空间智能的方向上持续推进,要做的不仅是让AI认识一张图片里的东西,还要让它理解这些东西存在于怎样的三维世界里。
而在Atlas发布的同一天,另一支团队Visko也正式推出了自己的世界模型Orbis,公司由Qing Yin创办,并完成了1000万美元Pre-seed融资。

Orbis当前展示出来的重点则更加集中,它希望让AI生成的世界持续运行,并且可以在运行过程中不断接受新的指令。
Visko将这类模型命名为Live Model,理解它最简单的感受,就好比看一场AI直播。
普通视频模型的逻辑很固定:输入提示词,等待模型运算,最终输出一段几秒到十几秒的成品视频。Orbis这一类则不一样,画面会不间断持续生成,音频同步输出,看到一半,用户还能追加新指令,直接改写后续内容。

最近这类体验正加速成为现实,最直接的推动因素,在于 AI 视频生成速度正在快速逼近实时播放的节奏。
MiniMax H3发布后,fal又推出了经过后训练和推理优化的H3 Max,一段五秒视频可以在三秒以内完成生成,速度已经快过视频本身的播放时间。
当生成速度达到这个区间以后,视频模型的用法也开始发生变化,最近火起来的H3 AI直播实验,本质上还是不断准备下一段视频,再把这些片段送进播放队列。

Orbis的实现思路不一样,持续推演是模型原生能力,开启一次会话之后,画面会持续推演,用户后续给出的指令,也会作用在同一会话当中。
当然,布局实时生成路线的并不只有Visko。过去一年,国内多家视频、世界模型团队都推出了相关成果,大家解决的问题各有侧重。
昆仑万维的Matrix Game 2.0去年就已经可以根据用户的键盘和鼠标操作实时生成画面,在通用场景里持续向前推演。

到了今年的Matrix Game 3.0,又进一步加入长期记忆,在720P下最高达到40 FPS,并尽量维持长时间运行时的空间和场景一致性。
爱诗科技的PixVerse R1今年年初就开始尝试持续运行的实时世界,用户可以在生成过程中继续输入提示词,让画面实时响应。
到了 4 月,R1 又加入多人共享世界,几个人可以在同一个实时画面里共同影响接下来的内容。

阿里也做了Happy Oyster,它同样强调实时可交互,用户可以通过文字、语音或者图片继续改变正在生成的世界。
产品还做了导演和漫游两种形态,一种更像站在镜头外控制接下来的剧情,另一种则让用户以第一人称进入画面里继续探索。

生数科技又公布了Vidu S1,它把实时交互进一步放到了人物身上,用户可以直接通过语音改变角色接下来的动作和行为,公开结果最高可以跑到42 FPS,也支持持续生成。

它们背后的共同变化也很明显,视频模型开始不满足于一次生成一条成片,而是尝试让画面一直存在,并在用户输入发生变化以后继续往下走。
Orbis也在这个赛道里,Visko将更多重心放在一个很现实的问题上,当画面连续运行几十分钟,模型究竟还能留存多少过往信息。
Orbis为此做了一套多尺度记忆机制,模型会持续保留人物、场景和风格里比较重要的信息,再拿这些记忆帮助后面的画面继续生成。

目前团队展示的结果可以维持到小时级。Visko对Live Model的构想,其实比Orbis当前展示出来的能力更大。
Orbis先把持续生成、实时交互和记忆做进视频世界里,而团队设想中的Live Model还需要持续感知外部信息,在运行过程中不断更新状态,甚至继续学习,并进一步理解现实世界里的物理变化。

Visko会选择这样的方向,多少也和创始人的经历有关。他本科就读于天津大学土木工程相关专业,后来进入Stanford攻读博士,长期研究计算力学、材料建模和物理模拟。
完成博士训练后,他又进入Columbia相关研究团队工作,后来加入Apple,继续从事工程与研发。
进入生成式AI以后,他研究的对象变成了一个由模型创建出来的视觉世界。这个世界要持续运行,也要尽量遵循运动规律,还要记住此前发生的状态。

Visko目前只有16名成员,团队整体也明显偏研究和工程。
哥伦比亚大学教授WaiChing Sun也在Visko的顾问阵容中,他长期研究计算力学,也是 Qing Yin 过去的学术合作者。
Orbis 1.0的另一位项目负责人Jie Yang来自Stanford,团队成员经历还覆盖苹果、Google DeepMind、Meta、亚马逊和特斯拉。
产品侧由Ying Yang负责,她此前参与过Lovart、Wanderboat,也加入过Manus Fellow Program。

Berkeley教授Michael I. Jordan也参与公司的顾问体系,并担任Advisory Board Chairman。
Visko出现的时间也刚好踩中了一个节点。AI 视频已经经历了很长一段画质竞争,各家公司不断解决人物一致性、运动自然度和镜头控制。
直播只是最容易理解的一个例子。一个模型如果可以持续运行并接受实时指令,就可以成为虚拟主播背后的画面引擎,也可以服务互动故事。

用户的一句话可能改变人物下一步的行动,观众的评论也可能影响接下来出现的环境。内容不需要提前全部制作完成,它可以随着参与者的行为继续生长。
游戏也很容易和这条能力联系起来。传统游戏里的场景、人物动作和剧情分支都需要提前制作,生成模型加入以后,部分视觉内容可以临时产生。问题在于游戏无法接受十几秒甚至几十秒的等待。

这类实时世界模型如果能够保持低延迟,同时维持人物和环境的一致性,它就有机会成为实时互动内容的一部分。
当然,这些应用目前大部分仍处于演示或者早期产品阶段。实时生成需要持续消耗大量算力,长时间稳定也远没有完全解决。

尤其是这批以实时视频为主要输出的世界模型,目前呈现给用户的核心依然是像素画面。
距离准确描述几何结构、物理状态,并稳定服务机器人训练的完整模拟环境,还有不少问题需要解决。

Visko将自己对这类模型的理解归纳为Live Model。它的关注点是让模型启动之后持续运行,保留此前的重要状态,在新的输入到来以后继续预测并更新这个世界。
Orbis 1.0是这套理念目前最直观的落地成果,伴随实时生成技术不断成熟,视频模型需要攻克的命题也会发生转向。
往后AI视频的较量,除了单次能产出多长素材,也会落脚在虚拟世界可以持续运转的时间。
文章来自于微信公众号 “虾蛄AI”,作者 “虾蛄AI”