1962 年,MIT 林肯实验室的伊万・萨瑟兰发表了一篇题为《Sketchpad:一个人机交互通信的图形系统》的论文。
里面首次用了 「计算机图形学」这个名词,很久以后人们才发现,这个词定义了我们所看到的,用图标、模块、点击等可视化的互动系统来组织并且呈现信息,完成人机交互的方式。
人和计算机的交互,过去60多年,依然延续着「计算机图形学」开创的很多范式。

但近两年,随着视频模型、世界模型的迭代,似乎更直观、更即时、更加摆脱计算机本身屏幕限制的交互形态,正在诞生。
AI的触手,已经伸进了物理世界,可以和现实中的我们产生连接。
我在想,如果视频不再只是被观看,还可以被进入、可以实时交互,会发生什么?
看到形界智能「Era」系列的原生模型Rise正式发布了,用500ms的端到端响应延迟,让人机交互,有了新的变量。
第一时间测试了一下,给大家介绍介绍。

01
全域沉浸,一种全新的视频交互形态
如果把现有的视频生成模型,按交互方式分类,大致可以分成三种。
第一种是离线视频生成。这是比较主流的形态,Seedance 2.5、MiniMax H3等都属于这一类。
交互方式是输入到输出,用户给一个指令,模型按指令生成一段视频。你说什么,它呈现什么。
第二种是实时视频生成。爱诗科技、生数科技往这个方向有一些尝试。
他们把渲染速度做到了实时,你输入 prompt,画面几乎同时出来。可以在一定程度上,支持实时数字人视频通话,还有语音控制视频走向。
速度变了,但输入和输出的映射关系没变。本质还是对提示词的执行,你说什么、它呈现什么,只是会更快。
第三个是全域沉浸式生成。
这是在输入侧增加了一层感知层,模型不再只是被动等待 prompt,而是主动接收用户的实时指令、表情、环境和动作等多模态信号。
输出的内容会基于用户的状态变化而有所不同,不再是 prompt 到结果的单一映射。
前两类,解决的是怎么让视频生成得更快、更好。
现在,形界智能Rise,希望探索的是怎么让用户进入一段视频,现实中的人挥动双手,视频中可以实时发生变化。
到这里,现实和屏幕世界的边界,第一次模糊了。

人和视频、人和计算机的交互,似乎也第一次有了新的味道。
有了摄像头的理解能力,随时随地和虚拟世界里面的物体、人,甚至环境进行互动,很神奇。
02
Rise模型,从技术到体验,不一样
特意研究了一下,目前主流的互动视频技术,实际上是两阶段串行系统:
先由一个视频理解模型解析用户的交互信号,生成渲染指令,再由一个视频生成模型根据指令生成画面。
但这存在两个很难绕过去的问题。
第一个是智能上限的问题。
用户的交互信号没办法被生成模型直接 Scaling,理解模型和生成模型各跑各的,Representation 没办法在同一个空间里联合优化。
说白了就是两个模型之间隔着一堵墙,理解侧再聪明,生成侧也接不住。
第二个是延迟的问题。
GenZ 时代的互动内容消费者,能接受的端到端响应耗时平均在 500 毫秒。
但两阶段串行系统从用户动作到画面响应,体感端到端时延在 4 秒左右。
理解模型生成指令要时间,生成模型接收指令再渲染也要时间,两个阶段串起来,4 秒已经算快的了。
4 秒是什么概念?在互动场景里,4 秒的延迟基本等于断联。
做一个动作,等 4 秒才看到反馈,那种沉浸感早就碎了。
这套两阶段的双工视频生成系统,是互动视频技术的中间形态。它代表了上一个时代能触碰的互动体验上限——不是技术做不到更好,是架构决定了天花板就在那里。
形界智能选择了另一条路。
他们把视频理解和视频生成做到一个模型里,在时序上把输出的每一帧和用户摄像头输入的每一帧统一建模。
没有理解模型和生成模型的分立,没有两阶段的串行等待,输入和输出在一个模型里端到端地流动。
这条路难在哪里?难在 Representation 的对齐。
视频理解需要的是语义层面的抽象,视频生成需要的是像素层面的细节,这两套东西要在同一个空间里共同优化,对模型架构和训练方法的要求极高。

但这条路走通之后的好处也是结构性的。
没有了串行等待,端到端延迟被压到了 500 毫秒以内。
这个数字刚好卡在人类感知实时交互的临界点上,超过 500 毫秒,人会感觉到卡顿;低于 500 毫秒,交互是流畅的。
形界智能今天发布的 Rise 模型,是 Era 系列第二个原生全双工视频生成基础模型。
基于约 300 小时的赛车视频的后训练数据,Rise 模拟了高速赛车场景的真实物理引擎反馈。

但真正让我觉得有意思的不是赛车本身,是 Rise 在理解侧展现出来的泛化性。
不需要专业的方向盘控制器。
对着摄像头用任意形状的东西比划:垫子、手机、甚至空手,模型都能理解你的转向意图,实时生成对应的驾驶画面。第一人称可以,第三人称也可以。
也就是说,进入这个虚拟世界的交互成本,被降到了几乎为零。
只要做出日常的真实的动作,模型就能理解你。
这才是这件事最核心的变化。
过去几十年,我们和虚拟内容之间的交互一直需要一层中介。

键盘、鼠标、手柄、方向盘,每一种外设都是一层翻译器,把我们的意图翻译成机器能理解的信号。
但现在,摄像头加上模型的理解能力,让这层翻译器变得多余了。
可以直接用手势、用动作、用任何你觉得自然的方式和虚拟世界沟通。
就像在乔布斯带来iPod、iPhone之前,人们很难想象没有物理按键的手机一样;
今天,也许我们更习惯的手势、动作等等,也可以成为更自然的人和计算机、人与模型的交互方式。
03
内容的新定义
我一直在想:视频生成这个赛道,最终的终局是什么?
是生成一段无限长的视频吗?是生成 4K 甚至 8K 的画面吗?是让物理模拟真实到分不清真假吗?
这些都很重要,但肯定都不是终点。
现在的所有视频生成模型都在走一条路径,叫把视频生成得更好、更快。
但它本质都还是在执行 prompt。用户给什么指令,模型出什么结果,中间没有变量。
但有了感知层之后,输出的内容可以基于用户的状态变化而有所不同。
它不再仅仅是 prompt 到结果的一一映射,还可以有更多的智能和现实体验,体现在里面。
这让我想起形界智能上一个模型 Genesis 发布时提出的一个概念,叫体验优先计算。

他们关心的不是这段视频生成得有多快多好,而是用户有没有真正进入其中。
这两个问题的差别,就是两个时代的差别。
从订单逻辑,到现制逻辑,再到实时响应,接下来,人和模型的关系,人和内容的关系,也会发生变化。
Rise 想做的,就是让内容可以根据你的状态实时变化。
人动一下,画面就跟着动一下。换一种方式进入,画面就换一种方式响应。
是不是已经有了点《头号玩家》的样子?
还有一个细节。
Rise 的每一次真实交互,都是模型进化的燃料。
用户交互信号进入模型,模型实时生成体验,用户给出反馈,这些交互视频数据积累下来,又反过来优化模型。
而且这个飞轮的转动速度会比传统的内容平台快得多,因为每一次交互产生的不是静态的数据点,还包含了用户意图、模型响应、用户反馈的完整闭环数据。
我在想,这个「流式理解+流式生成」的双流架构的意义,除了单次体验的提升,更在于它形成了一个新的数据闭环。
Rise 目前跑通的场景是赛车。300 小时的赛车视频数据,让模型学会了高速场景的物理反馈和实时响应。

但这只是开始。
作为一个通用的双流视频模型架构,后续会在其他场景持续释放能力。
如果同样的架构,被应用到虚拟陪伴、互动娱乐、虚拟角色这些场景,事情也会很快就不一样了。
你对着摄像头笑一下,屏幕里的Ta就跟着笑。你皱一下眉头,Ta就问你怎么了。你做一个手势,Ta就知道你想要什么……
生成一个能感知你、理解你、回答你的世界,就好像,对宇宙的所有呼唤,都有了具象的回应。
04
一点思考
我不喜欢用颠覆、炸裂这样的词汇,但似乎,能改变世界的模型,一定会先从改变交互体验开始。
当我们和视频的交互和相应有了不同,一种全新的内容形态、消费体验,甚至是虚拟互动的世界,即将开启。
Rise 已经把理解和生成揉进一个模型里,让用户用最自然的方式进入虚拟世界。
这条路肯定难,但似乎跳出了雕花的、重复的漩涡。
了解了一下,创始人王裕鑫,是很年轻有想象力的一位技术大牛。
2023年博士毕业,应届拿了华为、腾讯、字节、快手等多家头部企业的顶尖人才计划,最后选择投身大模型赛道创业。

在元石科技期间,他牵头组建了国内首批 MoE 架构大模型预训练团队,主导了 200B+ MoE 模型的训练工作。
其团队曾被 Django 联创 Simon Willison 评选为 2025 年中国 Top 6 大模型团队之一。
他们是明星团队,但更让我兴奋的,是他们在尝试定义,未来的内容交互范式。
随时随地,和一个虚拟世界里面的物体、人、环境,进行即时互动,产生新的创意和体验。
这可能是未来几年世界模型、视频生成赛道更值得看的方向。
现在,Rise 非常有诚意,没有 waiting list,官网能直接体验。

官网:https://www.frame-x.ai/models/rise?ref=rsh_a77729dy19d2qn03
感兴趣的朋友,抓紧去试试!
用手比划一下,就能感受这种新的交互方式!
也许有一天,我们看到人们都在自己家里,对着空中手舞足蹈,别奇怪,也许那就是更好玩的未来模样……
文章来自于微信公众号 “AI异类弗兰克”,作者 “AI异类弗兰克”