下一幕,由你的想法决定

过去两年,AI 视频比的是生成质量;从过去两周起,比的是推理速度和实时性。基于 MiniMax H3 后训练视频模型的实时交互、GPT-6 和 Fable 5.1 的新一代模型跃升,在同一周撞到一起。AI 应用和模型迎来新的机会:视频不再是内容的终点,它正在变成互动娱乐的基础设施。
一、模型代有才人出,各领风骚半个月
模型层的缩圈战争仍在加速,Anthropic 和 OpenAI 相继发布 Claude Fable 5.1 和 GPT-6 Astra,GPT-6 官方把它定义为在计算机使用、软件工程等方向上的代际跨越,RSI 和 AGI 似乎不再遥远。得益于这些能力,大家纷纷开始尝试 Blender 建模和 3D 游戏开发,游戏玩法的 AI 生成第一次逼近可玩可用,Coding 和 3D 作为视频生成的参考素材也被大家纳入了新的技术方案。
而在多模态上,8 月初 MiniMax 开放 H3 的权重:一个 33B 参数的稠密视频模型,文本、图像、视频、音频在同一个上下文里,生成的视频自带对白、音效和配乐。开源的意义不在模型本身多强,而在于把“后训练”这件事交给了整个社区——LoRA、蒸馏、量化、稀疏注意力,几十个团队同时在同一个底座上做加速和后训练。
跑得最快的是 fal —— 一家领先的中转站和推理基础设施公司。它先对 H3 做了后训练,再搬上自家推理引擎,得到 H3 Max:768p 带音频的 5 秒片段,3 秒出片,成本也显著降低。

社区比 fal 还快。几天之内,开发者做出了无限刷的短视频流、由 RSS 和社区讨论喂养的 24 小时 AI 新闻台、实时你画我猜、约会模拟器、分支式文字冒险。大多粗糙,但它们证明了一件事:当生成时间小于播放时间,“视频”就不再是被制作出来然后被观看的东西,它可以被当场决定。
Manus 的联合创始人张涛,也在即刻和朋友圈发文:“下一个应用爆发的机会:延迟为一秒内的 seedance 来临之时。正好是两个月前发的,再强调一次”。

判断确实如此,除了社区开发者,一些公司其实已经在潜伏和发力了。AI 互动内容公司 Yoroll 刚发布了自己的后训练模型 Yoroll H3 Superfast,4 秒耗时即可推理 10 秒视频,并上线了由它驱动的实时叙事产品 YoLive。
而它背后的公司,恰好也是在 AI 互动游戏和互动视频上积累最早、作品最多的公司之一。

在此之前,这家公司和它平台上的创作者已经拿到过几个数字:
《丧尸清道夫》和《民国诡事》Steam 心愿单超过 5 万;《华君传:翻牌吧女帝》登陆抖音小游戏一个月,玩家达到 200 万;一位个人创作者花两天做出的《AI Odyssey》,冲上过美国 X 趋势榜第一。
二、快过实时的视频做出来了,但它能被玩吗
根据官方的描述,Yoroll H3 Superfast 是基于开源 MiniMax H3 做后训练与推理加速的版本,官方定位一句话:“为游戏而生,而不只是为电影。” 数字是:10 秒、768p、24fps、带原生音频的视频,8 张 B200 上 4 秒生成,2.5 倍实时,跑在 Yoroll 自己的推理栈上,使用大量游戏录屏数据来后训练。作为对照,fal 的 H3 Max 是 5 秒片段 3 秒内出片,约 1.7 倍实时。Superfast 已在 Yoroll 创作者平台上线。
与此同时,Yoroll 还发布了基于这个模型的新产品 YoLive(yo.live[1]),产品形态非常直接:一部大家共同参与、持续向前发展的互动剧情游戏。

进入 YoLive,观众看到的是一个持续播放的 AI 互动剧情频道。任何人都可以提出下一幕应该发生什么——让机器人跳舞、来一场天台追逐、加一个谁都没想到的反转——其他人为这些提议投票,得票最高的方向被系统结合已经发生的剧情、人物关系、当前地点和任务状态续写成新的影像,由 H3 Superfast 模型当场生成。第一个开放的频道来自《丧尸清道夫》:机器人牛仔、模特、鸵鸟和那片原子朋克废土构成了稳定的角色与世界,观众在这个世界里决定故事往哪走。

这让弹幕第一次有了实际参与的功能。以前大家在同一部作品旁边聊天,现在聊天进入了作品本身。一个人在意角色命运,一个人想制造笑点,还有人专门负责把故事带偏——不同意图撞在一起,成了下一幕的素材,也成了留在直播间的理由。对参与者来说,最有吸引力的瞬间是“刚才那个主意是我提的”。

实时生成和直播玩法已经上线 Yoroll App 和抖音直播间
比 YoLive 更能说明“实时生成是一种玩法”的,是平台上创作者正在孵化的一批小游戏。它们的共同点是:用 Yoroll Code 写玩法,用 H3 Superfast 的 API 生成画面,实时输入直接改变剧情。目前都在开发与探索阶段,但题材已经很鲜明。

在这批小游戏里,“实时”已经被放进了具体的交互设计。《相亲战士》让玩家按喜好定制相亲对象,通过自由对话和行动推动约会:一句试探、一个大胆的举动,都可能把下一幕带向不同的方向。《主播开箱模拟器》把直播间的弹幕变成送礼指令,观众决定箱子里装什么,AI 生成随之而来的开箱过程与主播反应——惊喜还是惊吓,由玩家出题。《火柴无限冒险》则让玩家自由决定纸上火柴人的行动:换一种身份,想一个出人意料的脱身办法,甚至提出预设选项之外的答案,AI 再把这些想象续写成新的画面与剧情。实时生成最直接的变化,是把玩家的想法变成游戏里接下来发生的事。

基于 H3 Superfast 模型的 UGC 实时游戏《相亲战士》
这些游戏体量都不大,但它们是我们见到的第一批把“下一幕由玩家的输入决定”当核心循环、而不是当宣传噱头的作品。

Yoroll Code 玩法和关卡开发工具已支持 GPT-6 Astra 和 H3 Superfast
三、AI 做出来的内容,为什么有人愿意玩
Yoroll 不是因为实时生成到来才入场的公司。正相反,它在这条赛道上做得很早、做得够多:小游戏拿到了玩家数据的验证,大型游戏已经达到精品程度,头部创作者已经进来。实时生成也好,预生成也罢,用户和玩家最关心的还是好的故事、有趣的玩法、上瘾的互动。
Yoroll 上首批创作者制作的《华君传:翻牌吧女帝》,是女性向互动内容,8 月登陆抖音小游戏后,不到一个月时间玩家就达到了 200 万,成为目前据我们所知玩家数量最多的 AI 互动影游之一。

《华君传》介绍和 200 万玩家
在海外,一位北美创作者在 Yoroll 上用两天时间和大约 250 美元,做出了《AI Odyssey》——包含 140 多段视频、11 个结局的竖屏互动影游,上线了 Yoroll 平台和 TikTok Minis 小游戏。恰逢诺兰《奥德赛》电影上映的热度,这款 AI 奥德赛互动游戏一度冲上美国 X 趋势榜第一。

而在大型游戏上,Yoroll 也在带着几款头部 AI 游戏杀入传统大型游戏工作室的领地。

上周在德国科隆,全球最大游戏展 gamescom 的 Yoroll 展台,坐到电脑前的玩家,大多以为自己会看一部 AI 短片——《丧尸清道夫》原本就是一部传播颇广的 AI 短片。
但试玩版的结构比 Steam 页面此前披露的复杂得多。除了互动影游常见的选项和 QTE,还有场景探索、第三人称射击和放置塔防。玩家控制机器人男主进入海滩清理丧尸,进入地铁站后视野收窄、尸潮涌来;操作段落结束,回到电影化叙事,背包、武器、数值这些状态被带进后续段落。
目前 90 分钟的实机试玩版,在科隆游戏展的试玩数据中玩家平均体验时间超过半小时。海外玩家的第一反应,是一款看起来像 AI 电影的游戏,竟然真的可以进入空间移动、探索和射击。这说明,AI 内容也是可以打动硬核玩家的。
这些游戏背后的玩法和系统,都已经变成了 Yoroll 的创作平台能力。当 AI 视频的质量越来越高、玩法的编程越来越好、实时生成越来越快,互动娱乐产品的爆发就即将来临。
四、开源模型作为基座拉平了大家的起跑线
回到模型,有一个有趣的问题:H3 开源一个月,几十个团队在同一个底座上做后训练,为什么 fal 和 Yoroll 这样的公司能交出不错的答卷?
把视角拉远一点看。大语言模型今天是“两超多强”:GPT 和 Claude 两家闭源领跑,多强几乎全是开源——DeepSeek、Qwen、GLM、Kimi K3 等等。开源的多强没有赢下基准,却赢下了应用层:更低的成本、更开放的生态(不会被封号或者限制并发)、拿更强的底座为应用自己的场景去调模型。视频模型的格局是“一超多强”,多强里大半是国内团队,过去也几乎都闭着。H3 把权重放出来之后一个月里发生的事,和 DeepSeek 开源之后那半年 LLM 应用层发生的事很像:LoRA、蒸馏、量化、稀疏注意力,同一个底座上长出多个版本,模型本身不再是稀缺品。

OpenRouter 上最近一个月 LLM 的调用榜单
开源拉平的是模型层的起跑线。没有拉平的是三样东西:推理栈、数据、产品。
fal 占的是推理栈和开发者。它本来就是做推理基础设施的,H3 Max 的快,一部分来自后训练,另一部分来自把模型搬进自家推理栈。fal 把“比实时更快”做成了公共品,任何人都能按秒买到。
Yoroll 占的是数据和产品。这也是它要做一个自己的版本、且能做一个自己的版本的原因。
首先是数据。Yoroll 从做互动影游和 3D 游戏的第一天起,就在积累一类别人没有的素材:游戏内影像。第一方长内容,加上创作者平台上的作品,留下了大量带分支、状态和玩法标注的镜头——什么样的画面接在什么样的选择之后,一个角色在 90 分钟里如何保持一致,射击段落和播片段落之间如何衔接。通用视频模型的训练数据来自电影和短视频,它擅长“拍”,不擅长“玩”。H3 Superfast 的后训练,就是拿游戏内数据去补它:游戏美术风格的稳定性、长序列中的角色一致性、镜头与玩法节奏的配合,以及为世界模型预留的动作控制(action control),让模型能根据玩家的操作而不只是文字提示来续写画面。
其次是产品。速度只有被消耗掉才有价值。Superfast 发布当天就有三个地方在用它:创作者平台上生成视频,YoLive 里接观众的投票,实时互动小游戏。每一次提速都直接落到玩家手里,玩家的反应又回来告诉模型团队该先修什么——角色没执行动作,道具前后消失,画面接不上。只做模型的公司难以拿到这些问题,只做应用的公司过去拿不到模型;开源解决了后一半,前一半只能靠自己做 C 端产品。
最后是推理栈。实时生成的更大难点,其实是在于推理优化和加速。Anthropic 欲以 60 亿美元收购 Decart (AI 互动视频和实时生成公司),很大程度上也是看重团队的这部分能力和积累。据了解,Yoroll 母公司 LinearGame 正在洽谈投资一家 AI 推理芯片公司,双方深度合作、软硬件协同优化,通过“云+端”的专用芯片来进一步落地实时推理生成,解决速度和成本问题。

开源底座会一代一代换,能跟着迁移的只有数据、产品和推理栈。这三样是在这一轮里真正能积累的东西。
五、未来属于“预生成 + 实时生成 ”
预生成负责打磨,实时生成负责回应。 主线、角色和关键场景提前制作,玩家未被预设的提问与行动,由实时生成接续。规则和状态系统负责记住发生过什么,保证故事与玩法连贯。
成本会决定两者的分工:多人共看、共同参与的实时流更容易分摊成本;个人化互动需要付费意愿支撑;可自由探索的持久世界,则有待控制能力与推理成本进一步改善。
作品也可以边被玩、边生长:先交付主线,再把玩家感兴趣的角色、空间和互动,打磨成后续内容。
长期竞争力来自内容与 IP、交互数据、创作工具、发行能力和推理成本控制。Yoroll 正在这些方向上积累。但最终,作品仍要回答:好不好玩,谁愿意花时间,谁愿意付费。
下一幕,从你的一个弹幕选择开始。

参考资料
[1]yo.live:http://yo.live/
文章来自于微信公众号 “十字路口Crossing”,作者 “十字路口Crossing”