7月底MiniMax H3开源的时候,Artificial Analysis视频编辑榜Elo 1130分。


直冲全球第一,社区一片叫好。


不得不说,H3底子确实好。


但真拿去做量产,短板也在:多镜头一长,角色开始走样;商品多拍几组,轮廓就说不准;十几个镜头连着跑,后面越来越不像同一部片子。


从「跑得通」到「生产能用」,差的那一段是工程。


现在这段被补上了。


9月29日,RunningHub发布H3 RH Enhanced,一个基于MiniMax H3开源基座做深度后训练的增强模型。


RunningHub是海马云旗下的一站式全能创作平台,是目前全球最大的AIGC开发者创作者社区,聚集了500万以上专业创作者,覆盖140多个国家和地区。


通过 2000 组实测,H3 RH Enhanced 多镜头长时序叙事能力显著优于 Seedance2.0,整体表现直追 seedance2.5。


一秒一毛钱即可直接产出成片,降低成本。


这意味着,一个开源后训练模型,做到了闭源的效果。而成本仅为同等效果闭源模型的十分之一。


H3 RH Enhanced已经登陆 MiniMax ,面向全球B端创作者进行公开调用。现在可以在RunningHub平台上限时免费体验。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


体验链接:


rhTV:


https://rhtv.runninghub.cn/projects?inviteCode=sn3gnlj9&model=484


RHSTORY:


https://story.runninghub.cn/ai-comic


2000组盲测


多镜头叙事显著优于Seedance 2.0


1 秒只要 0.1 元


发布会上的Demo都好看,问题是真实场景什么样。


RunningHub这次的评测是按业务场景铺开的:人物连续特写、多场景转场运镜、多角色互动、16镜头以上完整叙事,四类各500组,合计2000组对照样本,横向拉齐当前主流模型。


结果里最关键的一项是多镜头长叙事:8到16镜连续生成,人物身份一致性、场景元素留存、指令约束留存三项指标,RH Enhanced全部显著领先Seedance 2.0。


来看几条实测。


先看一条15秒的赛博机车追逐。 同一张参考图、同一段14镜提示词,分别喂给RH Enhanced和Seedance 2.0,480P直出,音频由模型自己生成,不做任何针对性调参。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


RH Enhanced这边,两辆车从起跑到冲线一直是参考图里那两辆,07号黑橙、12号白蓝,号码牌没糊过、没换过。


女主换了正面、背后、双人特写、终点定格四种机位,始终是同一张脸、同一套带橙色肩甲的机车服,背景城市也没跑偏。


声音跟画面一起生成出来:起跑前近乎安静,弹射那一拍轰鸣骤起,进隧道声画同时压暗,出隧道一起拉起。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


RH Enhanced生成


Seedance 2.0单帧画质不差,护目镜里的倒计时甚至更贴提示词。


但镜头一多就松了:第4镜两辆车变成Tron风格的光环轮,已经不是参考图那款车;第5镜航拍直接换了一座城,广告牌全没了,还有明显穿模;第6镜女主的机车服从装甲款退成了普通皮衣。


不算崩,但已经不是同一部片子。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


Seedance 2.0生成


十个镜头之后,RH Enhanced还认得参考图,Seedance 2.0开始凭印象重画。


再看一条电商的。 电商最怕的不是画面不美,是商品变样。


这条15镜香水片,RH Enhanced全程瓶子都是参考图那一只:方正厚玻璃、满瓶琥珀液、黑盖金环,ORBIT 07标识没漂过。


模特穿过沙漠、雨夜橱窗、电梯、天台,同一张脸、同一件黑丝绒礼服。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


RH Enhanced生成


Seedance 2.0同样精致,但电梯那镜,瓶子悬在了掌心上方。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


Seedance 2.0生成


极端长场景:人物崩坏率降低60%以上。


16镜往上,Seedance 2.0的角色遗忘开始集中爆发,前面还好好的女主角,后面突然换了张脸,衣服变了,道具丢了。RH Enhanced在同等条件下,这类崩坏砍掉了六成以上。


我们拿两条18镜的片子试了试。


18镜、五个世界,考的就是模型记不记得她是谁。


RH Enhanced从雨巷、沙漠、雪林、地铁到空间站再回雨巷,四次正面特写是同一张脸,黄雨衣一直敞着帽、红伞一直在手、黑包一直斜挎。第1镜埋下的街角时钟,第16镜回来还挂在原处。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


RH Enhanced生成


Seedance 2.0开场和结尾都不差,最后回眸那帧很像参考图。


但中段崩了:雨巷里帽子戴着,到雪林就摘了;更要命的是红伞,从雪林奔跑、进地铁到整段空间站漂浮,将近4秒、3个镜头里伞直接不见了,到舱门那镜才重新出现——


而提示词里「红伞、黑包、雨衣同时漂浮」恰恰是这段要测的东西。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


Seedance 2.0生成


另一条18镜的东方奇幻,两个人加一只灵兽,三个主体得同时在线。


RH Enhanced很稳:女剑仙的白发、额心红印从特写到收尾是同一张脸,剑没离过手;黑甲将军有正面近景,脸、盔甲、披风、长枪都对得上参考图;灵兽每次出现都是同一只鹤。


最难的最后一镜也守住了:天宫半塌、碎石还在掉,女主和鹤在桥头,将军在远处残阶,三者位置一眼清楚。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


RH Enhanced生成


Seedance 2.0画面同样华丽,但将军的近景只有盔甲没有脸;收尾天宫大门完好无损,「半塌」没发生。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


Seedance 2.0生成


RH Enhanced能在长叙事上拉开差距,靠的是一套自研的RH长程记忆引擎。


普通模型的记性像一扇滑动的窗,镜头一多,第1镜那张脸就被挤出窗外了。


长程记忆引擎干的事,是在模型架构层面把跨帧信息钉住,让第14镜还记得第1镜的五官、服装和道具,不靠后期修补。


上线以来,RH Enhanced日均生成接近100万秒视频,相当于每天6.7万条15秒短视频,或者3300多集5分钟短剧。


RunningHub后训练做了什么


五层工程改造


让H3在量产场景更稳更快更省


RunningHub这次动的不只是权重。


从后训练、分辨率适配、采样策略、推理引擎到服务调度,五层一起改,每一层对应量产里一个绕不过去的问题。


第一层:场景定向后训练——把短剧、电商、漫剧的业务约束练进模型里。


H3基座管的是通用能力,什么都能做。


但短剧里人物频繁换装换场,电商里商品轮廓和材质一点不能变,漫剧里动作要连贯不能断,这些垂直场景各有各的细规矩,需要单独练。


RunningHub基于H3的单流Omni-Transformer架构和MM-RoPE多模态位置编码,给RH Enhanced搭了一条「场景SFT → 一致性优化 → 少步蒸馏」的训练链路。


训练数据是RunningHub围绕短剧、电商、漫剧三类真实业务构建的,每条样本都标清楚哪个是参考素材、哪个是目标人物、镜头指令指向谁。


训练时盯死四件事:人不换脸、有参考图就要像、动作做完整、运镜不乱跳,正是废片率最高的四种情况。再加上长程记忆引擎在跨帧维度上的增强,就有了前面16镜以上崩坏率下降60%的结果。


第二层:分辨率感知适配——训练分布对齐实际交付规格。


短剧、电商、漫剧的成片有自己的交付规格,跟模型默认的训练分辨率并不一样。


RunningHub按宽高比、帧数、时长给训练数据分桶,让分布直接贴着交付规格走;再做区域加权,人脸、商品轮廓、服饰结构这些决定「能不能用」的地方权重拉高,背景适当放宽。


结果是视觉Token更短、算力更省,但该清楚的脸和商品依然清楚。出来的就是成片,直接进剪辑时间线。


第三层:少步蒸馏——把几十步的质量压进几步。


视频生成本质上是从噪声一步步迭代成画面,H3默认要跑几十步,每步都是一轮完整的Transformer前向。


RunningHub用「教师—学生」式轨迹蒸馏:教师跑完整采样,学生不只学最终结果,还学教师在每个阶段的速度场方向和终点重建目标,把多步才有的质量压进少步模型里。


步数也不是一刀切,静态镜头、对话戏少给几步,大幅运动、多参考素材的镜头多给几步。


第四层:注意力与缓存协同加速——让每一步算得更快。


推理执行层,RunningHub叠了三项技术。


SageAttention2对注意力矩阵做离群值平滑和细粒度低精度运算,不丢精度地提高吞吐。


Cache-DiT是RunningHub自研的Dual Block缓存,相邻采样步之间DiT中间层特征变化不大,全部重算是浪费,它按特征变化幅度决定哪些模块复用、哪些重算,首尾模块保留实时计算,中间按阈值复用残差,并设连续复用上限防止误差累积。


torch.compile把计算图编译成融合算子,减少Python层和显存之间的来回搬运。


多卡用TP2+Ulysses4混合并行,张量并行切权重,Ulysses切长序列注意力。这个组合专门适配PCIe连接的普通多卡环境,不需要NVLink,京东上能买到的RTX级服务器就能跑。


第五层:批量服务调度——一万条一起跑,成本才压得下来。


前四层解决单条视频怎么又快又好,但量产面对的是一天几十万条。


单条再快,GPU利用率上不去、任务调度不合理、显存碎片化,综合成本照样下不来。


RunningHub的服务层把输入形状相近、采样配置兼容的任务自动分桶组batch;高频配置做参数预热和编译缓存复用,省掉冷启动;再按任务队列的实时负载在多台服务器间调度。


考核的不是一条视频几秒生成,而是GPU时间、合格成片率和批量吞吐一起算,落到每条合格成片的交付成本上。


算下来,一秒一毛钱。


海马云十年GPU工程底子,加速和超分同步就位


五层改造讲起来清楚,做起来要的是从训练到推理内核到集群调度的全栈GPU工程能力。


RunningHub的母公司海马云做了十年云渲染,国内60多个边缘节点,3000万以上月活,8到10毫秒的实时云游戏。


十年云渲染真正留下的,是大规模异构GPU集群的运营和调度经验:型号不一的卡怎么统一管,怎么让每一张都跑满,推理优化怎么压进链路里。