这是 Flova 团队的第一次公开采访。


Flova 很受关注,融资是一方面,两轮融资,红杉、IDG 和云九资本投资,累计超 8000 万美元,据说是目前视频 Agent 产品的最大融资。


独家对话 Flova :脸萌、剪映后郭列再创业,做视频 Agent、但学的是 Claude Code


而更主要的原因,可能是创始人郭列。郭列 2013 年做出脸萌,之后是 FaceU 激萌,2018 年被字节跳动以 3 亿美金并购,随后在字节孵化了轻颜相机、剪映和醒图。2025 年创业做 Flova,入局视频 Agent 赛道。


我们很好奇,在视频 Agent 这样一个可能唯二被验证了 PMF 的赛道,这样一个有着连续成功创业经验的创业者,和他的新团队,如何思考视频 Agent 的产品、竞争和商业化。视频 Agent 的核心壁垒在哪里,怎么才不会被模型吃掉,下一步打算做什么?


我们跟 80 后创始人郭列、 95 后增长和商业化负责人瑞瑞尔、 00 后产品负责人唐果一起聊了聊。相比较其他的视频产品,他们更关注的,却是 Codex、Manus 这些异业同行,「Coding  以及通用 Agent 确实在 Agent 上走得比较靠前,所以我们对 Coding 产品的设计会研究得多一点。」


也正因此,团队眼中的 Agent 的竞争,核心是持续观测用户和 Agent 如何完成共同创作,「做 Agent 产品,不是直接满足用户需求,是通过 Agent 去更好地满足。」


产品官网https://www.flova.ai/


以下是 Founder Park 与 Flova 团队的对话,经编辑整理。


01


当不了天才制作人,


就为创作者做一款好产品


Founder Park:Flova 的诞生由来是怎么样的?


郭列:从字节出来后做了一段时间的游戏创业,也一直在关注 AI,做游戏的时候也加了一部分 AI 实践。但那时候会觉得模型比较重要,应用层能做的事情相对有限。24 年底、25 年初的时候,DeepSeek 出来了,是个开源模型,当时就觉得应用层应该会有很多发挥空间,开始尝试自己手搓一些东西。


当时自己手搓了一个 3 分多钟的 AI 短片。用 Midjourney 做图,人物一致性非常不好,抽卡抽了很多张。生视频主要用可灵,效果也没有现在这么好。最后用剪映辅助剪辑,花了两周,每天晚上熬夜熬到很晚。


就觉得这个工作量很大,做起来也很累。如果用 Agent 做,可能是一个更好的方式。所以开始搭 Agent 的 demo。做到一半,GPT Image 1 出来了,解决了一部分角色一致性问题,不然还要用 LoRA 训练去保持一致性,会更复杂。图片模型越来越好,去年视频模型也卷得厉害,效果慢慢上来,我们就一直往下做了。


Founder Park:为什么是视频?


郭列:主要还是自己感兴趣。我经常看电影,也看得挺多,挺喜欢电影和剧本这些东西,自己还去上过一些课程,包括剪辑、视频拍摄和剧本,那时候还不是 AI 相关的。后来就发现,其实可以把它产品化,而产品化这个事情,是我过往经历里相对擅长的。


Founder Park:当时摆在你面前的还有另一条路:用 AI 把游戏的制作流程和玩法重新做一遍。为什么没选?


郭列:游戏这段经历,跟我之前互联网的经历有很大的差别。游戏跟电影比较像,它比较看导演或者制作人,需要一个天才导演、天才制作人。通过游戏这次创业,我发现自己并不是那个天才制作人。


现在做 Flova,我对 AI 视频方向感兴趣,对影视行业也感兴趣,但你真的让我变成一个导演,我觉得可能也挺有挑战的。更多的还是会发现自己擅长做什么。如果你能做一个帮大家做出很好内容的产品,本身也是很有价值的。天才导演是更难的事情,那是不同的能力模型。


Founder Park:到什么时候觉得这个方向走通了?


郭列:我们应该是 5 月份开始做 Demo。当时出了一些成片之后,就觉得这个方向出来的效果还挺惊艳。比起手搓可能差远了,但比起你花的时间和最终出来的视频效果,是有一个非常大的提升。真正开始产品测试,到了 2025 年 9 月初。


唐果:之前手搓的时候会花大量时间做素材管理和收集,可能要根据不同镜头去排不同的素材。天天晚上熬夜,做很多不愿意做的事情。Manus 出来之后,我们在想能不能通过 Agent 的方式来做视频,能不能帮我们减少在这些事情上的花费。当我们做出 Demo 的那一刻,发现自己能够更多地享受制作视频的快乐,那就是一个非常明确的信号。我们意识到可以这样做视频,和原本手搓视频的时代是一个完全不一样的 Moment。


Founder Park:从数据角度来看,你们什么时候觉得找到了 PMF?


瑞瑞尔:不管是用户创作内容品类的变化、单个用户消耗 Token 的观测,还是用户心智从试模型到持续做内容创作,这三条线都出现了明显的 PMF 拐点。当然这也跟模型本身的演进有关系,尤其是 Seedance 2.0,它很好地提高了创作的下限。


02


视频 Agent 做指挥官,


用户做决策和判断


Founder Park:市面上有很多视频类的产品,Flova 和别的有什么不一样?


瑞瑞尔:我们认为这个行业上的产品,根据业务演进的阶段,大概有三类。


第一类是模型厂商的 C 端应用。核心价值是自身模型的 Showcase,最佳商业模式就是卖 API。因为围绕自家模型构建,缺少第三方模型,对用户的完整创作体验是有缺失的。


第二类是模型一站式聚合平台。根据交互形态,会演变成对话式和画布式两类。但你会发现,它们的使用逻辑跟第一类是一样的。用户要自己去理解不同模型的上限是什么,提示词技巧是什么,一致性怎么保持,分镜怎么拆。需要用户对模型有很清晰的理解,对 Workflow 也有很多了解,才能做出高质量内容。


第三类是视频 Agent。不管是对话还是画布,都不是我们的本质,这只是人机交互的一种协作形式。真正核心的是 Agent 能够去懂用户的创作目标,懂不同模型的 Knowledge、不同工作流、不同美学风格的 Skill。它能极大降低用户的创作门槛。


Founder Park:那怎么区分聚合平台和视频 Agent?


瑞瑞尔:区别不在于画布还是对话,而在于谁来组织和执行创作过程,有没有解放用户的生产力:用户的注意力是在打磨提示词本身,还是回到了他想讲什么样的内容。聚合平台把模型和工具操作交给用户,用户仍然要自己规划、指挥和操作;视频 Agent 会理解用户的创作目标,接手大量执行和管理工作,让创作者把更多精力放回内容、创意和审美判断上。


唐果:单点的模型聚合平台,本质上每一次点击生成都是一次独立的开始。用户要自己做很多信息管理,比如片段和片段之间怎么组织。但我们知道,视频创作的核心难点不是生成单个好看的片段,而是把多个好看的片段组织成一个一致的作品。


这个过程中夹杂着创作者很多自己的判断。你可能会探索和尝试很多角色和风格,最后哪一个形象是你认可的?哪一个风格是你希望在整个创作流程中持续保持的?对创作 Agent 来说,非常重要的一点是不能把每一次生成当做一次孤立的开始,核心是要能帮用户整理素材、做版本管理,让创作者感觉和 Agent 一起在协作,甚至被 Agent 推着往前走,一起把完整的项目落实下来。


独家对话 Flova :脸萌、剪映后郭列再创业,做视频 Agent、但学的是 Claude Code


郭列:Agent 其实是把用户所有创作内容的上下文放在一个容器里。比如 10 个镜头的某一个镜头要修改,这个修改可能牵连到其他镜头、其他角色、其他音频生成,这些全在一个上下文里面,Agent 会更了解。如果用户要大幅修改,比如删掉一个人物,可能涉及所有镜头的修改,这些也是 Agent 可以做到的。它在做一个全知上下文的控制。


Founder Park:画布和 Agent 是冲突的吗?


瑞瑞尔:不冲突。我们也有各种交互方案的尝试,包括画布。交互方式只是阶段性的手段,我们的目的一直没变,怎么让用户在当下阶段把模型的最佳性能发挥出来,做出最高上限的内容效果。核心看的是有没有解放用户的生产力,用户的注意力是还在打磨提示词,还是回到了他想讲什么内容、围绕内容做发散收敛。


唐果:画布本身不是问题。对很多设计类用户来说,拖拽、摆放、放大缩小是非常自然的交互。画布本质上是一个非线性的创意发散空间。但你直接把非线性的创意发散空间带到 Agent 的设计里,可能会产生一些问题。Agent 需要一个有序的、有结构化的、可以索引的容器。


所以我们核心在探索的是,用户需要非线性发散的创作空间,Agent 需要有序可索引的context 管理,这两者之间怎么达到聚合?用户操作的工作台,和 Agent 最后理解的 context 数据结构,要能达到信息转化。


郭列:主要还是用户群体的差异。专业用户用画布更符合习惯,他们更希望在一个平面上发散。对小白用户来说,故事板的顺序更友好。但这些只是内容的展现方式,不是我们最看重的部分。我们更看重的是 Agent 怎么组织和管理这些内容资产,可以比较好地去调度它。


我们也看到了一些很有趣的用户行为。有些用户几乎只通过右侧的对话框完成创作,左边的辅助功能很少使用,所有修改都直接用自然语言告诉 Agent。随着 Agent 越来越智能、模型成本越来越低,我们认为这种创作方式会越来越普遍;未来需要用户亲手完成每一步操作的情况,反而可能会越来越少。


03


视频 Agent 的核心是资产管理、


以及人的 Taste


Founder Park:Flova 的 Skill 和通用 Agent 的 Skill 有什么区别?


唐果:整体的逻辑来说是一样的,通过渐进式披露节省上下文。当决定要用这个 Skill 之后,可以把更多业务知识给到 Agent。但因为服务的 Agent 不一样,定义的工具不一样,Skill 的工作方法就不一样。


郭列:我们把 Agent 所有的原子能力做了拆分,创作者可以灵活调动这些工具,自定义出好用的 Skill。做好了一个 Skill 之后,这个 Agent 有可能就是他自己的 Agent,不是我们设计的,因为所有提示词、喜好、流程都是他自己来定义的。


创作者给我们的输入比我们本身更多,他们的很多玩法出乎我们意料。我们想做的更多是帮他审核,找出可能有问题的地方,保证这个 Skill 在平台上没有 bug、运转顺畅。创意本身还是由超创和用户自己提供的。


独家对话 Flova :脸萌、剪映后郭列再创业,做视频 Agent、但学的是 Claude Code


Founder Park:前期覆盖哪些场景的 Skill,是怎么判断的?


瑞瑞尔:官方 Skill 前期会优先覆盖那些成熟、反复出现的创作需求,比如拉片、故事影片和短剧,为不同场景提供一个可以直接使用的基础版本。


在这个基础上,Skill 大概会沿着三个方向继续演化。第一类服务要求更高的专业用户。他们通常不会直接照搬官方 Skill,而是会根据自己的创作习惯、团队流程和质量要求,改造成更适合自己的版本。第二类是内容玩法创新,比如女友视角、互动视频或当下流行的创作主题,让新用户更容易体验到 Agent 能做什么。第三类是审美和风格,比如围绕某种镜头语言、视觉风格或导演表达方式进行定制。


所以我们判断一个场景是否值得做成 Skill,不只是看它属于短剧、MV 还是口播,更重要的是看其中有没有可以反复复用的创作方法,包括任务怎么拆、工具怎么用、生成顺序怎么安排,以及哪些地方需要用户做判断。官方提供基础版本,专业创作者再在真实项目里不断修改和 完善。


Founder Park:创作没有标准答案,Skill 有吗?


唐果:创作本身就是多元的,不会存在一个 Skill 就是某个场景最好的效果。Skill 只是让 Agent 进入不同创作场景的一种方案,能沉淀某一类视频的专业经验,告诉 Agent 在这个场景中通常怎么拆解任务、哪些工具比较重要、哪些地方需要批量执行。


但真正重要的审美判断,还是在用户自己的个性化项目里落实。让创作最终成为创作者自己的东西,这才是好的 Skill。真正有价值的 Skill,是在真实项目中被反复修改和验证出来的。官方和超创一起搭建标杆 Skill,用户在生产项目中验证它确实能降低创作成本、提高质量,自然会有动力去复用、改造和传播,整个生态才能养起来。


Founder Park:视频 Agent 的上下文管理和 Coding Agent 的核心区别是什么?


唐果:最核心的区别就是模态存储的逻辑不一样。Coding 里所有东西本质上都是文件,可以用比较成熟的 Git 做版本管理。


但多模态的数据怎么做存储和管理,逻辑完全不同。比如一个元素图,可以同时被引用为镜头 A 的参考图,又可以作为另一个镜头的关键帧。视频 Agent 里所有的 context 都是多模态的,图片、视频、用户上传的素材,甚至你的 Prompt 都有可能进入上下文。


第二个差异是版本管理。创意的过程就是不断发散、再不断收敛。用户选的版本,不是一开始生成的那个,也不是最后一次生成的,而是中间某次灵光乍现生成出来的。怎么做好版本管理、怎么辅助用户的决策,是和通用 Agent 完全不一样的点。


Founder Park:Memory 管理在视频 Agent 里的优先级怎么样?


唐果:一般 Agent 做 Memory,大致有两种方式。一种是在任务进行过程中,让 Agent 主动把重要信息写进文件或备忘录;另一种是任务结束后,回看之前的对话和执行过程,从中提取用户偏好、关键事实和长期有用的信息,之后再按需取出来。


视频 Agent 也需要这些能力,但它要记住的不只是用户说过什么。一个视频项目里还有大量多模态信息和版本关系:最终选定了哪个角色形象,哪些素材被哪些镜头引用,用户在多个版本里保留了什么、放弃了什么,以及哪种风格需要在后续内容里延续。对于几百集、几千个镜头的项目,这些信息还需要跨镜头、跨集甚至跨项目继续使用。


另外,团队的创作方式也需要被沉淀。比如怎么拆剧本、怎么确认角色、哪些环节需要人工判断,可以通过 Skill 让 Agent 逐渐适应这套工作方式。所以视频 Agent 的 Memory 不只是对聊天记录的提取,而是对素材、版本、用户判断和创作方法的持续继承。


Founder Park:视频 Agent 能像 Coding Agent 那样 Human on the loop吗?


唐果:首先,两个场景不一样。Coding 为什么对模型厂商更好训?从训练数据集你就能看出来,它有一个更可被验证的答案,奖励模型好训,结果是否符合预期也好验证。


但创作领域不一样,很多偏好你要用自己的眼睛才能看出来。而且人本来就是一个很好的多模态「模型」:我看到那些图,自然而然就知道哪一个是好的;但要看一个超长的文本,认知负荷是比较大的。


第二点,是怎么让人进入心流的状态。Coding 里我可以托管一个任务,就撒手去做别的了。但在创作里,要让人和 Agent 都进入心流:Agent 有一个好的工作环境,自由地检索上下文、使用工具,把结果写回创作过程;人有一个足够直觉的工作台,并行生成很多个镜头,检视 Agent 的工作,把相同镜头的不同版本放在一起,看哪一个更符合自己的直觉判断。


关键在于信息同步。一个比较好的产品容器,应该是 Human 和 Agent 共同工作的容器:让 Agent 自由地执行,让用户自由地选择和确认,把决策成本降到最低。至少在创作领域是这样。


Founder Park:往前想一步,更合理的交互形态会是什么样?


唐果:至少在创作领域,现阶段的解法就是,人要参与很多审美上的决策。这句话在 AI 界说得有点老生常谈了,就是 taste 是取代不了的,特别是多模态的 taste,非常依赖人本身。


当然,不同的用户有不同的创作方式。也有用户更偏好托管,比如把任务托管给自己的 Codex 或者 Claude Code,让它们来操纵 Flova 的 Agent。所以我们也在做对应的 CLI。真正重要的,还是观测好用户和 Agent 到底在以怎样的方式协作,端内决策也好,CLI 托管也好,观测好了,才知道怎么为 Agent 打造更好的工具、权限和 context 组织。


04


真正的壁垒,


是持续观测用户和 Agent 如何