导语|Flova 团队接受了成立以来的第一次公开采访。这家公司备受关注——一方面因为两轮融资累计超 8000 万美元(红杉、IDG、云九资本投资,据称是目前视频 Agent 产品最大融资),另一方面因为创始人郭列的创业履历。郭列 2013 年做出脸萌,之后是 FaceU 激萌,2018 年被字节跳动以 3 亿美金并购,随后在字节孵化轻颜相机、剪映和醒图。2025 年创业做 Flova,入局视频 Agent 赛道。我们跟 80 后创始人郭列、95 后增长和商业化负责人瑞瑞尔、00 后产品负责人唐果一起聊了聊。
比较其他视频产品,他们更关注的是 Codex、Manus 这些异业同行——「Coding 以及通用 Agent 确实在 Agent 上走得比较靠前,所以我们对 Coding 产品的设计会研究得多一点。」
产品官网:flova.tv。做视频网已收录 Flova 导航页:Flova AI – 一站式 AI 视频生成平台,支持多模型与一致性角色。

Founder Park:Flova 的诞生由来是怎么样的?
郭列:从字节出来后做了一段时间的游戏创业,也一直在关注 AI,做游戏的时候也加了一部分 AI 实践。但那时候会觉得模型比较重要,应用层能做的事情相对有限。24 年底、25 年初的时候,DeepSeek 出来了,是个开源模型,当时就觉得应用层应该会有很多发挥空间,开始尝试自己手搓一些东西。
当时自己手搓了一个 3 分多钟的 AI 短片。用 Midjourney 做图,人物一致性非常不好,抽卡抽了很多张。生视频主要用可灵,效果也没有现在这么好。最后用剪映辅助剪辑,花了两周,每天晚上熬夜到很晚。
就觉得这个工作量很大,做起来也很累。如果用 Agent 做,可能是一个更好的方式。所以开始搭 Agent 的 demo。做到一半,GPT Image 1 出来了,解决了一部分角色一致性问题,不然还要用 LoRA 训练去保持一致性,会更复杂。图片模型越来越好,去年视频模型也卷得厉害,效果慢慢上来,我们就一直往下做了。
Founder Park:为什么是视频?
郭列:主要还是自己感兴趣。我经常看电影,也看得挺多,挺喜欢电影和剧本这些东西,自己还去上过一些课程,包括剪辑、视频拍摄和剧本,那时候还不是 AI 相关的。后来就发现,其实可以把它产品化,而产品化这个事情,是我过往经历里相对擅长的。
Founder Park:当时摆在你面前的还有另一条路:用 AI 把游戏的制作流程和玩法重新做一遍。为什么没选?
郭列:游戏这段经历,跟我之前互联网的经历有很大的差别。游戏跟电影比较像,它比较看导演或者制作人,需要一个天才导演、天才制作人。通过游戏这次创业,我发现自己并不是那个天才制作人。
现在做 Flova,我对 AI 视频方向感兴趣,对影视行业也感兴趣,但你真的让我变成一个导演,我觉得可能也挺有挑战的。更多的还是会发现自己擅长做什么。如果你能做一个帮大家做出很好内容的产品,本身也是很有价值的。天才导演是更难的事情,那是不同的能力模型。
Founder Park:到什么时候觉得这个方向走通了?
郭列:我们应该是 5 月份开始做 Demo。当时出了一些成片之后,就觉得这个方向出来的效果还挺惊艳。比起手搓可能差远了,但比起你花的时间和最终出来的视频效果,是有一个非常大的提升。真正开始产品测试,到了 2025 年 9 月初。
唐果:之前手搓的时候会花大量时间做素材管理和收集,可能要根据不同镜头去排不同的素材。天天晚上熬夜,做很多不愿意做的事情。Manus 出来之后,我们在想能不能通过 Agent 的方式来做视频。当我们做出 Demo 的那一刻,发现自己能够更多地享受制作视频的快乐,那就是一个非常明确的信号。
Founder Park:从数据角度来看,你们什么时候觉得找到了 PMF?
瑞瑞尔:不管是用户创作内容品类的变化、单个用户消耗 Token 的观测,还是用户心智从「试模型」到「持续做内容创作」的转变,这三条线都出现了明显的 PMF 拐点。当然这也跟模型本身的演进有关系,尤其是 Seedance 2.0 提高了创作的下限。

Founder Park:市面上有很多视频类的产品,Flova 和别的有什么不一样?
瑞瑞尔:我们认为这个行业上的产品,根据业务演进的阶段,大概有三类。
第一类是模型厂商的 C 端应用。核心价值是自身模型的 Showcase,最佳商业模式就是卖 API。因为围绕自家模型构建,缺少第三方模型,对用户的完整创作体验是有缺失的。
第二类是模型一站式聚合平台。根据交互形态,会演变成对话式和画布式两类。但你会发现,它们的使用逻辑跟第一类是一样的。用户要自己去理解不同模型的上限是什么,提示词技巧是什么,一致性怎么保持,分镜怎么拆。需要用户对模型有很清晰的理解,对 Workflow 也有很多了解,才能做出高质量内容。
第三类是视频 Agent。不管是对话还是画布,都不是我们的本质,这只是人机交互的一种协作形式。真正核心的是 Agent 能够去懂用户的创作目标,懂不同模型的 Knowledge、不同工作流、不同美学风格的 Skill。它能极大降低用户的创作门槛。
Founder Park:那怎么区分聚合平台和视频 Agent?
瑞瑞尔:区别不在于画布还是对话,而在于谁来组织和执行创作过程,有没有解放用户的生产力——用户的注意力是在打磨提示词本身,还是回到了他想讲什么样的内容。聚合平台把模型和工具操作交给用户,用户仍然要自己规划、指挥和操作;视频 Agent 会理解用户的创作目标,接手大量执行和管理工作,让创作者把更多精力放回内容、创意和审美判断上。
Founder Park:画布和 Agent 是冲突的吗?
瑞瑞尔:不冲突。我们也有各种交互方案的尝试,包括画布。交互方式只是阶段性的手段,我们的目的一直没变,怎么让用户在当下阶段把模型的最佳性能发挥出来。核心看的是有没有解放用户的生产力。
唐果:画布本身不是问题。对很多设计类用户来说,拖拽、摆放、放大缩小是非常自然的交互。画布本质上是一个非线性的创意发散空间。但非线性空间带到 Agent 的设计里可能会产生一些问题——Agent 需要一个有序的、有结构化的、可以索引的容器。我们核心在探索的是,用户需要非线性发散的创作空间,Agent 需要有序可索引的 context 管理,这两者之间怎么达到聚合。
郭列:主要还是用户群体的差异。专业用户用画布更符合习惯,对小白用户来说,故事板的顺序更友好。但这些只是内容的展现方式,不是我们最看重的部分。我们更看重的是 Agent 怎么组织和管理这些内容资产。

Founder Park:Flova 的 Skill 和通用 Agent 的 Skill 有什么区别?
唐果:整体的逻辑来说是一样的,通过渐进式披露节省上下文。当决定要用这个 Skill 之后,可以把更多业务知识给到 Agent。但因为服务的 Agent 不一样,定义的工具不一样,Skill 的工作方法就不一样。
做视频产品,用的模型除了语言模型、视觉模型,可能还有视频生成模型、音频生成模型、图像生成模型、3D 模型、物理模型。涉及到的工具也五花八门,有浏览器、有画布、有搜索、有各种格式文件的解析。Flova 的 Skill 要理解的不仅是一个工具调用接口,还有创作审美、叙事节奏、分镜逻辑等视频特有的知识。
Founder Park:怎么才不会被模型吃掉?Agent 的核心壁垒在哪?
郭列:Agent 是把用户所有创作内容的上下文放在一个容器里。比如 10 个镜头的某一个镜头要修改,这个修改可能牵连到其他镜头、其他角色、其他音频生成,这些全在一个上下文里面,Agent 会更了解。如果用户要大幅修改,比如删掉一个人物,可能涉及所有镜头的修改,这些也是 Agent 可以做到的。它在做一个全知上下文的控制。
做视频 Agent 产品,不是直接满足用户需求,是通过 Agent 去更好地满足。模型会越来越强,但 Agent 层的价值在于理解用户的创作意图并把模型的输出整合为完整作品——这涉及场景理解、上下文管理、素材组织和创作流程编排,不是单点模型能力能覆盖的。
做视频网 Flova 导航页 有产品核心能力和上手建议的更完整介绍。
Founder Park:对未来怎么看?
郭列:从 3G 到 5G,从文字图片到视频,移动互联网走了很长的过程。在 AI 时代,我们对整个技术会更有耐心,相信它最终会变得更便宜、更普适、效果更好,以这样的角度去跨越一些周期来做产品。短期波动比较正常,相信长期会有最终的变化。
本文基于 Founder Park 与 Flova 团队的独家采访内容做原创整理。采访对象:创始人郭列、增长和商业化负责人瑞瑞尔、产品负责人唐果。经编辑整理。
