MAVIN 是面向多镜头音视频联合生成的研究框架,重点解决镜头切换、对白时间、跨镜头角色一致性以及视觉身份与音色绑定等问题。用户可以从自由形式的故事描述出发,经由多智能体脚本流水线形成全局、镜头和角色三级结构化脚本,再由生成模型按照时间边界执行。
核心技术
- 边界感知注意力:把镜头描述、角色动作和对白限制在对应时间区间。
- 身份感知传播:通过参考图像、参考音频和身份掩码维持跨镜头外貌与音色一致。
- 多智能体脚本流水线:将故事梗概补全为包含镜头边界、对白区间、动作和环境声音的可执行脚本。
- 音视频双塔架构:分别建模视频和音频,并通过跨模态注意力交换信息。
适用场景
MAVIN 面向多角色短剧、数字人表演、影视预演、叙事广告和交互式内容研究,可用于探索镜头节奏控制、说话时间控制、外貌与音色组合以及智能脚本规划。
该页面为研究项目主页,当前是否开放代码、模型权重或在线体验,请以项目页实时状态为准。






