### [MAVIN – 按剧本生成多镜头音视频的叙事控制模型](https://www.zuoshipin.com/) **Published:** 2026-08-28T04:41:27 **Author:** 天才交易员 **Excerpt:** MAVIN是ECCV 2026 Oral多镜头音视频生成研究,通过边界感知注意力、身份感知传播和多智能体脚本流… **MAVIN** 是面向多镜头音视频联合生成的研究框架,重点解决镜头切换、对白时间、跨镜头角色一致性以及视觉身份与音色绑定等问题。用户可以从自由形式的故事描述出发,经由多智能体脚本流水线形成全局、镜头和角色三级结构化脚本,再由生成模型按照时间边界执行。 ## 核心技术 - **边界感知注意力:**把镜头描述、角色动作和对白限制在对应时间区间。 - **身份感知传播:**通过参考图像、参考音频和身份掩码维持跨镜头外貌与音色一致。 - **多智能体脚本流水线:**将故事梗概补全为包含镜头边界、对白区间、动作和环境声音的可执行脚本。 - **音视频双塔架构:**分别建模视频和音频,并通过跨模态注意力交换信息。 ## 适用场景 MAVIN 面向多角色短剧、数字人表演、影视预演、叙事广告和交互式内容研究,可用于探索镜头节奏控制、说话时间控制、外貌与音色组合以及智能脚本规划。 该页面为研究项目主页,当前是否开放代码、模型权重或在线体验,请以项目页实时状态为准。 ---