从自动字幕到文字配音、声音训练与换声,拆开四条流程,看看哪些能省时间,哪些仍要靠后期把关。
先说预测:AI声音工具最先改变的,可能不是配音演员的工作,而是剪辑室里那些最磨人的小返工:临交片改了一句旁白,采访里一个词没听清,粗剪还缺几句占位解说。谁能把这些零碎问题在时间线里解决,谁就能少一次跨软件往返。
DaVinci Resolve 21把文字生成语音加入后期工具箱。但“能发出声音”和“能直接交片”之间,还隔着表演、节奏、语言和审核。与其把它理解成全自动配音机,不如先搞清楚:这次到底增加了什么,原有换声功能又适合做什么。

01 / 先认清四件事:字幕、配音、训练、换声
- 转写与字幕:把已经说出来的话变成文字,核心任务是识别与校对。
- Speech Generator:用文字生成一段新的语音表演。
- Voice Training:准备供换声使用的声音模型。
- Voice Convert:由现有语音驱动另一种声音,并不是直接读取文稿。
其中,Speech Generator是21版新增工具;Voice Convert在20版就已出现,官方20版指南将其标为Studio功能。不要把所有语音工具都写成21版首次推出,也不要看到“达芬奇免费下载”就默认每一项AI能力免费开放。具体入口与可用性以安装版本、授权和模型组件为准。
功能定位可查看官方新功能页:https://www.blackmagicdesign.com/products/davinciresolve/whatsnew
02 / 自动字幕:省的是输入时间,不是审核责任

8月17日的评测记录中,M4 Pro处理90分钟视频的转写用时不到3分钟;但音乐与噪声仍可能引发无意义文字或重复内容,讲话者也可能被分错。这些是特定环境的评测观察,不是本站实测,也不是所有电脑都能复现的性能承诺。

建议按风险校对:先核人名、品牌、数字、否定词,再检查无对白区间与说话人切换。粗剪阶段可以允许错别字暂存,交付字幕则必须逐句对照声音。尤其是“可以”和“不可以”这类只差一个字的句子,视觉上不显眼,意思却完全相反。


实用工作法:建立“字幕待核”标记,遇到听不清的位置保留时间码,请内容负责人确认;不要让第二个AI靠上下文补出一个听起来合理、素材里却没说过的答案。
03 / 文字配音怎么用?先用短段落跑通流程
官方21版指南给出的入口是Timeline > AI Tools > Speech Generator。先在Extras Download Manager下载所需模型,再输入短句或短段落、选择声音、设置文件名和目标轨道,最后生成音频。结果会进入Media Pool;勾选插入时间线时,会放到播放头所在位置。

参数不用一次调遍:先选声音,再判断语速;只有节奏合适后,才微调Pitch和Variation。Randomize控制不同生成编号,满意的结果应记录Generation ID。参数只是起点,耳朵才是验收工具。

官方指南说明,Speech Generator可通过Custom载入约10至20秒的干净语音样本;这不等于直接使用Voice Training生成的换声模型。“不能载入训练模型”和“不支持自定义声音”是两回事。
中文项目先拿品牌名、英文缩写、数字和长句做小样,不要根据英文演示推断普通话、方言或混合语言一定可靠。临时旁白建议单独命名为TEMP,并明确给审片方:当前重点是节奏,不是最终音色。
04 / 训练与换声:真正值得试的是短句补录
Voice Training从Media Pool中选取声音素材,通过右键AI Tools进入;训练完成后,在时间线选中要转换的语音,再打开Voice Convert,选择模型、输出轨道并渲染。官方建议训练素材约10分钟,声音干净,少做压缩等动态处理。

前述M4 Pro评测中,Better模式训练5分钟素材约需1小时,后台进程占用内存可到约6GB。不要把训练安排在最终导出前才开始。这个数字只作排期参考,素材、硬件和版本都会改变耗时。


我们的建议是先用一句五到十秒的对白验证,而不是直接处理整条片。保留原声,把新版本放在独立轨道,来回切换试听。只要有吞字、气口突变或情绪不对,就退回补录方案;不能因为声音“像本人”,就认为表演也成立。


05 / 后期观点:可撤回,比“一键完成”更重要
如果给AI语音设计一条团队流程,建议留下三份东西:原始录音、生成版本、审片确认记录。修改次数越多,越需要知道哪句来自真人、哪句经过生成、哪版已被确认。否则工具省下十分钟,沟通可能再花一小时。
授权也应放在开始之前:使用自己的声音或已经明确获准的声音,确认使用范围与必要的AI标识。不要把客户发来的参考片、演员试音或网上下载的录音,自动理解为可以训练声音。
交片前建议做一次“脱离画面”的纯听音检查,再回到完整混音复核。前者容易暴露发音与断句,后者才能判断生成片段是否与现场空间、音乐和人物情绪衔接。处理一个字的修补,最终也要听完整一句和前后衔接。
06 / 另一个思路:转写不必只有一条路
如果需求主要是采访转写、检索和整理,而非生成声音,可以了解开源项目StoryToolkitAI:它提供本地转写与素材检索,支持字幕等格式导出,并可与Resolve Studio 18及之后版本集成。接入外部大模型时,应另行确认数据发送范围和服务费用。
这不是配音替代品,而是前期整理的另一个选择。团队应拿相同采访片段比较识别后还需要多少人工修正,而不只是比较谁先跑完。
项目与安装说明:https://github.com/octimot/StoryToolkitAI
下载入口与站内相关阅读
DaVinci Resolve官方产品与下载入口:
https://www.blackmagicdesign.com/products/davinciresolve
站内相关阅读:达芬奇21 AI IntelliSearch素材搜索评测
https://www.zuoshipin.com/article/29102
最后的判断:值得把AI声音工具加入工具箱,但别把它放在审核流程之外。让它负责出候选、做占位、尝试短句修补,让剪辑师和声音后期负责决定什么能进成片。这才是省时间,而不是把返工留到最后。












