AI 视频翻译配音完整指南:保留原声,换成外语
AI 视频翻译配音(Dubbing)怎么做:上传视频、识别说话人、翻译、用原说话人的声音合成外语、对齐口型与时长,成本按分钟计,附中英对照样例。
2026年9月6日
声匠团队
听这篇文章
AI 朗读 · 约 2 分钟
视频翻译配音的核心承诺是"换语言不换人":观众听到的还是原说话人的声音,只是说的是英语、西班牙语或日语。这篇讲完整流程、常见坑和成本。
先听结论
同一个音色,先中文再英文:
音色: 霸道总裁中文8 秒
音色: 霸道总裁英语6 秒
流程
- 上传视频到视频配音,支持 MP4、MOV,或直接贴 YouTube、抖音链接。
- 自动识别说话人并转写;多人视频每个人保留各自的声音。
- 翻译成目标语言,可在导出前修改译文。
- 合成外语音轨,自动对齐每句话的起止时间,语速微调以匹配口型。
- 导出带新音轨的视频,或只导出音轨和 SRT。
三个常见坑
- 背景音乐被一起翻译:开启人声分离,音乐和音效原样保留。
- 译文太长对不上口型:翻译时选"贴合时长",系统会精简译文。
- 专有名词读错:先加入发音词典,再批量处理。
成本
按视频时长计费,一分钟约 1,000 积分。一条 3 分钟的产品视频翻成三种语言约 9,000 积分,远低于三次真人配音。
适合谁
跨境电商的产品视频、课程出海、短剧出海、YouTube 频道多语言分发。短剧的两条路线对比见短剧出海配音;多语言口音怎么选见多语言配音口音指南。