音频生成 SRT 字幕:三分钟,帧准对齐
把 MP3、录音、口播音频变成 SRT 字幕的完整流程:上传、说话人区分、逐字时间戳、改错字不影响时间轴,导出到剪映与 Premiere。
2026年9月5日
声匠团队
听这篇文章
AI 朗读 · 约 2 分钟
手动打轴一分钟音频要十分钟,还容易对不齐。用语音转文字直接输出 SRT,时间轴来自逐字时间戳而不是估算,这篇讲完整流程和三个易错点。
流程
- 上传音频到字幕生成,支持 MP3、WAV、M4A,视频文件会自动抽音轨。
- 选择语言或让它自动识别,多人对话打开说话人区分。
- 拿到 SRT 与逐字时间戳,改错字后时间轴不变。
- 导入剪映、Premiere 或 CapCut。
听源音频,看输出
两个人交替说话、句间停顿,每一句都要落在准确的起止点上:
音色: 霸道总裁 / 冷艳女王中文16 秒
生成的字幕会按说话人换行,停顿超过 0.8 秒自动断句。
三个易错点
- 口语填充词:"嗯""那个"默认保留,发布前可一键去除。
- 数字格式:"二零二六年"会规范为"2026 年",可以在设置里关掉。
- 专有名词:人名和品牌先加到发音词典的识别列表,转写准确率明显提升。
从配音直接出字幕
如果音频本身就是 AI 生成的,不用再转写:在文字配音里生成时同时导出 SRT,字级对齐,零误差。