返回博客

音频生成 SRT 字幕:三分钟,帧准对齐

把 MP3、录音、口播音频变成 SRT 字幕的完整流程:上传、说话人区分、逐字时间戳、改错字不影响时间轴,导出到剪映与 Premiere。

2026年9月5日声匠团队声匠团队

听这篇文章

AI 朗读 · 约 2 分钟
0:00 / –:––
音频生成 SRT 字幕:三分钟,帧准对齐

手动打轴一分钟音频要十分钟,还容易对不齐。用语音转文字直接输出 SRT,时间轴来自逐字时间戳而不是估算,这篇讲完整流程和三个易错点。

流程

  1. 上传音频到字幕生成,支持 MP3、WAV、M4A,视频文件会自动抽音轨。
  2. 选择语言或让它自动识别,多人对话打开说话人区分。
  3. 拿到 SRT 与逐字时间戳,改错字后时间轴不变。
  4. 导入剪映、Premiere 或 CapCut。
音频生成 SRT 字幕:三分钟,帧准对齐

听源音频,看输出

两个人交替说话、句间停顿,每一句都要落在准确的起止点上:

音色: 霸道总裁 / 冷艳女王中文16 秒
文稿:你知道我为什么让你留下来吗? 知道。因为整个公司,只有我不怕你。 错。是因为只有你,敢在会上说我错了。

生成的字幕会按说话人换行,停顿超过 0.8 秒自动断句。

三个易错点

  • 口语填充词:"嗯""那个"默认保留,发布前可一键去除。
  • 数字格式:"二零二六年"会规范为"2026 年",可以在设置里关掉。
  • 专有名词:人名和品牌先加到发音词典的识别列表,转写准确率明显提升。

从配音直接出字幕

如果音频本身就是 AI 生成的,不用再转写:在文字配音里生成时同时导出 SRT,字级对齐,零误差。

相关

时间轴为什么会漂移见字幕时间轴指南;会议录音的整理见会议转写;视频文件直接转文字见MP4 转文字。