字幕生成器 - 逐字时间戳,拖进去就对齐
在线字幕生成:上传音视频自动生成 SRT,时间轴来自逐字级时间戳而非事后估算,导入剪映或 Premiere 无需再对轴。
最近更新: 2026-08-26
字幕对不齐,问题几乎都出在时间轴是猜的
大多数自动字幕的流程是:先识别出文字,再按语速把时间平均分配给每个字。句子里有停顿、有拖长音、有语气词,平均分配就会漂——前半句提前消失,后半句迟到半秒。
这里的 SRT 时间轴不是分配出来的,是转写时逐字算出来的,精确到 0.01 秒。
看一眼精确到什么程度
一段中文说书音频的真实逐字时间戳:
字幕真正的难点是时间轴:两个人交替说话、句间有停顿,每一句都要落在准确的起止点上。听这段对白,再看下面的文稿如何被切成字幕行:
上[0.42→0.72] 回[0.72→0.88] 书[0.88→1.06] 说[1.06→1.48]
到[1.48→1.84] ,[1.84→2.62] 那[2.62→2.96] 少[2.96→3.18]
年[3.18→3.40] 提[3.40→3.64] 剑[3.64→3.96] 立[3.96→4.22]
注意第 6 项那个逗号:它占了 0.78 秒——比它前面任何一个字都长。这就是说书人的停顿。
如果按语速平均分配,这 0.78 秒会被摊到前后的字上,整句字幕从这里开始就漂了。逐字时间戳把停顿如实记下来,所以后面每个字都还在正确的位置。
两条路径,选对的那条
| 你的音频来自 | 该走哪条 | 为什么 |
|---|---|---|
| 我们生成的配音 | 直接用合成时给的字幕轨 | 时间戳是精确值,合成时就知道每个字什么时候发出 |
| 录音、外部素材 | 上传转写,导出 SRT | 时间戳由识别算出,逐字级 |
第一行很容易被忽略:如果配音是这里生成的,不要再跑一次语音识别。 那是拿估算值覆盖精确值,还会引入识别错字。合成时已经给了字幕轨,直接用。
改错字不影响时间轴
识别不可能全对——同音词是固有边界。但文字和时间是两份数据:
在文本里把错字改掉,那个词的起止时间不变。所以校对流程是先批量改文字,再导出 SRT,而不是在剪辑软件里逐条点着改。
这也是和剪辑软件自带字幕最实际的差别:那里文字和时间轴锁在一起,只能一条条改。
怎么用
- 打开语音工作台 → 转录
- 上传音频或视频(单次总计 ≤200MB)
- 在结果里通读一遍,重点改人名、术语、中英混说处
- 导出 SRT,拖进剪映 / Premiere / Final Cut
顺序上有个坑:先定剪,再转写。转写完再去剪视频,时间轴就和新画面错位了。
常见问题
和剪映自动字幕差在哪? 那里文字和时间轴锁在一起只能逐条改;这里可以批量改文字后再导出,时间轴不受影响。
精度多少? 逐字级,0.01 秒。断句能卡在词边界,不是估算的均分点。
单条太长能拆吗? 能,按任意词位置拆并读出精确秒数,不用估。
用你们的配音还要再识别吗? 不要。合成时已给出精确字幕轨,再识别是拿估算覆盖精确。
开始
费用: 每个文件 20 积分(单次 ≤200MB),失败自动退回。¥29.9 的体验包有 150 积分,够转 7 个文件,积分不过期。