字幕生成器 - 逐字时间戳,拖进去就对齐

在线字幕生成:上传音视频自动生成 SRT,时间轴来自逐字级时间戳而非事后估算,导入剪映或 Premiere 无需再对轴。

最近更新: 2026-08-26

字幕对不齐,问题几乎都出在时间轴是猜的

大多数自动字幕的流程是:先识别出文字,再按语速把时间平均分配给每个字。句子里有停顿、有拖长音、有语气词,平均分配就会漂——前半句提前消失,后半句迟到半秒。

这里的 SRT 时间轴不是分配出来的,是转写时逐字算出来的,精确到 0.01 秒。

看一眼精确到什么程度

一段中文说书音频的真实逐字时间戳:

音色: 老者说书人中文17 秒
文稿:上回书说到,那少年提剑立于城门之下,身后是三千追兵,身前是万丈深渊。他回头笑了一声——诸位,且听下回分解。

字幕真正的难点是时间轴:两个人交替说话、句间有停顿,每一句都要落在准确的起止点上。听这段对白,再看下面的文稿如何被切成字幕行:

音色: 霸道总裁 / 冷艳女王中文16 秒
文稿:你知道我为什么让你留下来吗? 知道。因为整个公司,只有我不怕你。 错。是因为只有你,敢在会上说我错了。
上[0.42→0.72]  回[0.72→0.88]  书[0.88→1.06]  说[1.06→1.48]
到[1.48→1.84]  ,[1.84→2.62]  那[2.62→2.96]  少[2.96→3.18]
年[3.18→3.40]  提[3.40→3.64]  剑[3.64→3.96]  立[3.96→4.22]

注意第 6 项那个逗号:它占了 0.78 秒——比它前面任何一个字都长。这就是说书人的停顿。

如果按语速平均分配,这 0.78 秒会被摊到前后的字上,整句字幕从这里开始就漂了。逐字时间戳把停顿如实记下来,所以后面每个字都还在正确的位置。

两条路径,选对的那条

你的音频来自该走哪条为什么
我们生成的配音直接用合成时给的字幕轨时间戳是精确值,合成时就知道每个字什么时候发出
录音、外部素材上传转写,导出 SRT时间戳由识别算出,逐字级

第一行很容易被忽略:如果配音是这里生成的,不要再跑一次语音识别。 那是拿估算值覆盖精确值,还会引入识别错字。合成时已经给了字幕轨,直接用。

改错字不影响时间轴

识别不可能全对——同音词是固有边界。但文字和时间是两份数据:

在文本里把错字改掉,那个词的起止时间不变。所以校对流程是先批量改文字,再导出 SRT,而不是在剪辑软件里逐条点着改。

这也是和剪辑软件自带字幕最实际的差别:那里文字和时间轴锁在一起,只能一条条改。

怎么用

  1. 打开语音工作台 → 转录
  2. 上传音频或视频(单次总计 ≤200MB)
  3. 在结果里通读一遍,重点改人名、术语、中英混说处
  4. 导出 SRT,拖进剪映 / Premiere / Final Cut

顺序上有个坑:先定剪,再转写。转写完再去剪视频,时间轴就和新画面错位了。

常见问题

和剪映自动字幕差在哪? 那里文字和时间轴锁在一起只能逐条改;这里可以批量改文字后再导出,时间轴不受影响。

精度多少? 逐字级,0.01 秒。断句能卡在词边界,不是估算的均分点。

单条太长能拆吗? 能,按任意词位置拆并读出精确秒数,不用估。

用你们的配音还要再识别吗? 不要。合成时已给出精确字幕轨,再识别是拿估算覆盖精确。

开始

费用: 每个文件 20 积分(单次 ≤200MB),失败自动退回。¥29.9 的体验包有 150 积分,够转 7 个文件,积分不过期。

上传素材生成字幕 →

相关:MP4 视频转文字 · MP3 转文字 · 会议录音转文字 · 字幕对轴实操指南