MP3 转文字 - 上传即出稿,带逐字时间戳

MP3 音频转文字在线工具:上传即转写,自动识别 90+ 语言,输出带逐字时间戳的文字稿与 SRT 字幕,单文件最大 200MB。

最近更新: 2026-08-26

上传一个 MP3,拿回三样东西

文字稿、逐字时间戳、SRT 字幕。不是三次操作,是一次上传的三个产物。

大多数转文字工具只给你第一样。第二样才是真正省时间的那个——有了逐字时间戳,字幕不用对轴,剪辑不用听着找点,长音频可以按词跳转。

真实输出,包括它出的错

拿站内的一段中文说书音频实测。下面是未经任何编辑的原始返回:

音色: 老者说书人中文17 秒
文稿:上回书说到,那少年提剑立于城门之下,身后是三千追兵,身前是万丈深渊。他回头笑了一声——诸位,且听下回分解。

访谈类录音是 MP3 转文字最常见的来源。长句、停顿、口语化的语序,都是断句准确率的考验:

音色: 播音腔大叔中文17 秒
文稿:很多人问我,做了三十年播音,最难的是什么。不是发音,也不是气息,是在你根本不想说话的那天,还能把每一个字送到听众耳朵里。
识别语言: zho  (置信度 88.7%)

文本:
上回书说到,那少年提剑立于城门之西,身后是三千追兵,
身前是莫张深渊。他回头笑了一声:“诸位,且听下回分解。

逐字时间戳(前 12 个):
上[0.42→0.72]  回[0.72→0.88]  书[0.88→1.06]  说[1.06→1.48]
到[1.48→1.84]  ,[1.84→2.62]  那[2.62→2.96]  少[2.96→3.18]
年[3.18→3.40]  提[3.40→3.64]  剑[3.64→3.96]  立[3.96→4.22]

它错了两处:原文是「城门之下」和「万丈深渊」,被听成了「城门之西」和「莫张深渊」。

同音词是语音识别的固有边界,任何引擎都一样。我们把错误留在页面上,是因为这比一段挑出来的完美样本更有用——你现在就知道要预期什么:大部分字是对的,专有名词和成语要过一遍眼。

关键是:改字不影响时间戳。在工作台里把「之西」改成「之下」,那两个字的起止时间不变,字幕依然对得上。

逐字时间戳能干什么

用途没有时间戳时怎么做有了之后
出字幕导入剪辑软件再跑一次识别,然后手动对轴直接导出 SRT,拖进去就齐
找一句话在哪拖进度条来回听搜文字,点一下跳过去
剪掉某段反复试听找入点出点按文字选中,读出精确秒数
做二创切片凭感觉切按句边界切,不切在字中间

第一行是最省时间的。SRT 是转写时一起算出来的,不是事后再识别一遍——所以不会出现"字幕里的错字和文稿里的错字不一样"这种要改两遍的情况。

说话人区分默认开着

如果音频里不止一个人,系统会自动分离并标注是谁在说,最多支持 32 个说话人。访谈、双人播客、会议录音上传后直接就是对话稿的形态。

具体效果和适用场景见会议录音转文字。

怎么用

  1. 打开语音工作台 → 转录
  2. 选文件上传(MP3/WAV/M4A/AAC/OGG/FLAC,单次总计 ≤200MB)
  3. 等待——一小时音频通常一两分钟
  4. 在结果面板里改错字,导出文字稿或 SRT

语言不用选,自动识别;说话人区分和音频事件标注默认开启,不用配置。

常见问题

支持哪些格式?多大? MP3、WAV、M4A、AAC、OGG、FLAC 都行,单次总计 200MB 以内。

准确率多高? 清晰单人录音通常 95% 以上,同音词是固有边界——本页那条真实输出就有两处错。

要手动选语言吗? 不用,自动识别并返回置信度,中英混说也能处理。

能导出字幕吗? 能,逐字时间戳直出 SRT,不用再对轴。

开始

费用: 每个文件 20 积分(单次 ≤200MB),失败自动退回。¥29.9 的体验包有 150 积分,够转 7 个文件,积分不过期。

上传一个 MP3 试试 →

相关:视频转文字 · 会议录音转文字 · 字幕生成 · 语音转文字总览