MP3 转文字 - 上传即出稿,带逐字时间戳
MP3 音频转文字在线工具:上传即转写,自动识别 90+ 语言,输出带逐字时间戳的文字稿与 SRT 字幕,单文件最大 200MB。
最近更新: 2026-08-26
上传一个 MP3,拿回三样东西
文字稿、逐字时间戳、SRT 字幕。不是三次操作,是一次上传的三个产物。
大多数转文字工具只给你第一样。第二样才是真正省时间的那个——有了逐字时间戳,字幕不用对轴,剪辑不用听着找点,长音频可以按词跳转。
真实输出,包括它出的错
拿站内的一段中文说书音频实测。下面是未经任何编辑的原始返回:
访谈类录音是 MP3 转文字最常见的来源。长句、停顿、口语化的语序,都是断句准确率的考验:
识别语言: zho (置信度 88.7%)
文本:
上回书说到,那少年提剑立于城门之西,身后是三千追兵,
身前是莫张深渊。他回头笑了一声:“诸位,且听下回分解。
逐字时间戳(前 12 个):
上[0.42→0.72] 回[0.72→0.88] 书[0.88→1.06] 说[1.06→1.48]
到[1.48→1.84] ,[1.84→2.62] 那[2.62→2.96] 少[2.96→3.18]
年[3.18→3.40] 提[3.40→3.64] 剑[3.64→3.96] 立[3.96→4.22]
它错了两处:原文是「城门之下」和「万丈深渊」,被听成了「城门之西」和「莫张深渊」。
同音词是语音识别的固有边界,任何引擎都一样。我们把错误留在页面上,是因为这比一段挑出来的完美样本更有用——你现在就知道要预期什么:大部分字是对的,专有名词和成语要过一遍眼。
关键是:改字不影响时间戳。在工作台里把「之西」改成「之下」,那两个字的起止时间不变,字幕依然对得上。
逐字时间戳能干什么
| 用途 | 没有时间戳时怎么做 | 有了之后 |
|---|---|---|
| 出字幕 | 导入剪辑软件再跑一次识别,然后手动对轴 | 直接导出 SRT,拖进去就齐 |
| 找一句话在哪 | 拖进度条来回听 | 搜文字,点一下跳过去 |
| 剪掉某段 | 反复试听找入点出点 | 按文字选中,读出精确秒数 |
| 做二创切片 | 凭感觉切 | 按句边界切,不切在字中间 |
第一行是最省时间的。SRT 是转写时一起算出来的,不是事后再识别一遍——所以不会出现"字幕里的错字和文稿里的错字不一样"这种要改两遍的情况。
说话人区分默认开着
如果音频里不止一个人,系统会自动分离并标注是谁在说,最多支持 32 个说话人。访谈、双人播客、会议录音上传后直接就是对话稿的形态。
具体效果和适用场景见会议录音转文字。
怎么用
- 打开语音工作台 → 转录
- 选文件上传(MP3/WAV/M4A/AAC/OGG/FLAC,单次总计 ≤200MB)
- 等待——一小时音频通常一两分钟
- 在结果面板里改错字,导出文字稿或 SRT
语言不用选,自动识别;说话人区分和音频事件标注默认开启,不用配置。
常见问题
支持哪些格式?多大? MP3、WAV、M4A、AAC、OGG、FLAC 都行,单次总计 200MB 以内。
准确率多高? 清晰单人录音通常 95% 以上,同音词是固有边界——本页那条真实输出就有两处错。
要手动选语言吗? 不用,自动识别并返回置信度,中英混说也能处理。
能导出字幕吗? 能,逐字时间戳直出 SRT,不用再对轴。
开始
费用: 每个文件 20 积分(单次 ≤200MB),失败自动退回。¥29.9 的体验包有 150 积分,够转 7 个文件,积分不过期。