语音转文字 - 90+ 语言转写,含词级时间戳

AI 语音转文字:90+ 语言自动识别、最多 32 个说话人区分、词级时间戳,音视频文件直接出文字稿和 SRT 字幕。会议、访谈、播客素材整理利器。

最近更新: 2026-08-23

不只是"转成文字"

语音转文字(Speech to Text)把音频或视频变成文字稿。这里的转写引擎多做了三件事:

  • 90+ 语言自动识别——不用手动选语言,混合语言内容也能处理
  • 说话人区分——最多 32 人,每个词标注是谁说的,访谈直接出对话稿
  • 词级时间戳——每个词的精确起止时间,一键导出 SRT 字幕

真实转写效果

用首页那条中文口播样例实测,以下是未经编辑的原始输出:

识别语言: zho (置信度 98.3%)
文本: 三步做出爆款口播,念帖文案,选择音色,一键到处带字幕的成品。
词级时间戳(前 6 词):
三 [0.20s→0.44s]  步 [0.44s→0.68s]  做 [0.68s→0.88s]
出 [0.88s→1.06s]  爆 [1.06s→1.28s]  款 [1.28s→1.40s]

坦白说:这条输出里"粘贴"被听成"念帖"、"导出"被听成"到处"——同音词仍是 ASR 的边界。这正是我们坚持展示真实输出的原因:你可以在工作台里直接编辑修正,时间戳不受影响。

典型用途

  • 字幕制作:视频转写 → 下载 SRT → 进剪辑软件
  • 访谈与会议整理:说话人区分直接输出"谁说了什么"
  • 播客文字版:一期节目一键出文稿,利于 SEO 收录
  • 配音质检:生成的配音回转写,核对是否照稿朗读

使用方式

进入语音工作台 → 转写,上传音频或视频(最大 200MB),自动开启说话人区分。完成后在生成记录里复制全文下载 SRT

已有文字稿、只想要精确时间轴?用音频工具页的强制对齐,更快更准。

转写我的第一个文件 →