MP4 视频转文字 - 不用先抽音轨
MP4 视频转文字:视频文件直接上传,不需要先转成音频,输出带逐字时间戳的文字稿与 SRT 字幕,自动区分说话人。
最近更新: 2026-08-26
直接传视频,不用先抽音轨
大多数转文字工具只收音频,于是流程变成:导出音频 → 上传 → 转写。多出来的第一步不只浪费时间,二次编码还会损失一点音质,反过来影响识别准确率。
这里直接收视频文件。MP4、MOV、MKV、WebM 都行,音轨由系统自己处理。
你会拿到什么
一次上传,三个产物:
- 文字稿——90+ 语言自动识别,不用预先选语种
- 逐字时间戳——每个字的起止时间,精确到 0.01 秒
- 说话人标注——最多 32 位,默认开启
以一段英文口播实测,原始返回:
Vlog 口播是视频转文字的主力场景 —— 语速快、带口头禅、随口转话题:
识别语言: eng (置信度 94.6%)
Built for the way you actually work. Sets up in ninety seconds,
runs all day, and comes with a two-year warranty. Ships free today
逐字时间戳(前 8 个):
Built[0.10→0.62] for[1.74→1.86] the[1.90→1.96] way[2.06→2.24]
you[2.34→2.46] actually[2.54→3.12] work.[3.26→4.02] Sets[5.20→5.46]
原文句末是「Ships free, today.」,识别成了「Ships free today」——逗号和句号被吞掉了。标点是语音识别里最不稳的部分,因为它靠停顿推断,而停顿因人而异。做字幕时这不影响观感,做正式文稿时需要过一遍。
文件太大怎么办
单次上传上限 200MB。1080p 的一小时视频动辄好几个 G,肯定超。
最省事的办法:用剪辑软件导出一份纯音频再传。 转写只用得到音轨,画面对结果没有任何影响,而一小时 MP3 通常只有 60–120MB。
顺序上还有一个坑:先定剪,再转写。如果转写完又去剪了视频,SRT 的时间轴就和新画面错位了,只能重来。
常见用途
| 做什么 | 具体怎么用 |
|---|---|
| 给成片配字幕 | 导出 SRT,拖进剪映/Premiere,时间轴天然对齐 |
| 视频改写成图文 | 拿文字稿做底,改成公众号/博客,一鱼两吃 |
| 长视频做切片 | 搜文字定位金句,按句边界切,不会切在字中间 |
| 访谈整理 | 说话人区分直接出对话稿,不用回听认人 |
| 竞品/课程学习 | 把别人的视频转成可搜索的文字,比反复拖进度条快得多 |
第二行是最被低估的一条。一条视频的文字稿几乎就是一篇文章的初稿,而搜索引擎抓不到视频里的话——转成图文等于给同一份内容开了第二个入口。
怎么用
- 打开语音工作台 → 转录
- 直接选视频文件上传(单次总计 ≤200MB,超了就先导音频)
- 等待,一小时素材通常一两分钟
- 改错字、替换说话人姓名,导出文字稿或 SRT
常见问题
要先转成 MP3 吗? 不用,直接传视频。多一步转换还会因二次编码损失音质。
200MB 不够怎么办? 导出纯音频再传,画面对结果没有影响,体积小一个量级。
字幕能直接用吗? 能,与原视频同一时基,无需对轴。但要先定剪再转写,否则时间轴错位。
多人说话能分开吗? 能,默认开启,最多 32 位。
开始
费用: 每个文件 20 积分(单次 ≤200MB),失败自动退回。¥29.9 的体验包有 150 积分,够转 7 个文件,积分不过期。
相关:MP3 转文字 · YouTube 视频转文字稿 · 字幕生成 · 视频翻译配音