会议录音转文字 - 自动分清谁在说话
会议录音转文字:自动区分最多 32 位说话人,每句标注发言人与起止时间,上传录音直接得到可读的对话纪要,支持 90+ 语言。
最近更新: 2026-08-26
会议纪要的活,九成花在"这句是谁说的"
把一小时录音打成文字,不难。难的是打完之后那一堆没有主语的句子——你得回听,才能把话安到人头上。
说话人区分(diarization)解决的就是这一步:转写时就把每个词标注是谁说的,输出直接是对话形态,不是一整块文字墙。
真实输出
一段中文双人对话,上传后未做任何编辑,原始返回如下:
再来一段更像真实站会的录音:两个人交替发言、互相接话、最后分工。下面的文稿就是转写要还原的内容。
识别语言: zho (置信度 99.4%)
检测到说话人: 2
speaker_0 @0.40s 你到底把芯片藏在哪儿了?
speaker_1 @4.18s 我可以解释,但不是现在。
speaker_0 @7.48s 现在就说。
三个轮次,归属全对,每次发言带起止时间。这是系统自动分的——上传时没有告诉它有几个人,也没有做任何标注。
注意第三行:speaker_0 第二次开口时,系统认出这是同一个人,而不是新增一位。这正是"说话人区分"和"简单分段"的区别。
匿名标识,不做声纹身份识别
系统给的是 speaker_0 / speaker_1,不是姓名。它只保证同一个标识对应同一个人,不去比对这个人是谁。
这是有意为之。自动比对声纹属于生物识别范畴,不该由一个转写工具默认打开。姓名由你在结果里替换一次,整篇统一生效——多花十秒,换掉一个不该默认存在的能力。
适合什么会议
| 场景 | 说话人区分的价值 | 注意 |
|---|---|---|
| 客户访谈 / 用户调研 | 直接得到问答对照稿,引述时不会张冠李戴 | 受访者较多时建议指定人数 |
| 双人播客 | 出稿即对话体,可直接做 show notes | 效果最好的一类 |
| 项目例会 | 谁承诺了什么,有时间戳可回溯 | 抢话片段需回听确认 |
| 庭审 / 问诊等正式记录 | 轮流发言,分离准确度高 | 敏感内容请先确认合规 |
最后一行要认真对待:音频会经由语音识别服务处理。高度敏感的会议,先确认这符合你们的合规要求再上传。
边界在哪
重叠说话是公认最难的部分。 轮流发言的会议准确度很高;两个人同时说话超过一两秒,归属可能出错。
实务上两个办法:录音时尽量让每人用独立麦克风;或者在纪要里对争议片段回听一次——有时间戳,回听只需要点一下,不用拖进度条找。
我们把这条写在页面上,而不是等你上传完才发现。
怎么用
- 打开语音工作台 → 转录
- 上传录音(音频或视频均可,单次总计 ≤200MB)
- 等待——一小时录音通常一两分钟
- 在结果里把 speaker_0 替换成真实姓名,导出
说话人区分默认开启,不需要配置。语言自动识别,90+ 语言。
常见问题
能分几个人?要提前说吗? 最多 32 位,默认自动判断。确知人数时可以指定,能提高分离准确度。
能认出谁是谁吗? 不能,也不该。输出匿名标识,不做声纹身份识别,姓名由你替换一次。
抢话能处理吗? 能分离,但重叠超过一两秒可能出错。建议独立麦克风,或回听确认。
涉密会议安全吗? 结果存在你的账号下可随时删除,但音频会经识别服务处理——敏感内容请先确认合规。
开始
费用: 每个文件 20 积分(单次 ≤200MB),失败自动退回。¥29.9 的体验包有 150 积分,够转 7 个文件,积分不过期。