会议录音转文字 - 自动分清谁在说话

会议录音转文字:自动区分最多 32 位说话人,每句标注发言人与起止时间,上传录音直接得到可读的对话纪要,支持 90+ 语言。

最近更新: 2026-08-26

会议纪要的活,九成花在"这句是谁说的"

把一小时录音打成文字,不难。难的是打完之后那一堆没有主语的句子——你得回听,才能把话安到人头上。

说话人区分(diarization)解决的就是这一步:转写时就把每个词标注是谁说的,输出直接是对话形态,不是一整块文字墙。

真实输出

一段中文双人对话,上传后未做任何编辑,原始返回如下:

中文9 秒
文稿:你到底把芯片藏在哪儿了? 我可以解释,但不是现在。 现在就说。

再来一段更像真实站会的录音:两个人交替发言、互相接话、最后分工。下面的文稿就是转写要还原的内容。

音色: 科技大佬 / 知性御姐中文43 秒
文稿:好,我们开始。先同步一下上周的进度:支付这块,Stripe 和支付宝都已经在线上跑通了,第一笔真实订单是昨天下午。 补充一点,退款流程我们也测过了,资金原路退回大概五到十天。剩下的问题是提现,还差一份补充材料。 那这周的目标就两个:把补充材料交上去,然后把素材页的音频全部补齐。谁负责? 素材我来,材料你交。周三下午三点再对一次。
识别语言: zho  (置信度 99.4%)
检测到说话人: 2

speaker_0  @0.40s   你到底把芯片藏在哪儿了?
speaker_1  @4.18s   我可以解释,但不是现在。
speaker_0  @7.48s   现在就说。

三个轮次,归属全对,每次发言带起止时间。这是系统自动分的——上传时没有告诉它有几个人,也没有做任何标注。

注意第三行:speaker_0 第二次开口时,系统认出这是同一个人,而不是新增一位。这正是"说话人区分"和"简单分段"的区别。

匿名标识,不做声纹身份识别

系统给的是 speaker_0 / speaker_1,不是姓名。它只保证同一个标识对应同一个人,不去比对这个人是谁。

这是有意为之。自动比对声纹属于生物识别范畴,不该由一个转写工具默认打开。姓名由你在结果里替换一次,整篇统一生效——多花十秒,换掉一个不该默认存在的能力。

适合什么会议

场景说话人区分的价值注意
客户访谈 / 用户调研直接得到问答对照稿,引述时不会张冠李戴受访者较多时建议指定人数
双人播客出稿即对话体,可直接做 show notes效果最好的一类
项目例会谁承诺了什么,有时间戳可回溯抢话片段需回听确认
庭审 / 问诊等正式记录轮流发言,分离准确度高敏感内容请先确认合规

最后一行要认真对待:音频会经由语音识别服务处理。高度敏感的会议,先确认这符合你们的合规要求再上传。

边界在哪

重叠说话是公认最难的部分。 轮流发言的会议准确度很高;两个人同时说话超过一两秒,归属可能出错。

实务上两个办法:录音时尽量让每人用独立麦克风;或者在纪要里对争议片段回听一次——有时间戳,回听只需要点一下,不用拖进度条找。

我们把这条写在页面上,而不是等你上传完才发现。

怎么用

  1. 打开语音工作台 → 转录
  2. 上传录音(音频或视频均可,单次总计 ≤200MB)
  3. 等待——一小时录音通常一两分钟
  4. 在结果里把 speaker_0 替换成真实姓名,导出

说话人区分默认开启,不需要配置。语言自动识别,90+ 语言。

常见问题

能分几个人?要提前说吗? 最多 32 位,默认自动判断。确知人数时可以指定,能提高分离准确度。

能认出谁是谁吗? 不能,也不该。输出匿名标识,不做声纹身份识别,姓名由你替换一次。

抢话能处理吗? 能分离,但重叠超过一两秒可能出错。建议独立麦克风,或回听确认。

涉密会议安全吗? 结果存在你的账号下可随时删除,但音频会经识别服务处理——敏感内容请先确认合规。

开始

费用: 每个文件 20 积分(单次 ≤200MB),失败自动退回。¥29.9 的体验包有 150 积分,够转 7 个文件,积分不过期。

上传一段会议录音 →

相关:MP3 转文字 · 视频转文字 · 字幕生成 · 多角色对话合成