Eleven v4 vs v3 对比 - 同一脚本实测试听
Eleven v4 和 v3 差在哪?同一脚本、同一音色各生成 21 次:v4 生成速度是 v3 的 1.6 倍,准确率持平。逐段并排试听,还能免费亲自对比。
最近更新: 2026-10-05
结论:用 Eleven v4。 我们把同样的 7 段脚本、用同样的音色,分别交给两个模型各生成 3 次。v4 的生成速度是 v3 的 1.6 倍,读得一样准,情绪标签都演出来了,没有被念出来,这一点和 v3 一样。另外 v4 单次能处理的文字翻倍(10,000 对 5,000 字符),多了包括粤语在内的 11 种语言,价格还一样。
用你自己的文字对比:两个模型各生成一次,结果会并排留在下面:
免费试用 Eleven v4,无需注册
每天免费 2 次,每次最多 200 字。方括号里的标签会被演出来,不会被念出来。
一张表看懂 Eleven v4 和 v3
| Eleven v3 | Eleven v4 | |
|---|---|---|
| 发布时间 | 2025 年 | 2026 年 9 月 28 日 |
| 模型 ID | eleven_v3 | eleven_v4 |
| 官方语言数 | 70+ | 90+ |
| API 模型列表里的语言代码 | 74 | 85 |
| 单次字符上限 | 5,000 | 10,000 |
| 情绪标签 | 支持 | 支持,可叠加 |
| 低延迟版本 | v3 Conversational | v4 Turbo(官方称中位推理约 100 毫秒) |
| 价格 | 标准 TTS 价 | 与 v3 相同 |
| 实测:生成 1 秒音频要多少秒(中位数) | 0.37 | 0.23 |
| 实测:首字节延迟(中位数) | 0.81 秒 | 0.70 秒 |
| 实测:对照原稿的转写错误率(平均) | 1.9% | 1.8% |
| 实测:标签被念出来 | 21 次中 0 次 | 21 次中 0 次 |
我们怎么测的
- 时间:2026 年 10 月 5 日,通过 ElevenLabs 公开 API。
- 脚本:7 段短稿,每段读出来 8 到 19 秒:英文旁白、带 4 个标签的英文台词、普通话旁白、带 3 个标签的普通话台词、日语、巴西葡萄牙语,以及一段用 text-to-dialogue 生成的两人普通话对白。
- 公平性:每组用同一个音色、同一段文字、默认参数。每段每个模型跑 3 次,先后顺序交替(这一轮 v3 先,下一轮 v4 先),避免网络某一分钟变慢偏向哪一方。一共 42 次生成、531 秒音频。
- 速度:用流式接口计时,记录从发出请求到收到第一个音频字节、到收到最后一个字节的时间。测试在我们位于亚洲的网络上进行,包含网络往返,所以请看两者的比例,不要看绝对秒数。
- 准确率:每段输出都用 ElevenLabs Scribe v2 转写,再和去掉标签的原稿比对。中文、日文按字算错误率,其他语言按词算。
分脚本结果
每格取 3 次的中位数,各列都是越低越好。
| 脚本 | v3:每秒音频耗时 | v4:每秒音频耗时 | v3 错误率 | v4 错误率 |
|---|---|---|---|---|
| 英文旁白 | 0.40 | 0.23 | 0% | 0% |
| 英文 + 标签 | 0.55 | 0.25 | 3.8% | 3.8% |
| 普通话旁白 | 0.37 | 0.20 | 1.2% | 0% |
| 普通话 + 标签 | 0.33 | 0.21 | 4.3% | 4.3% |
| 日语 | 0.39 | 0.24 | 0% | 0% |
| 巴西葡萄牙语 | 0.33 | 0.26 | 0% | 0% |
| 两人对白(普通话) | 0.35 | 0.19 | 3.9% | 4.4% |
错误率这一列其实反映了三件事:
- 带标签的脚本和对白,两个模型都在 4%–5%。原因是演出来的笑声、叹气被转写成了「哎」「哈哈」这样的字。这说明标签生效了,不是读错了。
- 英文带标签那段,两个模型都错了同一个词:Scribe 把「heard」听成了「hurt」。
- 唯一真正的差别在普通话旁白:v3 三次里有两次,「眼镜」被转写成「眼睛」;v4 三次都对。
逐段并排试听
每组都是第 1 次生成的原始音频,没有剪辑。先放 v3,后放 v4。
普通话旁白
普通话 + 情绪标签
[laughs] 你以为我会就这么算了?[whispers] 合同在我手里,三天之内,你会求着来找我。[sighs] 可惜啊,我们本来可以是朋友。[laughs] 你以为我会就这么算了?[whispers] 合同在我手里,三天之内,你会求着来找我。[sighs] 可惜啊,我们本来可以是朋友。两人对白,一次请求
[curious] 你这猴头,又从哪里闯了祸回来?
[laughs] 师父莫急,俺老孙不过是借了他三根毫毛!
[sighs] 借?只怕人家此刻正满山找你呢。
[excited] 找便找,俺一个筋斗,早到了十万八千里外![curious] 你这猴头,又从哪里闯了祸回来?
[laughs] 师父莫急,俺老孙不过是借了他三根毫毛!
[sighs] 借?只怕人家此刻正满山找你呢。
[excited] 找便找,俺一个筋斗,早到了十万八千里外!英文旁白
英文 + 情绪标签
转写时,笑声和叹气在 v4 的三次里都被识别成了音效,v3 是三次里有两次。
[whispers] Okay, don't move. I think it's still in the kitchen. [nervous] What if it heard us? [laughs] Relax, it's just the cat. [sighs] You scared me half to death.[whispers] Okay, don't move. I think it's still in the kitchen. [nervous] What if it heard us? [laughs] Relax, it's just the cat. [sighs] You scared me half to death.日语
巴西葡萄牙语
变了什么,没变什么
- 速度提升最明显。 7 段脚本 v4 全部更快,快了 1.3 到 2.2 倍。短句的等待时间主要花在模型「读完」上,不在「开口」上:首字节延迟只从 0.81 秒降到 0.70 秒。
- 准确率本来就高,现在依然高。 两个模型都完整读完了每一段,没有漏字、重复或多读。
- 标签照常可用。 v3 上用的标签在 v4 上全部生效,两个模型都没有把标签念出来。按 ElevenLabs 的说法,v4 还支持叠加和连用。
- 单次能处理的文字更多。 10,000 字符意味着常见长度的一章一次就能生成,不用拆成两次,接缝更少。
- 语言更多。 v4 的 API 模型列表新增了粤语、缅甸语、蒙古语、乌兹别克语、约鲁巴语、马耳他语、毛利语、奥里亚语、塔吉克语、阿斯图里亚斯语和奥克语。v3 支持的语言,v4 全都支持。
生产中的一个提醒:我们有声剧场的 76 集全部用 v4 渲染。较长的中文 text-to-dialogue 请求,到 1,700 字左右时,v4 偶尔会不报错地漏掉最后几句。我们的做法是中日韩文本每次请求不超过 1,200 字,并检查每一句都有时间戳,问题就解决了。v3 在这个长度下我们没有测过。
该选哪个
- 新的配音、有声书、有声剧:Eleven v4。
- 实时语音 Agent:Eleven v4 Turbo,v4 的低延迟版本。
- 已经用 v3 做了一半的项目:如果新补的句子要和已定稿的片段一致,就先用 v3 做完,再换 v4。
- 最看重每分钟成本:Google 的 Gemini 3.8 TTS 约每分钟 0.017 美元。同样的脚本,它比 v4 慢 2.4 倍,还有两段加了原稿里没有的语气词。
在声匠,两个模型都可以在配音工作台里选,价格相同;有声剧工坊用 v4 渲染。模型本身的介绍见 Eleven v4 在线试用。
常见问题
Eleven v4 比 v3 好吗? 新项目建议直接用 v4。我们的实测里 v4 生成速度是 v3 的 1.6 倍,准确率持平;单次上限翻倍到 10,000 字符,多了 11 种语言,而且价格一样。
v3 的情绪标签在 v4 上还能用吗? 能。[whispers]、[laughs]、[sighs]、[excited]、[nervous]、[curious] 在两个模型上都生效,42 次生成里没有一次把标签念出来。
Eleven v4 比 v3 贵吗? 不贵。ElevenLabs 对 v4 的计费和其他 TTS 模型相同,声匠里 v4 和 v3 也是同价。
Eleven v4 中文比 v3 准吗? 整体差不多:用语音识别对照原稿,v4 平均错误率 1.8%,v3 1.9%,差距几乎都来自笑声、叹气被转写成了字。唯一像是模型本身的差别是普通话旁白里的「眼镜」:v3 三次里有两次被转写成「眼睛」,v4 三次都对。
已经用 v3 做了一半的项目要换 v4 吗? 新项目直接用 v4。做到一半的项目,如果补录的句子要和已经定稿的 v3 片段保持一致,就先用 v3 做完。
Eleven v3、Eleven v4 和 ElevenLabs 是 ElevenLabs 的商标。声匠是基于 ElevenLabs API 的独立产品,与 ElevenLabs 没有隶属关系。