Eleven v4 vs v3 对比 - 同一脚本实测试听

Eleven v4 和 v3 差在哪?同一脚本、同一音色各生成 21 次:v4 生成速度是 v3 的 1.6 倍,准确率持平。逐段并排试听,还能免费亲自对比。

最近更新: 2026-10-05

结论:用 Eleven v4。 我们把同样的 7 段脚本、用同样的音色,分别交给两个模型各生成 3 次。v4 的生成速度是 v3 的 1.6 倍,读得一样准,情绪标签都演出来了,没有被念出来,这一点和 v3 一样。另外 v4 单次能处理的文字翻倍(10,000 对 5,000 字符),多了包括粤语在内的 11 种语言,价格还一样。

用你自己的文字对比:两个模型各生成一次,结果会并排留在下面:

免费试用 Eleven v4,无需注册

每天免费 2 次,每次最多 200 字。方括号里的标签会被演出来,不会被念出来。

模型两个模型各生成一次,就能并排对比。
音色
标签51 / 200
示例
今天还剩 2 次免费

一张表看懂 Eleven v4 和 v3

Eleven v3Eleven v4
发布时间2025 年2026 年 9 月 28 日
模型 IDeleven_v3eleven_v4
官方语言数70+90+
API 模型列表里的语言代码7485
单次字符上限5,00010,000
情绪标签支持支持,可叠加
低延迟版本v3 Conversationalv4 Turbo(官方称中位推理约 100 毫秒)
价格标准 TTS 价与 v3 相同
实测:生成 1 秒音频要多少秒(中位数)0.370.23
实测:首字节延迟(中位数)0.81 秒0.70 秒
实测:对照原稿的转写错误率(平均)1.9%1.8%
实测:标签被念出来21 次中 0 次21 次中 0 次

我们怎么测的

  • 时间:2026 年 10 月 5 日,通过 ElevenLabs 公开 API。
  • 脚本:7 段短稿,每段读出来 8 到 19 秒:英文旁白、带 4 个标签的英文台词、普通话旁白、带 3 个标签的普通话台词、日语、巴西葡萄牙语,以及一段用 text-to-dialogue 生成的两人普通话对白。
  • 公平性:每组用同一个音色、同一段文字、默认参数。每段每个模型跑 3 次,先后顺序交替(这一轮 v3 先,下一轮 v4 先),避免网络某一分钟变慢偏向哪一方。一共 42 次生成、531 秒音频。
  • 速度:用流式接口计时,记录从发出请求到收到第一个音频字节、到收到最后一个字节的时间。测试在我们位于亚洲的网络上进行,包含网络往返,所以请看两者的比例,不要看绝对秒数。
  • 准确率:每段输出都用 ElevenLabs Scribe v2 转写,再和去掉标签的原稿比对。中文、日文按字算错误率,其他语言按词算。

分脚本结果

每格取 3 次的中位数,各列都是越低越好。

脚本v3:每秒音频耗时v4:每秒音频耗时v3 错误率v4 错误率
英文旁白0.400.230%0%
英文 + 标签0.550.253.8%3.8%
普通话旁白0.370.201.2%0%
普通话 + 标签0.330.214.3%4.3%
日语0.390.240%0%
巴西葡萄牙语0.330.260%0%
两人对白(普通话)0.350.193.9%4.4%

错误率这一列其实反映了三件事:

  • 带标签的脚本和对白,两个模型都在 4%–5%。原因是演出来的笑声、叹气被转写成了「哎」「哈哈」这样的字。这说明标签生效了,不是读错了。
  • 英文带标签那段,两个模型都错了同一个词:Scribe 把「heard」听成了「hurt」。
  • 唯一真正的差别在普通话旁白:v3 三次里有两次,「眼镜」被转写成「眼睛」;v4 三次都对。

逐段并排试听

每组都是第 1 次生成的原始音频,没有剪辑。先放 v3,后放 v4。

普通话旁白

音色: 播音腔大叔中文模型: eleven_v314 秒
文稿:天还没亮,菜市场已经亮起了灯。卖豆腐的老陈把第一板豆腐抬上案子,热气一下子冒起来,模糊了他的眼镜。这么多年,他每天都是第一个到。
音色: 播音腔大叔中文模型: eleven_v414 秒
文稿:天还没亮,菜市场已经亮起了灯。卖豆腐的老陈把第一板豆腐抬上案子,热气一下子冒起来,模糊了他的眼镜。这么多年,他每天都是第一个到。

普通话 + 情绪标签

音色: 冷艳女王中文模型: eleven_v313 秒
文稿:[laughs] 你以为我会就这么算了?[whispers] 合同在我手里,三天之内,你会求着来找我。[sighs] 可惜啊,我们本来可以是朋友。
音色: 冷艳女王中文模型: eleven_v412 秒
文稿:[laughs] 你以为我会就这么算了?[whispers] 合同在我手里,三天之内,你会求着来找我。[sighs] 可惜啊,我们本来可以是朋友。

两人对白,一次请求

音色: 老者说书人 / 猴王中文模型: eleven_v319 秒
文稿:[curious] 你这猴头,又从哪里闯了祸回来? [laughs] 师父莫急,俺老孙不过是借了他三根毫毛! [sighs] 借?只怕人家此刻正满山找你呢。 [excited] 找便找,俺一个筋斗,早到了十万八千里外!
音色: 老者说书人 / 猴王中文模型: eleven_v417 秒
文稿:[curious] 你这猴头,又从哪里闯了祸回来? [laughs] 师父莫急,俺老孙不过是借了他三根毫毛! [sighs] 借?只怕人家此刻正满山找你呢。 [excited] 找便找,俺一个筋斗,早到了十万八千里外!

英文旁白

音色: 英伦绅士管家英语模型: eleven_v314 秒
文稿:The house had been empty for years, yet every clock in it still told the right time. Margaret noticed it the moment she stepped inside: the soft, patient ticking, as if someone had been winding them every night, waiting for her to come home.
音色: 英伦绅士管家英语模型: eleven_v415 秒
文稿:The house had been empty for years, yet every clock in it still told the right time. Margaret noticed it the moment she stepped inside: the soft, patient ticking, as if someone had been winding them every night, waiting for her to come home.

英文 + 情绪标签

转写时,笑声和叹气在 v4 的三次里都被识别成了音效,v3 是三次里有两次。

音色: 甜美少女英文英语模型: eleven_v310 秒
文稿:[whispers] Okay, don't move. I think it's still in the kitchen. [nervous] What if it heard us? [laughs] Relax, it's just the cat. [sighs] You scared me half to death.
音色: 甜美少女英文英语模型: eleven_v411 秒
文稿:[whispers] Okay, don't move. I think it's still in the kitchen. [nervous] What if it heard us? [laughs] Relax, it's just the cat. [sighs] You scared me half to death.

日语

音色: 元气动漫少女日语模型: eleven_v39 秒
文稿:おはようございます!今日は朝から雨ですが、新しい傘を買ったので、ちょっとだけ楽しみです。駅まで一緒に歩きませんか?
音色: 元气动漫少女日语模型: eleven_v48 秒
文稿:おはようございます!今日は朝から雨ですが、新しい傘を買ったので、ちょっとだけ楽しみです。駅まで一緒に歩きませんか?

巴西葡萄牙语

音色: Thiago葡萄牙语模型: eleven_v310 秒
文稿:Bom dia! Hoje vamos aprender a fazer um café coado perfeito, sem pressa e sem segredo. Primeiro, aqueça a água sem deixar ferver.
音色: Thiago葡萄牙语模型: eleven_v410 秒
文稿:Bom dia! Hoje vamos aprender a fazer um café coado perfeito, sem pressa e sem segredo. Primeiro, aqueça a água sem deixar ferver.

变了什么,没变什么

  • 速度提升最明显。 7 段脚本 v4 全部更快,快了 1.3 到 2.2 倍。短句的等待时间主要花在模型「读完」上,不在「开口」上:首字节延迟只从 0.81 秒降到 0.70 秒。
  • 准确率本来就高,现在依然高。 两个模型都完整读完了每一段,没有漏字、重复或多读。
  • 标签照常可用。 v3 上用的标签在 v4 上全部生效,两个模型都没有把标签念出来。按 ElevenLabs 的说法,v4 还支持叠加和连用。
  • 单次能处理的文字更多。 10,000 字符意味着常见长度的一章一次就能生成,不用拆成两次,接缝更少。
  • 语言更多。 v4 的 API 模型列表新增了粤语、缅甸语、蒙古语、乌兹别克语、约鲁巴语、马耳他语、毛利语、奥里亚语、塔吉克语、阿斯图里亚斯语和奥克语。v3 支持的语言,v4 全都支持。

生产中的一个提醒:我们有声剧场的 76 集全部用 v4 渲染。较长的中文 text-to-dialogue 请求,到 1,700 字左右时,v4 偶尔会不报错地漏掉最后几句。我们的做法是中日韩文本每次请求不超过 1,200 字,并检查每一句都有时间戳,问题就解决了。v3 在这个长度下我们没有测过。

该选哪个

  • 新的配音、有声书、有声剧:Eleven v4。
  • 实时语音 Agent:Eleven v4 Turbo,v4 的低延迟版本。
  • 已经用 v3 做了一半的项目:如果新补的句子要和已定稿的片段一致,就先用 v3 做完,再换 v4。
  • 最看重每分钟成本:Google 的 Gemini 3.8 TTS 约每分钟 0.017 美元。同样的脚本,它比 v4 慢 2.4 倍,还有两段加了原稿里没有的语气词。

在声匠,两个模型都可以在配音工作台里选,价格相同;有声剧工坊用 v4 渲染。模型本身的介绍见 Eleven v4 在线试用。

常见问题

Eleven v4 比 v3 好吗? 新项目建议直接用 v4。我们的实测里 v4 生成速度是 v3 的 1.6 倍,准确率持平;单次上限翻倍到 10,000 字符,多了 11 种语言,而且价格一样。

v3 的情绪标签在 v4 上还能用吗? 能。[whispers]、[laughs]、[sighs]、[excited]、[nervous]、[curious] 在两个模型上都生效,42 次生成里没有一次把标签念出来。

Eleven v4 比 v3 贵吗? 不贵。ElevenLabs 对 v4 的计费和其他 TTS 模型相同,声匠里 v4 和 v3 也是同价。

Eleven v4 中文比 v3 准吗? 整体差不多:用语音识别对照原稿,v4 平均错误率 1.8%,v3 1.9%,差距几乎都来自笑声、叹气被转写成了字。唯一像是模型本身的差别是普通话旁白里的「眼镜」:v3 三次里有两次被转写成「眼睛」,v4 三次都对。

已经用 v3 做了一半的项目要换 v4 吗? 新项目直接用 v4。做到一半的项目,如果补录的句子要和已经定稿的 v3 片段保持一致,就先用 v3 做完。

Eleven v3、Eleven v4 和 ElevenLabs 是 ElevenLabs 的商标。声匠是基于 ElevenLabs API 的独立产品,与 ElevenLabs 没有隶属关系。