Gemini 3.8 TTS 在线试用 - 免费语音合成

免费在线试用 Google Gemini 3.8 TTS,无需注册:选音色、用一句话描述语气,马上听。附中英日真实样音、30 个音色表、每分钟成本,以及和 Eleven v4 的同稿实测。

最近更新: 2026-10-08

Gemini 3.8 Flash TTS 是 Google 在 2026 年 9 月 23 日发布的最新文字转语音模型。 它不让你从情绪预设里选,而是用一句话告诉它语气,比如「紧张地压低声音」「激情的体育解说」,再在文字里插入 <laugh>(笑)、<sigh>(叹气)这类标签。它支持 100 多种语言,一次请求最多两个说话人,按 Google 付费价约 每分钟 0.017 美元(约 0.12 元人民币)。下面直接试:

免费试用 Gemini 3.8 TTS,无需注册

每天免费 2 次,每次最多 200 字。用一句话描述想要的语气;<laugh> 这类标签会被演出来,不会被念出来。

音色
标签45 / 200
示例
今天还剩 2 次免费

本试听使用 Google 免费档:你输入的内容可能被 Google 用于改进其产品,请不要输入隐私信息。

Gemini 3.8 TTS 基本参数

Gemini 3.8 Flash TTS
出品方Google
发布时间2026 年 9 月 23 日,与 Gemini 3.8 Flash-Lite TTS 同时发布
模型 IDgemini-3.8-flash-tts、gemini-3.8-flash-lite-tts
音色30 个经典预置音色;音色接口共列出 2,089 个、30 个语言区域(没有普通话);另可文字描述设计音色、用 10–30 秒样本克隆
语言100 多种语言和方言,自动识别(API 文档写 Flash 支持 130 多种)
怎么控制每段一句话描述风格,加 <laugh>、<sigh>、<short pause> 等行内标签
说话人每次请求最多 2 个
输出WAV,24 kHz 单声道 16 位
价格有免费档(每天请求数很少);付费档:文本输入每百万 token 0.50 美元,音频输出每百万 token 9 美元(2027 年 1 月 1 日起翻倍)
每分钟成本(实测)现在约 0.017 美元,2027 年起约 0.035 美元(每秒语音 32 个音频 token)
水印每段音频都带 SynthID 水印
在哪能用Gemini API、Google AI Studio、Gemini Notebook;Flash-Lite 已用于 Google Vids

试听:Gemini 3.8 TTS 真实生成效果

以下音频都是 2026 年 10 月 5 日用 gemini-3.8-flash-tts 一次生成的,没有挑选,也没有后期剪辑。播放器下面是发出去的原文,上面写着我们给的风格描述。脚本和 Eleven v4 页上的完全相同,可以直接对比。

普通话旁白,音色 Charon,风格「沉稳温暖的普通话新闻主播」:

音色: Charon中文模型: gemini-3.8-flash-tts14 秒
文稿:天还没亮,菜市场已经亮起了灯。卖豆腐的老陈把第一板豆腐抬上案子,热气一下子冒起来,模糊了他的眼镜。这么多年,他每天都是第一个到。

普通话加标签,音色 Kore,风格「冷淡嘲讽,压低成威胁的耳语」:

音色: Kore中文模型: gemini-3.8-flash-tts20 秒
文稿:<laugh> 你以为我会就这么算了?合同在我手里,三天之内,你会求着来找我。<sigh> 可惜啊,我们本来可以是朋友。

一次请求两个说话人:Algenib 演师父,Fenrir 演孙悟空,每句单独给风格:

音色: Algenib / Fenrir中文模型: gemini-3.8-flash-tts24 秒
文稿:你这猴头,又从哪里闯了祸回来? <laugh> 师父莫急,俺老孙不过是借了他三根毫毛! <sigh> 借?只怕人家此刻正满山找你呢。 找便找,俺一个筋斗,早到了十万八千里外!

英文旁白,音色 Charon,风格「从容温暖的英式讲故事」;英文加标签,音色 Leda,风格「先紧张地耳语,然后松一口气、被逗笑」:

音色: Charon英语模型: gemini-3.8-flash-tts18 秒
文稿:The house had been empty for years, yet every clock in it still told the right time. Margaret noticed it the moment she stepped inside: the soft, patient ticking, as if someone had been winding them every night, waiting for her to come home.
音色: Leda英语模型: gemini-3.8-flash-tts15 秒
文稿:Okay, don't move. I think it's still in the kitchen. What if it heard us? <laugh> Relax, it's just the cat. <sigh> You scared me half to death.

日语(Leda,「明亮开朗的动漫少女」)和巴西葡萄牙语(Puck,「亲切的巴西主持人」):

音色: Leda日语模型: gemini-3.8-flash-tts10 秒
文稿:おはようございます!今日は朝から雨ですが、新しい傘を買ったので、ちょっとだけ楽しみです。駅まで一緒に歩きませんか?
音色: Puck葡萄牙语模型: gemini-3.8-flash-tts9 秒
文稿:Bom dia! Hoje vamos aprender a fazer um café coado perfeito, sem pressa e sem segredo. Primeiro, aqueça a água sem deixar ferver.

怎么控制 Gemini 3.8 TTS 的语气

风格描述的是整段话。越具体越好:谁在说、什么心情、多快。比如「沉稳的新闻主播」「冷淡又带点嘲讽」「跑得上气不接下气」「温柔的睡前故事口吻」。Google 说 3.8 会把正文严格当作要朗读的稿子,所以指示要写在风格里,不要写进正文。

行内标签标记文字中的某个时刻:

标签效果
<laugh>在这里笑一下
<sigh>叹气
<short pause> / <long pause>短停顿 / 长停顿
<breath>听得见的吸气
<gasp>倒吸一口气
<cough> / <throat-clearing>咳嗽 / 清嗓子

两个说话人:给每个说话人起名、配音色,每句话单独写风格。上面孙悟空那段就是这样做的。

Gemini TTS 的 30 个经典音色

经典预置音色,以及 Google 给每个音色的一词描述。音色接口一共列出 2,089 个预置音色、30 个语言区域,但没有一个是普通话音色;想要地道的中文 Gemini 声音,可以用文字描述设计一个。

音色特点音色特点音色特点
Zephyr明亮Puck欢快Charon知性
Kore坚定Fenrir激昂Leda青春
Orus坚定Aoede轻快Callirrhoe随和
Autonoe明亮Enceladus气声Iapetus清晰
Umbriel随和Algieba圆润Despina圆润
Erinome清晰Algenib沙哑Rasalgethi知性
Laomedeia欢快Achernar柔和Alnilam坚定
Schedar平稳Gacrux成熟Pulcherrima有冲劲
Achird友好Zubenelgenubi随意Vindemiatrix温柔
Sadachbia活泼Sadaltager博学Sulafat温暖

每个音色都能说所有支持的语言,说哪种语言由文字决定。

Gemini 3.8 TTS 和 Eleven v4 同稿对比

上面 7 段脚本,两个模型都跑了:Gemini 每段 1 次(免费档每天只允许很少的请求),Eleven v4 每段 3 次。两边的输出用同一个语音识别对照原稿打分。

Gemini 3.8 Flash TTSEleven v4
生成 1 秒音频要多少秒(中位数)0.570.23
没有多读或漏读7 段中 5 段21 次全部
加了原稿没有的词英文带标签那段加了「I, I…」「Uh」「Oh」;对白开头加了「嗯」没有
「眼镜」被转写成「眼睛」是否
标签被演出来、没有被念出来是是
同样脚本的音频总长110 秒(语速慢、停顿多)88 秒
每分钟成本约 0.017 美元(付费价)按字符计费:ElevenLabs 订阅套餐下约 0.15–0.20 美元(我们按英文每分钟约 900 字符估算)

结论:Gemini 便宜得多,用一句话描述语气也很顺手。Eleven v4 更快,而且严格按稿子读。广告、字幕、需要客户逐句确认的稿子,这一点很关键。所以声匠的多人有声剧工坊和有声剧场都用 Eleven v4。v4 的更多细节见 Eleven v4 vs v3 对比实测。

通过 API 调用 Gemini 3.8 TTS

3.8 模型走 Gemini API 的 interactions 接口,直接返回 WAV:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash-tts",
    "input": [{"type": "user_input", "content": [{
      "type": "text",
      "text": "等一下…… <short pause> 你听到了吗?<sigh>",
      "annotations": [{"type": "speech_metadata", "style": "紧张地压低声音"}]
    }]}],
    "response_format": {"type": "audio"},
    "generation_config": {"speech_config": [{"voice": "Kore"}]}
  }'

音频以 base64 放在 steps[].content[].data 里。用免费档开发前要知道两件事:免费档的输入可能被 Google 用于改进产品;面向欧洲经济区、英国、瑞士用户的应用必须用付费档。

常见问题

Gemini 3.8 TTS 是什么? Google 在 2026 年 9 月 23 日发布的文字转语音模型,同时发布了更便宜的 Gemini 3.8 Flash-Lite TTS。它用一句话描述语气,再配合 <laugh>、<sigh> 这类行内标签来控制演绎,一次请求最多两个说话人。

Gemini 3.8 TTS 免费吗? Google 提供每天请求数很少的免费档;免费档的输入可能被 Google 用于改进产品,且不能提供给欧洲经济区、英国和瑞士的用户。在本页不用注册,每天可以免费生成 2 次(本站每日免费额度用完前)。

Gemini 3.8 TTS 多少钱? 付费档到 2026 年 12 月 31 日为:文本输入每百万 token 0.50 美元,音频输出每百万 token 9 美元;2027 年 1 月 1 日起翻倍到 1 美元和 18 美元。我们实测每秒语音 32 个音频 token,折合现在约每分钟 0.017 美元(约 0.12 元人民币),2027 年起约 0.035 美元。

Gemini 3.8 TTS 有哪些音色? 常见的是 30 个经典预置音色,比如 Kore(坚定)、Puck(欢快)、Charon(知性)。我们在 2026 年 10 月 8 日列出音色接口,实际有 2,089 个预置音色、30 个语言区域,但没有一个普通话音色。另外还能用文字描述设计音色,或用 10–30 秒样本加本人授权语复刻音色。

Gemini 3.8 TTS 中文效果怎么样? 支持中文,会自动识别语言。我们的实测里,一段普通话旁白只错了一个字(「眼镜」被转写成「眼睛」),一段普通话台词里的 <laugh> 和 <sigh> 都被演出来了。

Gemini 3.8 TTS 和 ElevenLabs 的 Eleven v4 哪个好? Gemini 每分钟便宜得多。同样 7 段脚本,Eleven v4 的生成速度约是 Gemini 的 2.4 倍,而且没有多读或漏读一个字;Gemini 有 2 段加了原稿里没有的语气词。

Gemini 3.8 Flash TTS 和 Flash-Lite TTS 有什么区别? Flash-Lite 更便宜,适合大批量生产:2026 年内每百万音频 token 6 美元,Flash 是 9 美元。Google 的定位是 Flash 重音质和表演,Flash-Lite 重批量。

声匠和 Google 是什么关系? 没有隶属关系。声匠是独立产品,本页试听调用的是公开的 Gemini API;Gemini 是 Google LLC 的商标。