Gemini 3.8 TTS 在线试用 - 免费语音合成
免费在线试用 Google Gemini 3.8 TTS,无需注册:选音色、用一句话描述语气,马上听。附中英日真实样音、30 个音色表、每分钟成本,以及和 Eleven v4 的同稿实测。
最近更新: 2026-10-08
Gemini 3.8 Flash TTS 是 Google 在 2026 年 9 月 23 日发布的最新文字转语音模型。 它不让你从情绪预设里选,而是用一句话告诉它语气,比如「紧张地压低声音」「激情的体育解说」,再在文字里插入 <laugh>(笑)、<sigh>(叹气)这类标签。它支持 100 多种语言,一次请求最多两个说话人,按 Google 付费价约 每分钟 0.017 美元(约 0.12 元人民币)。下面直接试:
免费试用 Gemini 3.8 TTS,无需注册
每天免费 2 次,每次最多 200 字。用一句话描述想要的语气;<laugh> 这类标签会被演出来,不会被念出来。
本试听使用 Google 免费档:你输入的内容可能被 Google 用于改进其产品,请不要输入隐私信息。
Gemini 3.8 TTS 基本参数
| Gemini 3.8 Flash TTS | |
|---|---|
| 出品方 | |
| 发布时间 | 2026 年 9 月 23 日,与 Gemini 3.8 Flash-Lite TTS 同时发布 |
| 模型 ID | gemini-3.8-flash-tts、gemini-3.8-flash-lite-tts |
| 音色 | 30 个经典预置音色;音色接口共列出 2,089 个、30 个语言区域(没有普通话);另可文字描述设计音色、用 10–30 秒样本克隆 |
| 语言 | 100 多种语言和方言,自动识别(API 文档写 Flash 支持 130 多种) |
| 怎么控制 | 每段一句话描述风格,加 <laugh>、<sigh>、<short pause> 等行内标签 |
| 说话人 | 每次请求最多 2 个 |
| 输出 | WAV,24 kHz 单声道 16 位 |
| 价格 | 有免费档(每天请求数很少);付费档:文本输入每百万 token 0.50 美元,音频输出每百万 token 9 美元(2027 年 1 月 1 日起翻倍) |
| 每分钟成本(实测) | 现在约 0.017 美元,2027 年起约 0.035 美元(每秒语音 32 个音频 token) |
| 水印 | 每段音频都带 SynthID 水印 |
| 在哪能用 | Gemini API、Google AI Studio、Gemini Notebook;Flash-Lite 已用于 Google Vids |
试听:Gemini 3.8 TTS 真实生成效果
以下音频都是 2026 年 10 月 5 日用 gemini-3.8-flash-tts 一次生成的,没有挑选,也没有后期剪辑。播放器下面是发出去的原文,上面写着我们给的风格描述。脚本和 Eleven v4 页上的完全相同,可以直接对比。
普通话旁白,音色 Charon,风格「沉稳温暖的普通话新闻主播」:
普通话加标签,音色 Kore,风格「冷淡嘲讽,压低成威胁的耳语」:
<laugh> 你以为我会就这么算了?合同在我手里,三天之内,你会求着来找我。<sigh> 可惜啊,我们本来可以是朋友。一次请求两个说话人:Algenib 演师父,Fenrir 演孙悟空,每句单独给风格:
<laugh> 师父莫急,俺老孙不过是借了他三根毫毛!
<sigh> 借?只怕人家此刻正满山找你呢。
找便找,俺一个筋斗,早到了十万八千里外!英文旁白,音色 Charon,风格「从容温暖的英式讲故事」;英文加标签,音色 Leda,风格「先紧张地耳语,然后松一口气、被逗笑」:
<laugh> Relax, it's just the cat. <sigh> You scared me half to death.日语(Leda,「明亮开朗的动漫少女」)和巴西葡萄牙语(Puck,「亲切的巴西主持人」):
怎么控制 Gemini 3.8 TTS 的语气
风格描述的是整段话。越具体越好:谁在说、什么心情、多快。比如「沉稳的新闻主播」「冷淡又带点嘲讽」「跑得上气不接下气」「温柔的睡前故事口吻」。Google 说 3.8 会把正文严格当作要朗读的稿子,所以指示要写在风格里,不要写进正文。
行内标签标记文字中的某个时刻:
| 标签 | 效果 |
|---|---|
<laugh> | 在这里笑一下 |
<sigh> | 叹气 |
<short pause> / <long pause> | 短停顿 / 长停顿 |
<breath> | 听得见的吸气 |
<gasp> | 倒吸一口气 |
<cough> / <throat-clearing> | 咳嗽 / 清嗓子 |
两个说话人:给每个说话人起名、配音色,每句话单独写风格。上面孙悟空那段就是这样做的。
Gemini TTS 的 30 个经典音色
经典预置音色,以及 Google 给每个音色的一词描述。音色接口一共列出 2,089 个预置音色、30 个语言区域,但没有一个是普通话音色;想要地道的中文 Gemini 声音,可以用文字描述设计一个。
| 音色 | 特点 | 音色 | 特点 | 音色 | 特点 |
|---|---|---|---|---|---|
| Zephyr | 明亮 | Puck | 欢快 | Charon | 知性 |
| Kore | 坚定 | Fenrir | 激昂 | Leda | 青春 |
| Orus | 坚定 | Aoede | 轻快 | Callirrhoe | 随和 |
| Autonoe | 明亮 | Enceladus | 气声 | Iapetus | 清晰 |
| Umbriel | 随和 | Algieba | 圆润 | Despina | 圆润 |
| Erinome | 清晰 | Algenib | 沙哑 | Rasalgethi | 知性 |
| Laomedeia | 欢快 | Achernar | 柔和 | Alnilam | 坚定 |
| Schedar | 平稳 | Gacrux | 成熟 | Pulcherrima | 有冲劲 |
| Achird | 友好 | Zubenelgenubi | 随意 | Vindemiatrix | 温柔 |
| Sadachbia | 活泼 | Sadaltager | 博学 | Sulafat | 温暖 |
每个音色都能说所有支持的语言,说哪种语言由文字决定。
Gemini 3.8 TTS 和 Eleven v4 同稿对比
上面 7 段脚本,两个模型都跑了:Gemini 每段 1 次(免费档每天只允许很少的请求),Eleven v4 每段 3 次。两边的输出用同一个语音识别对照原稿打分。
| Gemini 3.8 Flash TTS | Eleven v4 | |
|---|---|---|
| 生成 1 秒音频要多少秒(中位数) | 0.57 | 0.23 |
| 没有多读或漏读 | 7 段中 5 段 | 21 次全部 |
| 加了原稿没有的词 | 英文带标签那段加了「I, I…」「Uh」「Oh」;对白开头加了「嗯」 | 没有 |
| 「眼镜」被转写成「眼睛」 | 是 | 否 |
| 标签被演出来、没有被念出来 | 是 | 是 |
| 同样脚本的音频总长 | 110 秒(语速慢、停顿多) | 88 秒 |
| 每分钟成本 | 约 0.017 美元(付费价) | 按字符计费:ElevenLabs 订阅套餐下约 0.15–0.20 美元(我们按英文每分钟约 900 字符估算) |
结论:Gemini 便宜得多,用一句话描述语气也很顺手。Eleven v4 更快,而且严格按稿子读。广告、字幕、需要客户逐句确认的稿子,这一点很关键。所以声匠的多人有声剧工坊和有声剧场都用 Eleven v4。v4 的更多细节见 Eleven v4 vs v3 对比实测。
通过 API 调用 Gemini 3.8 TTS
3.8 模型走 Gemini API 的 interactions 接口,直接返回 WAV:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash-tts",
"input": [{"type": "user_input", "content": [{
"type": "text",
"text": "等一下…… <short pause> 你听到了吗?<sigh>",
"annotations": [{"type": "speech_metadata", "style": "紧张地压低声音"}]
}]}],
"response_format": {"type": "audio"},
"generation_config": {"speech_config": [{"voice": "Kore"}]}
}'
音频以 base64 放在 steps[].content[].data 里。用免费档开发前要知道两件事:免费档的输入可能被 Google 用于改进产品;面向欧洲经济区、英国、瑞士用户的应用必须用付费档。
常见问题
Gemini 3.8 TTS 是什么? Google 在 2026 年 9 月 23 日发布的文字转语音模型,同时发布了更便宜的 Gemini 3.8 Flash-Lite TTS。它用一句话描述语气,再配合 <laugh>、<sigh> 这类行内标签来控制演绎,一次请求最多两个说话人。
Gemini 3.8 TTS 免费吗? Google 提供每天请求数很少的免费档;免费档的输入可能被 Google 用于改进产品,且不能提供给欧洲经济区、英国和瑞士的用户。在本页不用注册,每天可以免费生成 2 次(本站每日免费额度用完前)。
Gemini 3.8 TTS 多少钱? 付费档到 2026 年 12 月 31 日为:文本输入每百万 token 0.50 美元,音频输出每百万 token 9 美元;2027 年 1 月 1 日起翻倍到 1 美元和 18 美元。我们实测每秒语音 32 个音频 token,折合现在约每分钟 0.017 美元(约 0.12 元人民币),2027 年起约 0.035 美元。
Gemini 3.8 TTS 有哪些音色? 常见的是 30 个经典预置音色,比如 Kore(坚定)、Puck(欢快)、Charon(知性)。我们在 2026 年 10 月 8 日列出音色接口,实际有 2,089 个预置音色、30 个语言区域,但没有一个普通话音色。另外还能用文字描述设计音色,或用 10–30 秒样本加本人授权语复刻音色。
Gemini 3.8 TTS 中文效果怎么样? 支持中文,会自动识别语言。我们的实测里,一段普通话旁白只错了一个字(「眼镜」被转写成「眼睛」),一段普通话台词里的 <laugh> 和 <sigh> 都被演出来了。
Gemini 3.8 TTS 和 ElevenLabs 的 Eleven v4 哪个好? Gemini 每分钟便宜得多。同样 7 段脚本,Eleven v4 的生成速度约是 Gemini 的 2.4 倍,而且没有多读或漏读一个字;Gemini 有 2 段加了原稿里没有的语气词。
Gemini 3.8 Flash TTS 和 Flash-Lite TTS 有什么区别? Flash-Lite 更便宜,适合大批量生产:2026 年内每百万音频 token 6 美元,Flash 是 9 美元。Google 的定位是 Flash 重音质和表演,Flash-Lite 重批量。
声匠和 Google 是什么关系? 没有隶属关系。声匠是独立产品,本页试听调用的是公开的 Gemini API;Gemini 是 Google LLC 的商标。