Gemini 声音设计 - 免费在线试用 Gemini 3.8
免费在线试用 Gemini 3.8 声音设计,无需注册:一句话描述声音,听它即兴开口。附中文音色实测、被拦截的描述、API 调用和 ElevenLabs 对比。
最近更新: 2026-10-08
Gemini 声音设计能把一句描述变成一个新声音。 它是 Google 在 2026 年 9 月 23 日发布的 Gemini 3.8 TTS 的一部分:描述年龄、口音、音色和性格,Gemini 就会生成一个保存好的音色,并以这个角色即兴说一段话。Google 的预置音色库里没有普通话音色,想要中文的 Gemini 声音,只能靠设计。下面免注册直接试。
用 Gemini 3.8 设计一个声音:免费,无需注册
每天免费 2 次。用一两句话描述年龄、口音、音色和性格,Gemini 会以这个角色即兴说一段话;描述用什么语言写,它就用什么语言说。
本试听使用 Google 免费档:你输入的内容可能被 Google 用于改进其产品,请不要输入隐私信息。
一表看懂
| Gemini 声音设计 | |
|---|---|
| 出品 | Google(Gemini 3.8 TTS) |
| 发布 | 2026 年 9 月 23 日 |
| 模型 | gemini-3.8-flash-tts、gemini-3.8-flash-lite-tts |
| 输入 | 一段描述(Google 建议 1–2 句)、性别、语言区域 |
| 输出 | 一个保存好的音色(voice_…)+ 一段即兴的 WAV 预览(实测 7–49 秒) |
| 保存 | 必须保存;每个项目最多 200 个,每个保留一年 |
| 速度 | 免费档实测每次 12–40 秒 |
| 成本 | 未单独定价;我们 40 秒的预览用了 1,002 个音频 token,按 2026 年付费价约 $0.009 |
| 安全 | 部分描述会被拒;所有 Gemini 音频都带 SynthID 水印 |
| 在哪用 | Gemini API、Google AI Studio |
实测发现
我们在 2026 年 10 月 8 日用免费档 API 设计了几个声音,每条都保留原样。
1. 预览是即兴的,不是朗读。 用中文描述「一位五十多岁的北京胡同说书先生,嗓音浑厚略带沙哑,说话慢条斯理,爱卖关子,带一点京腔儿化音」,Gemini 自己编了一段鬼故事开头,停顿、卖关子都有:
2. 预览的语言跟着描述走,不跟语言区域走。 我们把猴王的英文描述交给 Gemini,语言区域设成普通话(cmn-CN),预览却是英文。描述写成中文,预览才是中文。不过读文稿时语言区域照样起作用:英文描述出来的猴王读中文广告词很顺(见下方对比)。
英文描述的苏格兰老渔夫,即兴说了 40 秒他那条倔脾气的船:
同一个声音念我们给的台词:
3. 安全策略会拦下一部分虚构角色。 冷艳女王的描述「An icy, menacing villainess queen: low, slow, every word a blade」直接返回 Voice prompt was blocked by safety policies,而 ElevenLabs 当初接受了同样的描述。写反派时,描述声音(低沉、缓慢、冷、咬字清楚),别写威胁感。
4. 预置音色库里没有普通话。 列出音色接口,共 2,089 个预置音色、30 个语言区域,最多的是美式英语(215)、印度英语(120)、英式英语(118)、韩语(117)、日语(115)、印地语(114)、巴西葡语(107),没有一个普通话或粤语音色。
5. 当天日语设计失败。 用语言区域 ja-JP 设计我们的元气动漫少女,两次都返回 503 The service is currently unavailable,而前后一分钟英语的设计都正常。可能只是暂时的,但要用某个语言之前,先自己试一下。
同一段描述,两个引擎
声匠的 24 个角色音都是用 ElevenLabs 声音设计做的。我们把每个音色页上的描述原样交给 Gemini,再让 Gemini 设计出的声音念那个音色页上已有的同一段文稿。
齐天大圣·猴王 ·「A Monkey King–style character: high-pitched, cheeky, slightly raspy with opera flair.」
Gemini 3.8(语言区域 cmn-CN):
ElevenLabs 的猴王音色:
Gemini 给这个猴王即兴的英文预览,笑着嘲讽满天神佛:
[laughs] See? They thought they had a trick up their sleeve, eh? Did they? To trap me, the mighty master of mischief, in something so petty. [laughs] Nonsense. I'm faster than a thousand lightning bolts, and all that big mouth talk about sealing me away, [laughs] all the gods, I simply shrug. Look like a hundred sleepy owls lost in a fog. [laughs]同样 49 个字的广告词,Gemini 念了 10.4 秒,ElevenLabs 念了 17.3 秒:Gemini 更亮、更快,戏曲味的沙哑少一些。
美式预告片男声 ·「The classic Hollywood "In a world…" trailer voice: ultra-deep, gravelly, epic.」
Gemini 3.8(语言区域 en-US):
ElevenLabs 的美式预告片男声:
Gemini 自己即兴的预览,一段讲人类历史的史诗开场:
英伦绅士管家 ·「A refined British butler in crisp RP: calm, dry, impeccably courteous.」
Gemini 3.8(语言区域 en-GB):
ElevenLabs 的英伦绅士管家:
这次 Gemini 的预览只有 7 秒,一句「为您的聚会留了一瓶上好的波尔多」:
| 音色 | 文稿 | Gemini 3.8 | ElevenLabs |
|---|---|---|---|
| 齐天大圣·猴王 | 中文广告,49 字 | 10.4 秒 | 17.3 秒 |
| 美式预告片男声 | 英文广告,198 字符 | 19.3 秒 | 22.9 秒 |
| 英伦绅士管家 | 英文旁白,218 字符 | 16.1 秒 | 15.0 秒 |
| 冷艳女王 | — | 被安全策略拒绝 | 已设计 |
元气动漫少女(ja-JP) | — | 两次返回 503「服务不可用」 | 已设计 |
两段广告 Gemini 都念得比 ElevenLabs 快,旁白语速差不多。需要说明:每个 ElevenLabs 音色都是我们建站时为这个角色选定的,而这里每个 Gemini 声音都只用了一段描述、一次生成。所以这张表反映的是两个引擎「第一次给你什么」,不是各自的上限。
描述怎么写
- 写固定特征:年龄、性别、音色、口音、语速。Google 自己的例子是「a crisp, energetic sports announcer in her 30s with a slight Midwestern accent」。
- 情绪留到后面。 「压低声音」「暴怒」这类临时情绪,放到每次 Gemini TTS 请求的风格指令里,不要写进音色。
- 想听哪种语言的预览,就用哪种语言写描述。
- 写声音,不写威胁。 「冷、慢、咬字清楚」能过,「威胁感、字字带刀」没过。
通过 API 使用
先创建音色,返回里有 id 和 sample_audio(base64 WAV):
curl -X POST "https://generativelanguage.googleapis.com/v1beta/voices" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"store": true,
"voice": {
"model": "gemini-3.8-flash-tts",
"type": "prompted",
"display_name": "北京说书先生",
"gender": "male",
"language_code": "cmn-CN",
"prompted": { "input": "一位五十多岁的北京胡同说书先生,嗓音浑厚略带沙哑,说话慢条斯理。" }
}
}'
再把 ID 当作音色,朗读你的文稿:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash-tts",
"input": [{ "type": "user_input", "content": [{ "type": "text", "text": "话说那天夜里,老吴提着灯笼往后院走。" }] }],
"response_format": { "type": "audio" },
"generation_config": { "speech_config": [{ "voice": "voice_YOUR_ID" }] }
}'
两点注意:设计音色不允许 "store": false;音色会一直占着每个项目 200 个的名额,直到你用 DELETE /v1beta/voices/{id} 删掉。本页的试用会在预览返回后立即删除音色。
Gemini 和 ElevenLabs 声音设计对比
| Gemini 3.8 声音设计 | ElevenLabs 声音设计 | |
|---|---|---|
| 预览 | 一段,以角色即兴 | 几段,念你给的(或它写的)文字 |
| 设计好的声音在哪用 | Gemini API、AI Studio | ElevenLabs 应用和 API,以及基于它的工作台(如声匠) |
| 普通话 | 可以,靠设计(cmn-CN) | 可以 |
| 反派类描述 | 部分被拒 | 我们实测可以 |
| 保存 | 每个项目 200 个,保留一年 | 存进音色库 |
在声匠,你可以在语音工作台用 ElevenLabs 设计声音并长期用于所有工具,也可以直接从音色库里 24 个设计好的角色音开始。Gemini 的预置音色和风格指令见 Gemini 3.8 TTS 在线试用;想复刻真人声音,见 Gemini 声音克隆。
常见问题
Gemini 声音设计是什么? 声音设计是 Google 在 2026 年 9 月 23 日随 Gemini 3.8 TTS 发布的功能:用一两句话描述年龄、性别、口音、音色和性格,就能生成一个新声音。这个声音会保存在你的 Google 项目里,之后可以通过 Gemini API 朗读任何文稿。
Gemini 声音设计能免费试吗? 能。本页不用注册,每天可以免费设计 2 个声音;开发者也可以在 Google AI Studio 里试。走 API 时,Google 没有单独公布设计声音的价格;我们实测设计一次约用 1,000 个音频 token,按 2026 年付费价不到 1 美分。
Gemini 能设计普通话声音吗? 能,语言选 cmn-CN 即可。这一点很重要:我们在 2026 年 10 月 8 日列出 Google 的预置音色库,共 2,089 个音色、30 个语言区域,其中一个普通话音色都没有。想要中文的 Gemini 声音,只能靠声音设计。想让预览说中文,描述也要用中文写。
设计完会返回什么? 一个音色 ID(voice_…)和一段 WAV 预览。预览不是固定句子,而是 Gemini 以这个角色即兴说的一段话(我们实测 7–49 秒),语言跟着描述走。想听它念你的文稿,把文稿和这个 ID 一起发到 interactions 接口。
为什么我的描述被拦截了? Google 的安全策略会拒绝部分描述,返回「Voice prompt was blocked by safety policies」。我们实测时,「冷艳、带威胁感的反派女王,字字带刀」这类描述被拒,而 ElevenLabs 声音设计接受了同样的描述。写反派时,描述声音本身(低沉、缓慢、冷、咬字清楚),不要写角色的威胁感。
设计好的声音能保存多少个? 设计音色必须保存,每个 Google 项目最多保存 200 个音色(设计和克隆合计),每个音色创建一年后过期,也可以随时删除。
选 Gemini 声音设计还是 ElevenLabs 声音设计? Gemini 每次给一段即兴预览,只能在 Google API 或 AI Studio 里用;ElevenLabs 会用你给的文字生成几段预览,音色存进音色库,在它的应用里都能用。声匠的 24 个角色音都是用 ElevenLabs 设计的,本页把同样的描述交给 Gemini 做了对比。
声匠和 Google 是什么关系? 没有隶属关系。声匠是独立的配音工作台;Gemini 是 Google LLC 的商标,本页的试用调用的是公开的 Gemini API。