Gemini 声音设计 - 免费在线试用 Gemini 3.8

免费在线试用 Gemini 3.8 声音设计,无需注册:一句话描述声音,听它即兴开口。附中文音色实测、被拦截的描述、API 调用和 ElevenLabs 对比。

最近更新: 2026-10-08

Gemini 声音设计能把一句描述变成一个新声音。 它是 Google 在 2026 年 9 月 23 日发布的 Gemini 3.8 TTS 的一部分:描述年龄、口音、音色和性格,Gemini 就会生成一个保存好的音色,并以这个角色即兴说一段话。Google 的预置音色库里没有普通话音色,想要中文的 Gemini 声音,只能靠设计。下面免注册直接试。

用 Gemini 3.8 设计一个声音:免费,无需注册

每天免费 2 次。用一两句话描述年龄、口音、音色和性格,Gemini 会以这个角色即兴说一段话;描述用什么语言写,它就用什么语言说。

示例46 / 300
性别
语言
今天还剩 2 次免费

本试听使用 Google 免费档:你输入的内容可能被 Google 用于改进其产品,请不要输入隐私信息。

一表看懂

Gemini 声音设计
出品Google(Gemini 3.8 TTS)
发布2026 年 9 月 23 日
模型gemini-3.8-flash-tts、gemini-3.8-flash-lite-tts
输入一段描述(Google 建议 1–2 句)、性别、语言区域
输出一个保存好的音色(voice_…)+ 一段即兴的 WAV 预览(实测 7–49 秒)
保存必须保存;每个项目最多 200 个,每个保留一年
速度免费档实测每次 12–40 秒
成本未单独定价;我们 40 秒的预览用了 1,002 个音频 token,按 2026 年付费价约 $0.009
安全部分描述会被拒;所有 Gemini 音频都带 SynthID 水印
在哪用Gemini API、Google AI Studio

实测发现

我们在 2026 年 10 月 8 日用免费档 API 设计了几个声音,每条都保留原样。

1. 预览是即兴的,不是朗读。 用中文描述「一位五十多岁的北京胡同说书先生,嗓音浑厚略带沙哑,说话慢条斯理,爱卖关子,带一点京腔儿化音」,Gemini 自己编了一段鬼故事开头,停顿、卖关子都有:

音色: Gemini 设计音色 · 北京说书先生中文模型: gemini-3.8-flash-tts21 秒
文稿:您说的没错。就那么一回呀,老吴提着灯笼,正打后院那片荒草地边上过,突然间,哎,就听见那么一声响,嘿,轻飘飘的,可愣是叫人听得头皮发麻呀。

2. 预览的语言跟着描述走,不跟语言区域走。 我们把猴王的英文描述交给 Gemini,语言区域设成普通话(cmn-CN),预览却是英文。描述写成中文,预览才是中文。不过读文稿时语言区域照样起作用:英文描述出来的猴王读中文广告词很顺(见下方对比)。

英文描述的苏格兰老渔夫,即兴说了 40 秒他那条倔脾气的船:

音色: Gemini designed voice · Scottish fisherman英语模型: gemini-3.8-flash-tts40 秒
文稿:Ah, it's a, it's a stubborn lass, that one. Aye. I've been at it now, what, an hour? And it, so right she won't. It's not what's putting against her, she says. Ah, it's the, the things in her head. I can tell you when the wind picks up and, and the waves come. But this one, no, she's, she's just had enough for the day. Yeah, I suppose that's quite right, actually. After all this time, well, who am I to question it? Little so.

同一个声音念我们给的台词:

音色: Gemini designed voice · Scottish fisherman英语模型: gemini-3.8-flash-tts6 秒
文稿:Right then. The tide turns at half past four, and if you're not on the boat by then, you're not coming.

3. 安全策略会拦下一部分虚构角色。 冷艳女王的描述「An icy, menacing villainess queen: low, slow, every word a blade」直接返回 Voice prompt was blocked by safety policies,而 ElevenLabs 当初接受了同样的描述。写反派时,描述声音(低沉、缓慢、冷、咬字清楚),别写威胁感。

4. 预置音色库里没有普通话。 列出音色接口,共 2,089 个预置音色、30 个语言区域,最多的是美式英语(215)、印度英语(120)、英式英语(118)、韩语(117)、日语(115)、印地语(114)、巴西葡语(107),没有一个普通话或粤语音色。

5. 当天日语设计失败。 用语言区域 ja-JP 设计我们的元气动漫少女,两次都返回 503 The service is currently unavailable,而前后一分钟英语的设计都正常。可能只是暂时的,但要用某个语言之前,先自己试一下。

同一段描述,两个引擎

声匠的 24 个角色音都是用 ElevenLabs 声音设计做的。我们把每个音色页上的描述原样交给 Gemini,再让 Gemini 设计出的声音念那个音色页上已有的同一段文稿。

齐天大圣·猴王 ·「A Monkey King–style character: high-pitched, cheeky, slightly raspy with opera flair.」

Gemini 3.8(语言区域 cmn-CN):

音色: Gemini designed voice · Monkey King中文模型: gemini-3.8-flash-tts10 秒
文稿:新一代降噪耳机,四十小时续航,三秒开盖即连。今天下单,立减两百,再送一年延保。数量有限,现在就来。

ElevenLabs 的猴王音色:

音色: 齐天大圣·猴王 (ElevenLabs Voice Design)中文17 秒
文稿:新一代降噪耳机,四十小时续航,三秒开盖即连。今天下单,立减两百,再送一年延保。数量有限,现在就来。

Gemini 给这个猴王即兴的英文预览,笑着嘲讽满天神佛:

音色: Gemini designed voice · Monkey King英语模型: gemini-3.8-flash-tts30 秒
文稿:[laughs] See? They thought they had a trick up their sleeve, eh? Did they? To trap me, the mighty master of mischief, in something so petty. [laughs] Nonsense. I'm faster than a thousand lightning bolts, and all that big mouth talk about sealing me away, [laughs] all the gods, I simply shrug. Look like a hundred sleepy owls lost in a fog. [laughs]

同样 49 个字的广告词,Gemini 念了 10.4 秒,ElevenLabs 念了 17.3 秒:Gemini 更亮、更快,戏曲味的沙哑少一些。

美式预告片男声 ·「The classic Hollywood "In a world…" trailer voice: ultra-deep, gravelly, epic.」

Gemini 3.8(语言区域 en-US):

音色: Gemini designed voice · Trailer Voice英语模型: gemini-3.8-flash-tts19 秒
文稿:The new noise-cancelling headphones: forty hours of battery, connected three seconds after you open the case. Order today, save two hundred, and get a year of extra warranty. Limited stock — go now.

ElevenLabs 的美式预告片男声:

音色: Trailer Voice (ElevenLabs Voice Design)英语23 秒
文稿:The new noise-cancelling headphones: forty hours of battery, connected three seconds after you open the case. Order today, save two hundred, and get a year of extra warranty. Limited stock — go now.

Gemini 自己即兴的预览,一段讲人类历史的史诗开场:

音色: Gemini designed voice · Trailer Voice英语模型: gemini-3.8-flash-tts32 秒
文稿:In the vast tapestry of time, where echoes of ancient whispers persist among the sands, one thing remains clear: this is the course of human history. The world we built, the boundaries we pushed, and now we stand at a crossroads.

英伦绅士管家 ·「A refined British butler in crisp RP: calm, dry, impeccably courteous.」

Gemini 3.8(语言区域 en-GB):

音色: Gemini designed voice · British Butler英语模型: gemini-3.8-flash-tts16 秒
文稿:On the third morning the fog had still not lifted. She walked back along the embankment with dew on her shoes, and when a horn sounded from the distant ferry she remembered the letter, still in the desk drawer, unsent.

ElevenLabs 的英伦绅士管家:

音色: British Butler (ElevenLabs Voice Design)英语15 秒
文稿:On the third morning the fog had still not lifted. She walked back along the embankment with dew on her shoes, and when a horn sounded from the distant ferry she remembered the letter, still in the desk drawer, unsent.

这次 Gemini 的预览只有 7 秒,一句「为您的聚会留了一瓶上好的波尔多」:

音色: Gemini designed voice · British Butler英语模型: gemini-3.8-flash-tts8 秒
文稿:I've taken the liberty of setting aside some very fine Bordeaux for your gathering, sir.
音色文稿Gemini 3.8ElevenLabs
齐天大圣·猴王中文广告,49 字10.4 秒17.3 秒
美式预告片男声英文广告,198 字符19.3 秒22.9 秒
英伦绅士管家英文旁白,218 字符16.1 秒15.0 秒
冷艳女王—被安全策略拒绝已设计
元气动漫少女(ja-JP)—两次返回 503「服务不可用」已设计

两段广告 Gemini 都念得比 ElevenLabs 快,旁白语速差不多。需要说明:每个 ElevenLabs 音色都是我们建站时为这个角色选定的,而这里每个 Gemini 声音都只用了一段描述、一次生成。所以这张表反映的是两个引擎「第一次给你什么」,不是各自的上限。

描述怎么写

  • 写固定特征:年龄、性别、音色、口音、语速。Google 自己的例子是「a crisp, energetic sports announcer in her 30s with a slight Midwestern accent」。
  • 情绪留到后面。 「压低声音」「暴怒」这类临时情绪,放到每次 Gemini TTS 请求的风格指令里,不要写进音色。
  • 想听哪种语言的预览,就用哪种语言写描述。
  • 写声音,不写威胁。 「冷、慢、咬字清楚」能过,「威胁感、字字带刀」没过。

通过 API 使用

先创建音色,返回里有 id 和 sample_audio(base64 WAV):

curl -X POST "https://generativelanguage.googleapis.com/v1beta/voices" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "store": true,
    "voice": {
      "model": "gemini-3.8-flash-tts",
      "type": "prompted",
      "display_name": "北京说书先生",
      "gender": "male",
      "language_code": "cmn-CN",
      "prompted": { "input": "一位五十多岁的北京胡同说书先生,嗓音浑厚略带沙哑,说话慢条斯理。" }
    }
  }'

再把 ID 当作音色,朗读你的文稿:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash-tts",
    "input": [{ "type": "user_input", "content": [{ "type": "text", "text": "话说那天夜里,老吴提着灯笼往后院走。" }] }],
    "response_format": { "type": "audio" },
    "generation_config": { "speech_config": [{ "voice": "voice_YOUR_ID" }] }
  }'

两点注意:设计音色不允许 "store": false;音色会一直占着每个项目 200 个的名额,直到你用 DELETE /v1beta/voices/{id} 删掉。本页的试用会在预览返回后立即删除音色。

Gemini 和 ElevenLabs 声音设计对比

Gemini 3.8 声音设计ElevenLabs 声音设计
预览一段,以角色即兴几段,念你给的(或它写的)文字
设计好的声音在哪用Gemini API、AI StudioElevenLabs 应用和 API,以及基于它的工作台(如声匠)
普通话可以,靠设计(cmn-CN)可以
反派类描述部分被拒我们实测可以
保存每个项目 200 个,保留一年存进音色库

在声匠,你可以在语音工作台用 ElevenLabs 设计声音并长期用于所有工具,也可以直接从音色库里 24 个设计好的角色音开始。Gemini 的预置音色和风格指令见 Gemini 3.8 TTS 在线试用;想复刻真人声音,见 Gemini 声音克隆。

常见问题

Gemini 声音设计是什么? 声音设计是 Google 在 2026 年 9 月 23 日随 Gemini 3.8 TTS 发布的功能:用一两句话描述年龄、性别、口音、音色和性格,就能生成一个新声音。这个声音会保存在你的 Google 项目里,之后可以通过 Gemini API 朗读任何文稿。

Gemini 声音设计能免费试吗? 能。本页不用注册,每天可以免费设计 2 个声音;开发者也可以在 Google AI Studio 里试。走 API 时,Google 没有单独公布设计声音的价格;我们实测设计一次约用 1,000 个音频 token,按 2026 年付费价不到 1 美分。

Gemini 能设计普通话声音吗? 能,语言选 cmn-CN 即可。这一点很重要:我们在 2026 年 10 月 8 日列出 Google 的预置音色库,共 2,089 个音色、30 个语言区域,其中一个普通话音色都没有。想要中文的 Gemini 声音,只能靠声音设计。想让预览说中文,描述也要用中文写。

设计完会返回什么? 一个音色 ID(voice_…)和一段 WAV 预览。预览不是固定句子,而是 Gemini 以这个角色即兴说的一段话(我们实测 7–49 秒),语言跟着描述走。想听它念你的文稿,把文稿和这个 ID 一起发到 interactions 接口。

为什么我的描述被拦截了? Google 的安全策略会拒绝部分描述,返回「Voice prompt was blocked by safety policies」。我们实测时,「冷艳、带威胁感的反派女王,字字带刀」这类描述被拒,而 ElevenLabs 声音设计接受了同样的描述。写反派时,描述声音本身(低沉、缓慢、冷、咬字清楚),不要写角色的威胁感。

设计好的声音能保存多少个? 设计音色必须保存,每个 Google 项目最多保存 200 个音色(设计和克隆合计),每个音色创建一年后过期,也可以随时删除。

选 Gemini 声音设计还是 ElevenLabs 声音设计? Gemini 每次给一段即兴预览,只能在 Google API 或 AI Studio 里用;ElevenLabs 会用你给的文字生成几段预览,音色存进音色库,在它的应用里都能用。声匠的 24 个角色音都是用 ElevenLabs 设计的,本页把同样的描述交给 Gemini 做了对比。

声匠和 Google 是什么关系? 没有隶属关系。声匠是独立的配音工作台;Gemini 是 Google LLC 的商标,本页的试用调用的是公开的 Gemini API。

看 24 个设计好的角色音 →