Gemini 声音克隆 - Gemini 3.8 声音复刻教程
Gemini 3.8 声音克隆:10–30 秒样本加一句授权语(附中文原文),哪些地区不能用、保存期限、API 调用,以及和 ElevenLabs 克隆的对比。
最近更新: 2026-10-08
Gemini 可以用 10–30 秒的录音克隆一个声音,前提是说话人本人再录一句授权语。 Google 把这个功能叫做 Voice Replication(声音复刻),随 Gemini 3.8 TTS 在 2026 年 9 月 23 日发布,在 Google AI Studio 和 Gemini API 里都能用。按 Google 公告,AI Studio 里的这个功能在美国伊利诺伊州、得克萨斯州,以及欧洲经济区、英国、瑞士和印度不可用。本页讲清楚需要准备什么、中文授权语原文、API 怎么调,以及和 ElevenLabs 克隆的区别。
一表看懂
| Gemini 声音复刻 | |
|---|---|
| 出品 | Google(Gemini 3.8 TTS) |
| 发布 | 2026 年 9 月 23 日 |
| 模型 | gemini-3.8-flash-tts、gemini-3.8-flash-lite-tts |
| 参考样本 | 一位成年人 10–30 秒的录音;建议 24 kHz 单声道 16 位 WAV |
| 授权 | 同一个人逐字朗读 Google 授权语(30 种语言) |
| 结果 | 保存的音色 voice_…(保留 1 年,每项目 200 个),或不保存的 voicekey_…(7 天) |
| 在哪用 | Google AI Studio、Gemini API |
| AI Studio 不可用地区 | 伊利诺伊、得克萨斯、欧洲经济区、英国、瑞士、印度(Google 公告) |
| 水印 | 所有 Gemini 音频都带 SynthID |
| 价格 | 创建音色未单独定价;生成语音按 Gemini TTS 输出计费(Flash 在 2026 年每百万音频 token 9 美元) |
需要准备什么
- 一段 10–30 秒的参考样本。 一个成年人自然说话,不要背景音乐和其他人声。安静的房间比贵的麦克风更重要。
- 一段授权录音。 同一个人逐字念出 Google 的授权语。用录样本时的同一支麦克风、在同一个房间录:Google 会核对两段录音是不是同一个人,换了设备或环境最容易通不过。
- 一个 Google AI Studio 账号,或一个 Gemini API key。
授权语原文
Google 提供 30 种语言的授权语,以下三种是原文:
| 语言 | 授权语 |
|---|---|
简体中文 zh-CN | 我是此声音的拥有者并授权谷歌使用此声音创建语音合成模型 |
英语(美国)en-US | I am the owner of this voice and I consent to Google using this voice to create a synthetic voice model. |
日语 ja-JP | 私はこの音声の所有者であり、Googleがこの音声を使用して音声合成モデルを作成することを承認します。 |
完整列表(阿拉伯语、印地语、韩语、葡萄牙语、西班牙语等)见 Google 的声音复刻文档。
用 API 克隆
用两段 WAV 拼出请求体(base64 -i 是 macOS 写法,Linux 用 base64 -w0),然后创建音色:
jq -n \
--arg src "$(base64 -i reference.wav)" \
--arg consent "$(base64 -i consent.wav)" \
'{store: true, voice: {model: "gemini-3.8-flash-tts", type: "replicated", display_name: "我的声音",
replicated: {source_audio: {mime_type: "audio/wav", data: $src},
consent_audio: {mime_type: "audio/wav", data: $consent}}}}' > voice.json
curl -X POST "https://generativelanguage.googleapis.com/v1beta/voices" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d @voice.json
返回里有 id(voice_…),像其他 Gemini 音色一样使用:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash-tts",
"input": [{ "type": "user_input", "content": [{ "type": "text", "text": "这是我克隆的声音。" }] }],
"response_format": { "type": "audio" },
"generation_config": { "speech_config": [{ "voice": "voice_YOUR_ID" }] }
}'
如果用 "store": false,返回的是 voicekey_…,Google 不替你保存,7 天内有效。保存的音色会占用每个项目 200 个的名额(和设计音色共用),直到你用 DELETE /v1beta/voices/{id} 删除。
Gemini 和 ElevenLabs 克隆对比
| Gemini 声音复刻 | ElevenLabs 即时克隆 | ElevenLabs 专业克隆 | |
|---|---|---|---|
| 需要的音频 | 10–30 秒 | 短样本,两分钟以内 | 长得多的训练音频 |
| 说话人校验 | 本人念授权语,与样本比对 | ElevenLabs 文档未描述 | 语音验证码 |
| 套餐 | Gemini API 或 AI Studio | 大多数套餐 | Creator 及以上 |
| 音色存在哪 | 你的 Google 项目(1 年) | 你的 ElevenLabs 音色库 | 你的 ElevenLabs 音色库,可公开分享 |
| 适合 | 基于 Gemini 开发的开发者 | 快速克隆、直接干活 | 自己声音的最高保真复刻 |
来源:Google Gemini API 声音复刻文档与发布公告、ElevenLabs 音色文档,2026 年 10 月 8 日核对。
为什么这页没有克隆样音
Google 设授权校验,是为了不让任何人的声音在本人不知情时被复制。我们也守同样的规矩:只有声音的主人同意,才会公开发布克隆效果,目前还没有录到愿意参与对比的志愿者。Gemini 声音设计页上的样音,全部来自不属于任何真人的设计声音。
在声匠克隆
声匠的语音工作台用 ElevenLabs 即时克隆:上传 1–3 分钟干净的录音、起个名字,就能用在文字转语音、多角色对话和长文有声书里,在 Eleven v4 上支持 90 多种语言。克隆一次 30 积分,¥29.9 起,支持支付宝。规矩和 Google 一样:只克隆你自己的声音,或者你有书面授权的声音。
没有可以克隆的声音?可以用 Gemini 免费设计一个,或者从 24 个原创角色音里挑。
常见问题
Gemini 能克隆声音吗? 能。Google 在 2026 年 9 月 23 日发布的 Gemini 3.8 TTS 可以用 10–30 秒的参考录音复刻一个声音,Google 把这个功能叫做 Voice Replication(声音复刻)。在 Google AI Studio 和 Gemini API 里都能用,支持 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts 两个模型。
Gemini 克隆声音需要什么? 同一位成年说话人的两段录音:一段 10–30 秒的参考样本(Google 建议 24 kHz、单声道、16 位 WAV),一段本人逐字朗读 Google 授权语的录音。Google 建议两段用同一支麦克风、在同一个房间录,否则可能通不过说话人校验。
Gemini 声音克隆的中文授权语是什么? 简体中文版原文是:「我是此声音的拥有者并授权谷歌使用此声音创建语音合成模型」。英文版是「I am the owner of this voice and I consent to Google using this voice to create a synthetic voice model.」Google 一共提供 30 种语言的授权语。
哪些地区不能用 Gemini 声音克隆? Google 的发布公告写明,AI Studio 里的声音复刻在美国伊利诺伊州、得克萨斯州,以及欧洲经济区、英国、瑞士和印度不可用。截至 2026 年 10 月 8 日,Gemini API 文档里没有列出地区限制。
能用 Gemini 克隆别人或明星的声音吗? 不能,除非本人参与:授权录音必须和参考样本是同一个人,并且逐字念出 Google 的授权语。只拿到明星或他人的音频片段,是通不过校验的。
Gemini 克隆的声音能保存多久? 保存模式(store: true)会得到 voice_… 形式的 ID,保留一年;每个项目最多保存 200 个音色(设计和克隆合计)。不保存模式(store: false)返回一个 voicekey_…,由你自己保管,有效期 7 天。
Gemini 声音克隆收费吗? Google 没有单独公布创建音色的价格。用克隆音色生成的语音按 Gemini 3.8 TTS 输出计费:Flash TTS 在 2026 年内每百万音频 token 9 美元(2027 年 1 月 1 日起 18 美元),开发者有免费档。
选 Gemini 声音克隆还是 ElevenLabs 声音克隆? Gemini 只要 10–30 秒样本,但必须本人念授权语,音色存在你的 Google 项目里。ElevenLabs 即时克隆用短样本即可,大多数套餐都能用;专业克隆要更长的训练音频,用语音验证码核实说话人,需要 Creator 及以上套餐。
声匠和 Google 是什么关系? 没有隶属关系。声匠是基于 ElevenLabs API 的独立配音工作台,同时提供 Google Gemini TTS 的免费试用。Gemini 是 Google LLC 的商标。