文字转语音 - 在线 TTS,自带字幕时间轴
在线文字转语音,可用 Eleven v4:90+ 语言、情绪标签、字级时间轴 SRT 字幕。免注册每天免费试 2 次,¥29.9 起、无需订阅,支持支付宝。
最近更新: 2026-10-08
声匠 VoiceSmiths 是一个在线文字转语音工作台,用的是 ElevenLabs 最新的模型(包括 Eleven v4)。 粘贴文稿,选 54 个精选音色或 5,000 多个社区音色之一,就能下载 MP3 和按字对齐的 SRT 字幕。下面可以免注册免费试;正式使用 ¥29.9 起(一次性,无需订阅),支持支付宝。
免费试用 Eleven v4,无需注册
每天免费 2 次,每次最多 200 字。方括号里的标签会被演出来,不会被念出来。
一表看懂
| 声匠文字转语音 | |
|---|---|
| 模型 | Eleven v4、Eleven v3、Multilingual v2、Flash v2.5(ElevenLabs 官方 API) |
| 语言 | Eleven v4 支持 90+,v3 支持 70+ |
| 音色 | 54 个精选(24 个原创角色音 + 30 个精挑),5,000+ 社区音色,可克隆、可用文字设计 |
| 长度 | 单次 5,000 字;长文模式一次 50,000 字 |
| 输出 | MP3,附字级时间轴和 SRT 字幕 |
| 情绪控制 | 行内标签,如 [whispers]、[excited]、[laughs],不会被念出来 |
| 免费 | 免注册每天 2 次,每次 200 字 |
| 价格 | 每 100 字 7 积分(Flash 4 积分);中文按月付套餐折算约 ¥1.0–1.4 / 分钟 |
| 套餐 | ¥29.9 体验包 150 积分(永不过期),或月付 ¥49 起 600 积分 |
| 付款 | 支付宝,或银行卡(Visa / Mastercard) |
| 商用 | 可以,以服务条款为准 |
价格截至 2026 年 10 月,实际价格以生成按钮上显示的为准。
文字转语音,但不止是"能读出来"
多数 TTS 工具解决的是"把字读出来";内容创作者真正需要的是能直接发布的成品。声匠 VoiceSmiths 的文字转语音在三个地方不一样:
1. 字级时间轴,字幕帧准
每次生成同时返回每个字符的起止时间,精确到毫秒。SRT 字幕不是靠语速估算切出来的,而是和音频严格对齐——短视频加字幕、播客加章节、课程加逐句高亮,一次生成全解决。
2. 情绪可以"导演"
Eleven v4 和 v3 支持在文稿里直接写情绪指令:
[whispers] 我不该来这里的。
[excited] 但是你看这个数据——涨了三倍!
[whispers]、[excited]、[sighs]、[laughs] 等标签只影响演绎,不会被读出来,也不会漏进字幕。完整列表见情绪标签速查表。
同一段文案,平静版与情绪标签版的实际差别:
无标签 · 知性御姐:
[excited] · 带货女主播:
[excited] 最后三十秒!库存只剩最后两百件,拍下立减一百,手慢无!新闻播报腔 · 播音腔大叔:
英文新闻播报,同一套工作流:
3. 90+ 语言母语级发音
同一个工作台生成中文、英语、西班牙语、日语、葡萄牙语等几十种语言。注意:TTS 不做翻译——请提供目标语言的文稿;需要翻译+配音一条龙的场景请用视频翻译配音。
模型怎么选
| 模型 | 工作台里的名字 | 语言 | 特点 | 适合 |
|---|---|---|---|---|
| Eleven v4 | Eleven v4 | 90+ | 最新、表现力最强,支持情绪标签 | 剧情、广告、有声书 |
| Eleven v3 | Resona Ultra | 70+ | 表现力强,支持情绪标签 | 角色演绎 |
| Multilingual v2 | Resona Multi | 29 | 稳定均衡 | 口播、讲解、课程 |
| Flash v2.5 | Resona Flash | 32 | 延迟最低,单价约减半 | 大批量、长文本 |
在语音工作台的下拉框里随时切换,按钮上直接显示积分价格,失败自动返还。拿不准选哪个,可以看 v4 和 v3 用同一批脚本的对比实测;想对比不同引擎,Google 的 Gemini 3.8 TTS 也可以免费试听。
典型工作流
- 写好(或翻译好)目标语言文稿
- 选音色——不满意可以克隆自己的声音或用文字描述设计一个
- 生成 → 试听 → 下载 MP3 + SRT
常见问题
声匠的文字转语音免费吗? 可以免费试:不用注册,每天 2 次,每次最多 200 字,在本页或首页都能用;站内所有音色样音也都能免费听。超出后按积分计费,没有每月免费额度。
文字转语音怎么收费? 标准模型(Eleven v4、v3、Multilingual v2)每 100 字 7 积分,极速模型 Flash 每 100 字 4 积分。1,000 个汉字约 4 分钟音频,扣 70 积分,按月付套餐折算约 ¥4.0–5.7;用 ¥29.9 体验包约 ¥14。生成失败自动退还积分。详见定价。
能用哪些 TTS 模型? Eleven v4(2026 年 9 月 28 日发布)、Eleven v3、Multilingual v2 和 Flash v2.5,都通过 ElevenLabs 官方 API 调用。工作台里 v3、Multilingual v2、Flash 分别显示为 Resona Ultra、Resona Multi、Resona Flash。
支持多少种语言? Eleven v4 支持 90 多种,v3 支持 70 多种,Flash v2.5 支持 32 种,Multilingual v2 支持 29 种。文字转语音不做翻译,想听哪种语言就写哪种语言的文稿。
一次能生成多长? 文字转语音单次最多 5,000 字;长文模式一次最多 50,000 字,全程同一个音色、同一条连续字幕。
能出字幕吗? 能。每次生成都返回每个字的起止时间,导出的 SRT 字幕和音频严格对齐,不是按语速估算的。
支持 SSML 吗? Eleven v4 和 v3 用情绪标签和标点控制节奏:省略号加停顿,大写加重音。品牌名、多音字用发音词典固定读法。
生成的音频可以商用吗? 可以。你生成的音频归你所有,可用于广告、短视频、播客、App 等商业用途,具体以服务条款为准;克隆真人声音需要本人授权。
声匠和 ElevenLabs 是什么关系? 声匠是独立的配音工作台,没有隶属关系。我们通过 ElevenLabs 官方 API 调用模型,自己做音色、工作流和定价,支持支付宝和人民币付款。