文字转语音 - 在线 TTS,自带字幕时间轴

在线文字转语音(TTS):70+ 语言母语级发音、旗舰模型情绪标签控制、字符级时间轴直接导出 SRT 字幕。粘贴文本一分钟出成品。

最近更新: 2026-08-23

文字转语音,但不止是"能读出来"

多数 TTS 工具解决的是"把字读出来";内容创作者真正需要的是能直接发布的成品。声匠 VoiceSmiths 的文字转语音在三个地方不一样:

1. 字级时间轴,字幕帧准

每次生成同时返回每个字符的起止时间,精确到毫秒。SRT 字幕不是靠语速估算切出来的,而是和音频严格对齐——短视频加字幕、播客加章节、课程加逐句高亮,一次生成全解决。

2. 情绪可以"导演"

旗舰模型支持在文稿里直接写情绪指令:

[whispers] 我不该来这里的。
[excited] 但是你看这个数据——涨了三倍!

[whispers][excited][sighs][laughs] 等标签只影响演绎,不会被读出来,也不会漏进字幕。

3. 70+ 语言母语级发音

同一份工作台生成中文、英语、西班牙语、日语、葡萄牙语等 70+ 种语言。注意:TTS 不做翻译——请提供目标语言的文稿;需要翻译+配音一条龙的场景请用视频翻译配音

模型怎么选

| 模型 | 特点 | 适合 | | --- | --- | --- | | 旗舰模型 | 表现力最强,支持情绪标签 | 剧情、广告、有声书 | | 多语言标准 | 稳定均衡 | 口播、讲解、课程 | | 极速模型 | 延迟最低、单价减半 | 大批量、长文本 |

语音工作台的下拉框里随时切换,按钮上直接显示积分价格,失败自动返还。

typical 工作流

  1. 写好(或翻译好)目标语言文稿
  2. 选音色——不满意可以克隆自己的声音或用文字描述设计一个
  3. 生成 → 试听 → 下载 MP3 + SRT

常见问题

一次能生成多长? 单次最长 5,000–40,000 字符(取决于模型),长文分段生成即可。

支持 SSML 吗? 旗舰模型用情绪标签和标点控制节奏:省略号加停顿,大写加重音。

价格怎么算? 按次扣积分,价格明示在按钮上。查看定价了解套餐。

免费生成第一条 →