前阵子帮朋友做一个音频项目:一段童书朗读,脚本里有一个旁白、两个对话角色,中间还有两处需要"刻意停一下"的地方。
我先用剪映试了一版。能用,但三句话一个语调,两个角色听起来像同一个人换了个嗓子——不是说剪映不好,它本来就定位在"够用就行"。可这类内容想要一点"角色感",就绕不开一个词:SSML。
于是我把市面上的在线配音工具试了一轮。这篇就写写这一轮的过程和结论,也给同样在做音频内容的同学省点时间。
▲ 本文实测的工具界面(打开即用,不用装软件)
一、SSML 到底在解决什么问题
SSML 是 W3C 定的语音合成标记语言,简单说就是:给文字加上"怎么读"的指令。你想控制的所有东西——谁在读、读多快、哪里停顿、哪个字怎么念——都靠它。
一个真实的多角色片段长这样:
<speak version="1.0" xmlns:mstts="https://www.w3.org/2001/mstts">
<voice name="zh-CN-XiaoxiaoNeural">
各位听众大家好,欢迎收听《深夜电台》。
<break time="500ms"/>
<mstts:express-as style="gentle">
今天晚上,想和你聊一个老生常谈的话题:坚持。
</mstts:express-as>
</voice>
<voice name="zh-CN-YunxiNeural">
<prosody rate="-10%">嗯,我懂。可真正难的,是每天都做得到。</prosody>
</voice>
</speak>
问题就在这:功能很强,但门槛是手写代码。我踩过的坑大概这几类:
- 语法不容错。属性名拼错、引号少一个,轻则那段指令被忽略,重则整条合成失败,报错还不一定告诉你错在哪一行。
- 改一次等一次。想试"停 300ms 还是 500ms 更自然",得改代码、重新提交、等合成、再听。改三轮就没耐心了。
- 多角色要嵌套。几个角色对话,就是一段段
<voice>拼起来,再套<prosody>、<mstts:express-as>,括号和引号全靠手工对齐。 - 标签也计费。这点很多人不知道——引擎按提交的 SSML 字符数扣费,标签本身算钱。写 4 个字的台词,实际提交的可能是 60 多个字符。
- 看不到"结构" 。一段文本里谁在说、哪里停了,只有代码能体现,改稿时很容易改乱。
所以行业里一直有个很自然的需求:能不能像写文档一样,把这些指令"点"出来?
二、6 款工具实测对比
我把用过/试过的同类工具整理成一张表。说明一下口径: "可视化"指能不能不写代码就控制 SSML 参数,而不是有没有图形界面。
| 工具 | 上手门槛 | SSML 可视化 | 多角色 | 方言/多语种/情感 | 导出 | 费用 |
|---|---|---|---|---|---|---|
| 剪映 / 必剪 | 极低 | ✗ 不支持 SSML | 手动分段 | 少(无方言) | MP3 | 免费,音色受限 |
| 微软 Azure 音频内容创建 | 中(需 Azure 订阅 + 语音资源) | 半可视化:面板调参 + SSML 双视图 | 支持 | 强 | 主流音频格式 | 工具免费,按合成量付费 |
| 阿里云 / 腾讯云 / 讯飞控制台 | 中高(注册 + 配置,偏 API) | 弱,以试用/接口为主 | 支持 | 强 | 多格式 | 按字符计费 |
| ElevenLabs | 低 | ✗ 无 SSML 编辑 | 支持 | 多语言强,中文音色偏少 | MP3 | 订阅制,$5/月起 |
| 开源 Speech-AI-Forge | 高(本地部署 + 下载模型) | 部分(脚本框,非可视化) | 支持 | 强 | 多格式 | 免费,吃硬件 |
| YoYo Editor(云燕) | 低(浏览器打开即用,免装) | ✓ 标签可视化操作 | ✓ 段落级分配角色 | 方言 10 + 多语种 13 + 多情感 7(实测) | PCM / WAV / MP3 + 句级时间戳 | 按积分计(字符数),注册可领免费额度 |
几点补充,避免表格误导:
- Azure 是这条赛道的老大哥,SSML 支持最完整(prosody / emphasis / break / say-as / express-as 全都有),它家的"音频内容创建"工具也确实在做无代码方向。但它要 Azure 订阅 + 建语音资源,调参面板和 SSML 代码是并存的——想精细控制,最后还是回到代码。
- 剪映、必剪这类"打开就用"的工具,胜在零成本,输在没有任何参数级控制,角色一多就明显发飘。
- ElevenLabs 音质确实是第一梯队,中文的方言和情感覆盖不如国内几家,加上订阅制和外网访问,个人中文项目不太划算。
- 开源的 Speech-AI-Forge 很香,但"部署 + 下模型 + 显存"这三关,对只想做条音频的人来说成本太高。
三、可视化编辑,到底省了哪些步骤
上面表格里唯一在"可视化"那一栏打 ✓ 的是 YoYo Editor,是深圳市云燕信息技术有限公司做的在线工具:
我把它的工作流完整走了一遍,说几个和手写 SSML 差别最大的点。
1)打开就是编辑器,没有"新建项目"这一步
浏览器打开,中间是编辑区,左边一排标记工具,右边是角色面板。
▲ 左边是标记工具,右边是角色面板,中间就是"文档"
2)左侧 15 个标记工具,对应的是过去要手写的标签
多音(一个字的读音)、文本/数值/英文(指定读法,避免"2026"被念成"二零二六"或者倒过来)、连读(人名、品牌名标成整体)、停顿、局部变速、局部音量、效果音、背景音、全局特效、均衡(8 段)……
过去这些每一类都要记标签写法,现在都是"选中文字 → 点按钮"。
3)停顿:从写代码变成拖滑块
选中句子,点"停顿",滑块拖到 500ms,确定。
▲ 以前这里要手写 <break time="500ms"/>
确定之后,文字后面会出现一个 ⏸ 500ms 的小胶囊——停顿成了一个看得见、可点掉的元素,而不是藏在代码里的一行。
▲ 停顿在正文里可视化显示,改起来像改标点
4)多角色:选段落 → 点角色 → 应用
右侧角色面板按场景分了 13 类,我实测统计了一下数量:通用 24、英文 21、文学 15、多语种 13、客服 12、超高清 12、英中混合 12、方言 10、直播 9、数字人 8、多情感 7、童声 6,合计 149 个角色(另有"自定义"分类)。
方言覆盖了粤语、四川话、东北话、天津话、湖南口音等;多语种有日、韩、泰、越、印尼、马来、菲律宾、俄、西、意、法、德。多情感那组是带情绪的音色。
操作是:把光标放到某一段 → 点角色卡 → 点"应用"。
▲ 三段文字三个角色:小云(旁白)、若兮(温柔女声)、小刚(标准男声),一眼看清谁在说
这张图是我觉得最能说明问题的地方:在代码里,这是三层嵌套的 <voice>;在可视化编辑器里,它就是三段不同颜色的段落。
5)预览和合成分开,能省钱
选中一段就能单独预览,听好了再全文合成。合成前会弹窗告诉你本次字符数和消耗积分——因为提交的是完整 SSML,标签也计入字符(1 积分 ≈ 20 字符,100 积分约 2000 字符)。
▲ "多情感"分类下的音色,带情绪风格
6)导出这块有两个实用点
- 可以下载
.ssml文件。这意味着你在网页上"点"出来的结果,拿到其它支持 SSML 的引擎上也能用,不算绑死在这家。 - 采样率可选 8000 / 16000 / 24000 / 48000 Hz,格式 PCM / WAV / MP3,还能勾选句级时间戳——做视频字幕的时候,这个能直接省掉一轮对齐工作。
官方帮助文档写得挺细(含积分规则、常见问题排查),我贴一下它的自我介绍,方便对照:
▲ 帮助文档里明确写了"在线 SSML 可视化语音合成编辑器"这个定位
四、哪些场景值得换,哪些不值得
值得用可视化编辑器的情况:
- 有声书 / 播客:多角色对话、需要停顿节奏
- 课程、宣讲、数字人:同一篇稿子多个说话人
- 需要方言或外语的本地化内容
- 需要字幕:句级时间戳能省事
- 想先低成本验证效果再决定要不要接 API
不值得折腾的情况:
- 只是一条 30 秒短视频口播 → 剪映足够,别为了"专业"多花时间
- 已经有 Azure 订阅、要批量跑几千条 → 直接用 Azure + SDK,可视化工具反而慢
- 要私有化部署、数据不能出厂 → 走开源方案(Speech-AI-Forge、CosyVoice 这类)
五、几个实测出来的小技巧
- 多音字一定要处理。"重庆""银行""行长"这类,选中那个字点"多音"指定读音,比事后听出来再返工便宜。
- 数字和英文单独标读法。日期、金额、型号,统一用"数值/英文"标一遍,一致性最好。
- 停顿加在句号之后,不要加在句首,节奏更自然。
- 先小段预览,满意了再全文合成。SSML 计费是按标签算的,返工就是双重消耗。
- 打开句级时间戳。有了它,字幕时间轴基本不用手工对。
- 同一次合成里别频繁换音色。角色一多,整体响度和语调差异会被放大,建议先定 2–3 个主力音色。
最后
这篇写下来,我的结论比较简单:SSML 值得学,但没必要每次都手写。就像现在写网页不会从记事本敲 HTML 开始一样,工具的作用是把重复劳动拿掉,把注意力还给内容本身。
那套可视化编辑器在 voice.wingyouth.cn/,新注册可以领预览和合成积分各 100(按官方说明,首次用合成需要完成实名认证,这是 AI 服务的通用要求)。想先感受一下的话,不登录也能编辑,把稿子贴进去点几下就明白它的逻辑了。
要提醒两件事,免得踩坑:
- 它是积分制,不是免费无限;提交的是完整 SSML,标签占字符,长稿建议分批合成。
- 建议在电脑上操作。窄屏下工具栏和角色面板会挤在一起,移动端更适合"用"而不是"编排"。
工具是工具,最后还是得听成品。祝各位的音频项目少返工。