手写 SSML 太折磨人,我试了 6 款在线配音工具:可视化编辑到底能省多少事

0 阅读9分钟

前阵子帮朋友做一个音频项目:一段童书朗读,脚本里有一个旁白、两个对话角色,中间还有两处需要"刻意停一下"的地方。

我先用剪映试了一版。能用,但三句话一个语调,两个角色听起来像同一个人换了个嗓子——不是说剪映不好,它本来就定位在"够用就行"。可这类内容想要一点"角色感",就绕不开一个词:SSML。

于是我把市面上的在线配音工具试了一轮。这篇就写写这一轮的过程和结论,也给同样在做音频内容的同学省点时间。 image.png ▲ 本文实测的工具界面(打开即用,不用装软件)

一、SSML 到底在解决什么问题

SSML 是 W3C 定的语音合成标记语言,简单说就是:给文字加上"怎么读"的指令。你想控制的所有东西——谁在读、读多快、哪里停顿、哪个字怎么念——都靠它。

一个真实的多角色片段长这样:

<speak version="1.0" xmlns:mstts="https://www.w3.org/2001/mstts">
  <voice name="zh-CN-XiaoxiaoNeural">
    各位听众大家好,欢迎收听《深夜电台》。
    <break time="500ms"/>
    <mstts:express-as style="gentle">
      今天晚上,想和你聊一个老生常谈的话题:坚持。
    </mstts:express-as>
  </voice>
  <voice name="zh-CN-YunxiNeural">
    <prosody rate="-10%">嗯,我懂。可真正难的,是每天都做得到。</prosody>
  </voice>
</speak>

问题就在这:功能很强,但门槛是手写代码。我踩过的坑大概这几类:

  1. 语法不容错。属性名拼错、引号少一个,轻则那段指令被忽略,重则整条合成失败,报错还不一定告诉你错在哪一行。
  2. 改一次等一次。想试"停 300ms 还是 500ms 更自然",得改代码、重新提交、等合成、再听。改三轮就没耐心了。
  3. 多角色要嵌套。几个角色对话,就是一段段 <voice> 拼起来,再套 <prosody>、<mstts:express-as>,括号和引号全靠手工对齐。
  4. 标签也计费。这点很多人不知道——引擎按提交的 SSML 字符数扣费,标签本身算钱。写 4 个字的台词,实际提交的可能是 60 多个字符。
  5. 看不到"结构" 。一段文本里谁在说、哪里停了,只有代码能体现,改稿时很容易改乱。

所以行业里一直有个很自然的需求:能不能像写文档一样,把这些指令"点"出来?

二、6 款工具实测对比

我把用过/试过的同类工具整理成一张表。说明一下口径: "可视化"指能不能不写代码就控制 SSML 参数,而不是有没有图形界面。

工具上手门槛SSML 可视化多角色方言/多语种/情感导出费用
剪映 / 必剪极低✗ 不支持 SSML手动分段少(无方言)MP3免费,音色受限
微软 Azure 音频内容创建中(需 Azure 订阅 + 语音资源)半可视化:面板调参 + SSML 双视图支持强主流音频格式工具免费,按合成量付费
阿里云 / 腾讯云 / 讯飞控制台中高(注册 + 配置,偏 API)弱,以试用/接口为主支持强多格式按字符计费
ElevenLabs低✗ 无 SSML 编辑支持多语言强,中文音色偏少MP3订阅制,$5/月起
开源 Speech-AI-Forge高(本地部署 + 下载模型)部分(脚本框,非可视化)支持强多格式免费,吃硬件
YoYo Editor(云燕)低(浏览器打开即用,免装)✓ 标签可视化操作✓ 段落级分配角色方言 10 + 多语种 13 + 多情感 7(实测)PCM / WAV / MP3 + 句级时间戳按积分计(字符数),注册可领免费额度

几点补充,避免表格误导:

  • Azure 是这条赛道的老大哥,SSML 支持最完整(prosody / emphasis / break / say-as / express-as 全都有),它家的"音频内容创建"工具也确实在做无代码方向。但它要 Azure 订阅 + 建语音资源,调参面板和 SSML 代码是并存的——想精细控制,最后还是回到代码。
  • 剪映、必剪这类"打开就用"的工具,胜在零成本,输在没有任何参数级控制,角色一多就明显发飘。
  • ElevenLabs 音质确实是第一梯队,中文的方言和情感覆盖不如国内几家,加上订阅制和外网访问,个人中文项目不太划算。
  • 开源的 Speech-AI-Forge 很香,但"部署 + 下模型 + 显存"这三关,对只想做条音频的人来说成本太高。

三、可视化编辑,到底省了哪些步骤

上面表格里唯一在"可视化"那一栏打 ✓ 的是 YoYo Editor,是深圳市云燕信息技术有限公司做的在线工具:

voice.wingyouth.cn/

我把它的工作流完整走了一遍,说几个和手写 SSML 差别最大的点。

1)打开就是编辑器,没有"新建项目"这一步

浏览器打开,中间是编辑区,左边一排标记工具,右边是角色面板。

▲ 左边是标记工具,右边是角色面板,中间就是"文档"

2)左侧 15 个标记工具,对应的是过去要手写的标签

多音(一个字的读音)、文本/数值/英文(指定读法,避免"2026"被念成"二零二六"或者倒过来)、连读(人名、品牌名标成整体)、停顿、局部变速、局部音量、效果音、背景音、全局特效、均衡(8 段)……

过去这些每一类都要记标签写法,现在都是"选中文字 → 点按钮"。

3)停顿:从写代码变成拖滑块

选中句子,点"停顿",滑块拖到 500ms,确定。

image.png

▲ 以前这里要手写 <break time="500ms"/>

确定之后,文字后面会出现一个 ⏸ 500ms 的小胶囊——停顿成了一个看得见、可点掉的元素,而不是藏在代码里的一行。 image.png

▲ 停顿在正文里可视化显示,改起来像改标点

4)多角色:选段落 → 点角色 → 应用

右侧角色面板按场景分了 13 类,我实测统计了一下数量:通用 24、英文 21、文学 15、多语种 13、客服 12、超高清 12、英中混合 12、方言 10、直播 9、数字人 8、多情感 7、童声 6,合计 149 个角色(另有"自定义"分类)。

方言覆盖了粤语、四川话、东北话、天津话、湖南口音等;多语种有日、韩、泰、越、印尼、马来、菲律宾、俄、西、意、法、德。多情感那组是带情绪的音色。

操作是:把光标放到某一段 → 点角色卡 → 点"应用"。

image.png

▲ 三段文字三个角色:小云(旁白)、若兮(温柔女声)、小刚(标准男声),一眼看清谁在说

这张图是我觉得最能说明问题的地方:在代码里,这是三层嵌套的 <voice>;在可视化编辑器里,它就是三段不同颜色的段落。

5)预览和合成分开,能省钱

选中一段就能单独预览,听好了再全文合成。合成前会弹窗告诉你本次字符数和消耗积分——因为提交的是完整 SSML,标签也计入字符(1 积分 ≈ 20 字符,100 积分约 2000 字符)。 image.png

▲ "多情感"分类下的音色,带情绪风格

6)导出这块有两个实用点

  • 可以下载 .ssml 文件。这意味着你在网页上"点"出来的结果,拿到其它支持 SSML 的引擎上也能用,不算绑死在这家。
  • 采样率可选 8000 / 16000 / 24000 / 48000 Hz,格式 PCM / WAV / MP3,还能勾选句级时间戳——做视频字幕的时候,这个能直接省掉一轮对齐工作。

官方帮助文档写得挺细(含积分规则、常见问题排查),我贴一下它的自我介绍,方便对照:

帮助文档

▲ 帮助文档里明确写了"在线 SSML 可视化语音合成编辑器"这个定位

四、哪些场景值得换,哪些不值得

值得用可视化编辑器的情况:

  • 有声书 / 播客:多角色对话、需要停顿节奏
  • 课程、宣讲、数字人:同一篇稿子多个说话人
  • 需要方言或外语的本地化内容
  • 需要字幕:句级时间戳能省事
  • 想先低成本验证效果再决定要不要接 API

不值得折腾的情况:

  • 只是一条 30 秒短视频口播 → 剪映足够,别为了"专业"多花时间
  • 已经有 Azure 订阅、要批量跑几千条 → 直接用 Azure + SDK,可视化工具反而慢
  • 要私有化部署、数据不能出厂 → 走开源方案(Speech-AI-Forge、CosyVoice 这类)

五、几个实测出来的小技巧

  1. 多音字一定要处理。"重庆""银行""行长"这类,选中那个字点"多音"指定读音,比事后听出来再返工便宜。
  2. 数字和英文单独标读法。日期、金额、型号,统一用"数值/英文"标一遍,一致性最好。
  3. 停顿加在句号之后,不要加在句首,节奏更自然。
  4. 先小段预览,满意了再全文合成。SSML 计费是按标签算的,返工就是双重消耗。
  5. 打开句级时间戳。有了它,字幕时间轴基本不用手工对。
  6. 同一次合成里别频繁换音色。角色一多,整体响度和语调差异会被放大,建议先定 2–3 个主力音色。

最后

这篇写下来,我的结论比较简单:SSML 值得学,但没必要每次都手写。就像现在写网页不会从记事本敲 HTML 开始一样,工具的作用是把重复劳动拿掉,把注意力还给内容本身。

那套可视化编辑器在 voice.wingyouth.cn/,新注册可以领预览和合成积分各 100(按官方说明,首次用合成需要完成实名认证,这是 AI 服务的通用要求)。想先感受一下的话,不登录也能编辑,把稿子贴进去点几下就明白它的逻辑了。

要提醒两件事,免得踩坑:

  1. 它是积分制,不是免费无限;提交的是完整 SSML,标签占字符,长稿建议分批合成。
  2. 建议在电脑上操作。窄屏下工具栏和角色面板会挤在一起,移动端更适合"用"而不是"编排"。

工具是工具,最后还是得听成品。祝各位的音频项目少返工。