如果你最近关注开源语音合成领域,大概率已经刷到过VoxCPM2这个名字。它是由OpenBMB团队(也就是MiniCPM系列大模型背后的团队)在2026年推出的新一代文本转语音系统,短短时间内在GitHub上就拿下了三万多颗星,热度惊人 。但真正让业内人士兴奋的,不是它又多支持了几种语言,而是它彻底抛弃了当下几乎所有主流TTS系统都依赖的核心组件——离散音频token化器。这句话听起来有点技术化,别急,往下看就明白它意味着什么。
传统TTS的天花板,卡在哪儿
要理解VoxCPM2的突破,得先弄明白现在大多数语音模型是怎么工作的。近几年主流做法基本抄的是大语言模型那套路子,先把连续的音频波形切碎、量化成一串串离散的token(类似文字里的一个个词),再让一个自回归模型像写句子一样去预测下一个音频token。这套思路好处很明显,可以直接套用LLM那些成熟的扩展规律和上下文学习能力 。
但问题也出在这儿。量化这个动作,说白了就是把连续、丰富的声音信号硬塞进有限的几千个离散符号里,必然会丢掉大量细节。为了补救,很多高质量系统不得不搭两阶段甚至多阶段的流水线,先用自回归模型规划粗略的语义token,再用一个独立的扩散或流匹配模型去补全声学细节。这种拆分设计虽然效果还行,但语义规划和声学渲染被人为割裂开,没法端到端联合优化,性能上限也被中间那个token化器死死限制住 。
有位长期做TTS测评和音频书制作的博主曾这样描述这种瓶颈——声音听起来不错,但总差口气,细微的重音会丢失,节奏莫名有点僵,那种让配音听起来"活"起来的音乐性总是抓不住。他试遍市面上能找到的模型,包括很新的Higgs-Audio-v3,折腾了好几天调参数,最后才发现问题根本不在参数,而在整个架构本身 。
VoxCPM2的解法:不切碎,直接建模连续表征
VoxCPM2走的是一条不太一样的路,它是tokenizer-free的,也就是完全不做那个离散量化步骤,而是端到端地直接生成连续的语音表征,架构上称为分层扩散自回归模型(hierarchical diffusion-autoregressive) 。
这套架构可以拆成三块核心组件来理解。
MiniCPM-4骨干网络负责语义规划
VoxCPM2构建在MiniCPM-4这个语言模型骨干之上,它负责理解文本内容、推断该用什么语气语调、以及维持长上下文里的连贯性。你可以把它想象成一位经验丰富的导演,先通读剧本,决定整体的情绪基调和节奏走向 。
LocDiT局部扩散Transformer负责声学渲染
真正生成声音细节的是一个叫LocDiT(Local Diffusion Transformer,局部扩散变换器)的模块。它在每一个音频小片段(patch)内部运行扩散过程,通过flow-matching的方式逐步去噪,把连续的语音潜在表征雕琢出来 。和以往那种把所有条件信息一股脑早期融合的做法不同,VoxCPM2给LocDiT喂入的是分层、解耦的条件信号,这样声学细节生成的精度会更高 。
AudioVAE V2负责音频的压缩与超分辨率重建
第三块是非对称设计的AudioVAE V2。它在编码端接收16kHz的输入音频,压缩成64维的潜在向量,帧率只有25Hz,相当于把原始信息压缩了640倍;而在解码端,它却能直接重建出48kHz的录音室级音质,内置了隐式超分辨率能力,完全不需要额外接一个上采样器 。
整个生成流程可以简单画成这样
对比一下传统路线的差异,会更直观
这种统一的序列组织方式还带来一个额外好处,所有的生成模式,无论是普通合成、声音设计还是声音克隆,都能用同一套输入构件不同排列组合来表达,整个模型可以用一套参数和一个训练目标联合训练,不需要为不同任务单独开分支 。
功能亮点:不只是能说话,还能"演"
VoxCPM2在能力覆盖上做得相当全面,这也是它区别于很多学术Demo模型的地方,它是真的可以拿来用的产品级系统 。
多语言零标签合成支持30种语言,输入文字直接合成,不需要手动标注语言类型,模型自己判断 。
声音设计(Voice Design) 这个功能挺有意思,你完全不需要提供参考音频,只要用自然语言描述想要的声音,比如"一个中年男性、略带沙哑、语速偏慢、带点忧郁感",模型就能凭空生成一个从未存在过的声音 。
可控克隆(Controllable Cloning) 是拿一段简短的参考音频克隆音色,同时还可以额外加风格引导,去调节情绪、语速和表现力,音色本身保持不变 。
终极克隆(Ultimate Cloning) 则更进一步,同时提供参考音频和对应文本,模型会从参考片段无缝续接下去,把音色、节奏、情绪、风格这些细枝末节全部精准复刻 。
48kHz高质量输出前面已经提过,靠AudioVAE V2的非对称设计,输入16kHz参考音频也能吐出48kHz的成片质感 。
实时流式生成在NVIDIA RTX 4090上RTF(实时因子)能做到约0.3,如果借助Nano-vLLM或者vLLM-Omni这类推理加速框架,还能压到0.13左右,基本满足实时交互场景的需求 。
性能数据说话
模型规模上,VoxCPM2是一个2B参数量级的模型,训练数据超过200万小时的多语种语音,覆盖30种语言外加9种中文方言 。这个训练数据量放在语音合成领域已经是相当激进的规模了。
在OpenBMB团队自建的30语言内部评测集上,VoxCPM2的平均词错误率(WER)做到了1.68%,在公开的zero-shot和指令跟随类TTS基准测试上,也拿到了达到或接近业界最优的成绩 。这些数字背后传递的信息其实很朴素,不依赖外部离散语音token化器的分层连续潜在建模路线,是完全可行、而且效果能打的技术方向 。
模型权重、微调代码和推理工具全部以Apache 2.0协议开源,这在动辄闭源商用的语音大模型赛道里算是相当有诚意的姿态 。
几点冷静的补充
需要说明的是,模型卡里的示例代码默认输出采样率是16kHz(sf.write 那段示例用的就是16kHz),实际使用中48kHz输出通常需要走对应的高质量解码配置,具体细节建议直接参考官方文档和代码仓库的最新说明,避免踩坑 。
另外VoxCPM2依赖的是MiniCPM-4这个相对较新的骨干网络,生态和工具链的成熟度目前还在快速追赶阶段,社区已经有像ComfyUI插件这样的第三方集成出现,说明生态正在往好的方向发展 。
写在最后
VoxCPM2最打动人的地方,不是参数量堆得有多大,也不是支持语言列表有多长,而是它证明了一件事,语音生成这件事,未必非要走"先量化成token、再当文字一样预测"这条路。直接对连续声学空间建模,绕开量化损失,反而可能是通向更自然、更有生命力的语音合成的正解 。
对于想做有声书、虚拟主播、多语言配音甚至个性化语音助手的开发者来说,这套完全开源、能跑在消费级显卡上的方案,值得认真研究一下。
参考资料
OpenBMB. VoxCPM GitHub Repository. github.com/OpenBMB/Vox…
OpenBMB. VoxCPM2 Model Card. Hugging Face. huggingface.co/openbmb/Vox…
Andrew Zhu. VoxCPM2: The TTS Model That Ditched Tokens and Changed Everything. Medium, 2026年6月18日. xhinker.medium.com/voxcpm2-the…
VoxCPM Team. VoxCPM2 Technical Report. arXiv:2606.06928, 2026年6月. arxiv.org/html/2606.0…
VoxCPM 2.0 Documentation — Architecture. voxcpm.readthedocs.io/en/latest/m…