1. 引言
在数字人交互场景中,语音是最自然、最高效的输入输出方式。ZorvAI 数字人控制台内置了一套完整的语音服务体系,让用户用说话代替打字、AI 用语音代替文本,配合 3D 虚拟形象形成「听—想—说—演」的闭环。
这套语音服务脱胎于 OpenClaw AI Engine 的 LatticeASR / LatticeTTS 轻量自研模型(合计约 14.7M 参数),可端侧离线运行,也可接入在线服务增强。本文将从架构分层、核心组件、关键流程三个维度,带你完整拆解 ZorvAI 语音服务的设计思路。
2. 设计理念
语音服务以「常驻守护 + 按需唤醒」方式存在:后台语音服务持续做唤醒词检测,命中后拉起完整识别—推理—合成链路;结果既驱动对话,也驱动数字人口型与动作。
核心设计原则有四条:
- 离线优先:ASR / TTS 模型本地推理,弱网 / 无网可用;在线服务作为高保真补充。
- 流式流水线:采集、VAD、识别、合成均支持流式,降低端到端延迟。
- 数字人联动:合成音频的韵律(prosody)信号同步驱动 3D 形象口型与表情。
- 与终端 / 技能 / MCP 打通:语音指令可触发 terminal_exec、调用技能、驱动 MCP 连接器。
3. 技术架构(分层)
语音服务整体采用七层架构设计,从底层的守护进程到顶层的 3D 呈现,各层职责清晰、逐层联动:
| 层级 | 名称 | 核心组件 |
|---|---|---|
| L6 | 呈现层 | 3D 虚拟形象(角色卡)、口型 / 表情同步、对话 UI 播报 |
| L5 | 联动层 | 语音指令 → terminal_exec、语音 → 技能 / MCP 触发、QuroAssistant 对话编排 |
| L4 | 合成层 | LatticeTTS(7.5M)、音色管理 / 韵律控制、流式 TTS |
| L3 | 理解层 | NLU / 意图识别、LLM 应答生成、上下文记忆 |
| L2 | 识别层 | LatticeASR(7.2M)、VAD 端点检测、流式 ASR |
| L1 | 前端层 | AudioRecord 采集、降噪 / AGC、唤醒词检测、AudioTrack 播放 |
| L0 | 守护层 | 语音服务后台进程、唤醒监听(低功耗)、保活 / 权限(RECORD_AUDIO) |
整体调用链路如下:
flowchart TD
A["L0 守护层:唤醒监听"] --> B["L1 前端层:AudioRecord 采集"]
B --> C["L2 识别层:LatticeASR + VAD"]
C --> D["L3 理解层:NLU / LLM 应答"]
D --> E["L4 合成层:LatticeTTS 流式合成"]
E --> F["L5 联动层:terminal_exec / 技能 / MCP"]
F --> G["L6 呈现层:3D 形象口型同步"]
4. 核心组件
| 组件 | 职责 | 实现 |
|---|---|---|
| LatticeASR | 语音识别(约 7.2M 参数) | 端侧流式识别,输出文本流 |
| LatticeTTS | 语音合成(约 7.5M 参数) | 端侧流式合成,支持多音色 |
| Wake-word | 唤醒词检测 | 常驻低功耗监听,命中唤醒链路 |
| VAD | 语音活动 / 端点检测 | 决定何时开始 / 结束识别 |
| 数字人驱动 | 口型 / 表情同步 | 消费 TTS 韵律信号驱动 3D 模型 |
| 语音服务守护 | 后台常驻 | 类似 KeepAlive,保障随时可唤醒 |
5. 关键流程:一次语音对话
一次完整的语音交互共分六步:
- 唤醒:守护进程 Wake-word 命中 → 拉起识别链路
- 采集:AudioRecord 取麦克风流,前端降噪 + VAD 切句
- 识别:LatticeASR 流式输出文本 → NLU / LLM 生成应答
- 合成:LatticeTTS 流式合成音频,韵律信号同步给数字人
- 播放 / 演绎:AudioTrack 播放语音,3D 形象口型同步
- 联动:指令类语句可路由到 terminal_exec / 技能 / MCP
6. 与系统其它模块的关系
语音服务并非孤岛,而是数字人控制台的「输入 / 输出总线」:
- 终端 4.0:语音 → terminal_exec 执行命令
- 技能 Skills:语音触发技能工作流
- MCP:语音驱动连接器动作(飞书 / 浏览器…)
- 数字人:语音 + 口型 = 拟人交互
7. 总结
ZorvAI 语音服务通过「常驻守护 + 按需唤醒」的架构,将轻量自研的 LatticeASR / LatticeTTS 模型与数字人呈现、终端联动、技能编排深度整合,构建了一条从「唤醒」到「演绎」的完整语音交互链路。其离线优先、流式处理的设计,让数字人在弱网甚至无网环境下依然能保持自然流畅的对话体验。
如果你对数字人语音交互感兴趣,欢迎前往开源仓库进一步探索: