ZorvAI 语音服务架构全解析:从唤醒词到数字人口型联动的完整链路

0 阅读3分钟

1. 引言

在数字人交互场景中,语音是最自然、最高效的输入输出方式。ZorvAI 数字人控制台内置了一套完整的语音服务体系,让用户用说话代替打字、AI 用语音代替文本,配合 3D 虚拟形象形成「听—想—说—演」的闭环。

这套语音服务脱胎于 OpenClaw AI Engine 的 LatticeASR / LatticeTTS 轻量自研模型(合计约 14.7M 参数),可端侧离线运行,也可接入在线服务增强。本文将从架构分层、核心组件、关键流程三个维度,带你完整拆解 ZorvAI 语音服务的设计思路。

开源地址github.com/Quor-a/Zorv…

2. 设计理念

语音服务以「常驻守护 + 按需唤醒」方式存在:后台语音服务持续做唤醒词检测,命中后拉起完整识别—推理—合成链路;结果既驱动对话,也驱动数字人口型与动作。

核心设计原则有四条:

  • 离线优先:ASR / TTS 模型本地推理,弱网 / 无网可用;在线服务作为高保真补充。
  • 流式流水线:采集、VAD、识别、合成均支持流式,降低端到端延迟。
  • 数字人联动:合成音频的韵律(prosody)信号同步驱动 3D 形象口型与表情。
  • 与终端 / 技能 / MCP 打通:语音指令可触发 terminal_exec、调用技能、驱动 MCP 连接器。

3. 技术架构(分层)

语音服务整体采用七层架构设计,从底层的守护进程到顶层的 3D 呈现,各层职责清晰、逐层联动:

层级名称核心组件
L6呈现层3D 虚拟形象(角色卡)、口型 / 表情同步、对话 UI 播报
L5联动层语音指令 → terminal_exec、语音 → 技能 / MCP 触发、QuroAssistant 对话编排
L4合成层LatticeTTS(7.5M)、音色管理 / 韵律控制、流式 TTS
L3理解层NLU / 意图识别、LLM 应答生成、上下文记忆
L2识别层LatticeASR(7.2M)、VAD 端点检测、流式 ASR
L1前端层AudioRecord 采集、降噪 / AGC、唤醒词检测、AudioTrack 播放
L0守护层语音服务后台进程、唤醒监听(低功耗)、保活 / 权限(RECORD_AUDIO)

整体调用链路如下:

flowchart TD
  A["L0 守护层:唤醒监听"] --> B["L1 前端层:AudioRecord 采集"]
  B --> C["L2 识别层:LatticeASR + VAD"]
  C --> D["L3 理解层:NLU / LLM 应答"]
  D --> E["L4 合成层:LatticeTTS 流式合成"]
  E --> F["L5 联动层:terminal_exec / 技能 / MCP"]
  F --> G["L6 呈现层:3D 形象口型同步"]

4. 核心组件

组件职责实现
LatticeASR语音识别(约 7.2M 参数)端侧流式识别,输出文本流
LatticeTTS语音合成(约 7.5M 参数)端侧流式合成,支持多音色
Wake-word唤醒词检测常驻低功耗监听,命中唤醒链路
VAD语音活动 / 端点检测决定何时开始 / 结束识别
数字人驱动口型 / 表情同步消费 TTS 韵律信号驱动 3D 模型
语音服务守护后台常驻类似 KeepAlive,保障随时可唤醒

5. 关键流程:一次语音对话

一次完整的语音交互共分六步:

  1. 唤醒:守护进程 Wake-word 命中 → 拉起识别链路
  2. 采集:AudioRecord 取麦克风流,前端降噪 + VAD 切句
  3. 识别:LatticeASR 流式输出文本 → NLU / LLM 生成应答
  4. 合成:LatticeTTS 流式合成音频,韵律信号同步给数字人
  5. 播放 / 演绎:AudioTrack 播放语音,3D 形象口型同步
  6. 联动:指令类语句可路由到 terminal_exec / 技能 / MCP

6. 与系统其它模块的关系

语音服务并非孤岛,而是数字人控制台的「输入 / 输出总线」:

  • 终端 4.0:语音 → terminal_exec 执行命令
  • 技能 Skills:语音触发技能工作流
  • MCP:语音驱动连接器动作(飞书 / 浏览器…)
  • 数字人:语音 + 口型 = 拟人交互

7. 总结

ZorvAI 语音服务通过「常驻守护 + 按需唤醒」的架构,将轻量自研的 LatticeASR / LatticeTTS 模型与数字人呈现、终端联动、技能编排深度整合,构建了一条从「唤醒」到「演绎」的完整语音交互链路。其离线优先、流式处理的设计,让数字人在弱网甚至无网环境下依然能保持自然流畅的对话体验。

如果你对数字人语音交互感兴趣,欢迎前往开源仓库进一步探索:

开源地址github.com/Quor-a/Zorv…