问题背景
一位做声纹功能产品的客户,命令词不多、控制逻辑简单,最终选了带自学习声纹能力的 CI1302。但真正让选型卡住的,不是算力,也不是命令词数量,而是一个更基础的问题:单麦克风够不够用,要不要上双麦克风?
这个问题几乎所有语音硬件都会遇到——智能门锁、家电控制、车载语音、办公设备——而且它直接决定咪头布位、板子面积、结构设计和 BOM 成本。本文把这次技术支持中确认下来的结论整理出来,供正在画板的开发者参考。
单麦与双麦的工作原理与分工
单麦克风:一路信号承担全部识别
单麦方案里,唯一一个咪头采集的信号要同时承担唤醒、命令词识别等任务,并在噪声环境下直接承受环境声的干扰。在安静、近距离、噪声可控的场景(比如用户凑近设备说话),单麦完全可以胜任,成本与结构复杂度也最低。
双麦克风:M1 做识别,M2 跑算法
双麦并不是"两路信号都做识别",而是分工明确的架构,这也是理解双麦收益的关键:
- M1 咪头负责识别:唤醒词、命令词的识别从这一路提取;
- M2 咪头负责算法:这一路跑降噪算法,为识别通道提供更干净的信号基础。
双麦的两大收益
- 噪声环境下识别效果更好。 使用环境噪声大时,M2 上的降噪算法能改善识别表现,这是双麦最直接的收益。
- 支持声源定位。 需要判断声音来向的功能必须用双麦,单麦从原理上无法实现声源定位。
什么场景该上双麦:一张判断表
把上面的原理换成可执行的判断,选型时直接对照下表:
| 你的情况 | 建议 |
|---|---|
| 需要声源定位功能 | 必须双麦 |
| 使用环境噪声大 | 建议双麦,识别效果更好 |
| 环境安静、交互距离近 | 单麦即可满足 |
| 命令词少、控制逻辑简单,且对成本敏感 | 单麦更划算 |
一句话总结:双麦买到的是抗噪能力与声源定位,单麦买到的是成本与结构简单。 两样都不需要,就没必要为双麦买单。
声纹产品的落地要点
麦克风架构定了之后,声纹功能落地还有几个容易踩坑的点。先补一个硬件前提:CI1302 可用 IO 口共 9 个,模块与芯片引脚兼容(芯片引脚一样),参考设计可以通用。另外,双麦在噪声环境下识别效果更好的结论,对声纹这类识别任务同样适用——这正是声纹产品也要认真做麦克风架构决策的原因。
声纹注册:IO 触发与串口触发都可行
声纹学习(注册)既可以通过 IO 口电平触发,也可以通过串口发命令触发,两种方式均已确认可行。对 MCU 主控的产品,发一条命令就能开启录音、注册声纹;IO 电平触发则适合"长按按键进入注册"这类交互。
清除声纹:平台没有现成选项,需固件支持
平台配置里没有"清除已录制声纹"的现成选项,这个能力要在固件层面实现。这次支持中就出现了实际情况:客户自制固件缺少声纹注册指令等配置,FAE 检查固件后指出缺失项,并提供了固件测试协助和 CI-33T 声纹识别教程视频。教训是:产品若需要"删除当前用户、重新注册"的能力,务必在固件评审阶段确认指令齐全,别拖到量产前才发现。
唤醒词没有 RX 串口控制
唤醒词不支持串口输入触发,也就是没有 RX 串口控制。配置串口输入输出时要把这一点区分清楚:命令词可以走串口,唤醒词不行。好消息是,串口输入输出在不同型号模块上的配置方式一致,都在平台上配置,换型号不需要重学一套方法。
画板前验证与平台配置建议
语音这一块坑比较多,画板前先充分验证:板子画好后可以发给硬件工作师审核,尽量避免把设计问题带进打样阶段。麦克风架构、咪头布位、IO 分配一旦成型,返工成本远高于多花几天做验证。
平台配置方面有个实用技巧: 先看,模型占用空间的大小,通常模型越大效果越好; 其次,看场景模型编号,编号越大是越新的模型,效果通常比老的好; 最后,综合考虑产品类别,产品类别对的话,模型可能针对该产品的常用词条做了优化,效果可能更好;可以生成不同模型的版本实测一下,看针对该产品词条,哪个模型效果最好选那个。
FAQ
Q:CI1301 模块和芯片引脚兼容吗? 兼容,芯片引脚一样,参考设计可通用,画板时可按同一套引脚定义走。
Q:怎么快速判断该不该上双麦? 要声源定位就必须双麦;环境噪声大建议双麦;安静、近距离、命令词少的产品单麦就够。
Q:声纹注册必须用串口吗? 不必,IO 口电平触发和串口命令触发都可行,按主控方案与交互方式选择即可。
Q:平台上能直接配置"清除声纹"吗? 不能,平台没有现成选项,需固件层面支持;自制固件要确认包含声纹注册等相关指令。
Q:唤醒词能通过串口命令触发吗? 不能,唤醒词没有 RX 串口控制。串口输入输出均在平台配置,各型号模块配置方式一致。