5 分钟用 AIGCPanel 部署阿里 SenseVoice,中粤日韩英语音识别 + 情感分析全搞定

0 阅读3分钟

阿里达摩院开源的 SenseVoice,一个模型把语音识别、情感识别、语种识别、事件检测全包了,而且比 Whisper 快 5 倍。中文识别比 Whisper 准,粤语场景优势更明显,还能听出说话人情绪和背景声音。

SenseVoice 模型架构概览

速度碾压 Whisper,中文准确度还更高

SenseVoiceSmall 采用非自回归端到端架构,参数量跟 Whisper-Small 差不多,推理速度是它的 5 倍以上,是 Whisper-Large 的 15 倍。在 AISHELL-1、AISHELL-2、Wenetspeech 等中文基准上,识别准确率全面领先 Whisper。

ASR 效果对比 更多 ASR 效果对比

一个模型顶四个

大多数 ASR 模型只做语音转文字。SenseVoice 在一个模型里同时输出:

  • 语音识别:中、粤、英、日、韩,带标点,带逆文本归一化
  • 情感识别:7 种情绪——高兴、悲伤、愤怒、中性、恐惧、厌恶、惊讶
  • 事件检测:8 种事件——音乐、掌声、笑声、哭声、咳嗽、喷嚏、呼吸、说话
  • 语种识别:自动判断输入语言

在不做任何目标数据微调的前提下,SenseVoice 的情感识别效果就达到了甚至超过了当前最好的专用情感识别模型。

情感识别效果对比

录一段会议录音,不仅能拿到逐字稿,还能知道哪句话是开心的、哪段有人在鼓掌、背景有没有音乐。这种"富文本转录"对内容创作、客服质检、会议纪要这些场景很实用。

AIGCPanel 一键部署,5 分钟跑起来

模型再好,部署折腾也白搭。SenseVoice 的 AIGCPanel 服务把流程简化到了几步:

  1. 打开 AIGCPanel,导入 SenseVoice 模型服务
  2. 系统自动下载 SenseVoiceSmall + FSMN-VAD 两个模型(总共不到 1GB)
  3. 填好音频地址,选择语言,等结果

支持 GPU 推理(自动检测 CUDA),没有 GPU 自动降级 CPU,机器有就行。还支持粤语、日语、韩语的自动识别,做海外内容、多语言客服场景很合适。

AIGCPanel 操作界面

能力巡礼

  • 多语言语音识别:中文、粤语、英文、日文、韩文,自动语种识别
  • 情感识别:7 种情绪标签,无需微调
  • 音频事件检测:掌声、笑声、咳嗽、音乐等 8 种事件
  • 长音频支持:内置 VAD,自动分段合并,任意时长都能处理
  • 带标点输出:逆文本归一化,数字日期自动规整
  • GPU/CPU 自动切换:有 GPU 用 GPU,没 GPU 用 CPU
  • 边缘端也能跑:GGUF 量化版本仅 254MB,无需 Python,单二进制运行

其他信息

  • 论文已公开:arXiv:2407.04051,技术细节透明
  • MIT 开源协议,模型权重可商用(需遵守模型协议)
  • 支持 FastAPI、Docker、llama.cpp(边缘端)、ONNX、LibTorch 多平台部署
  • 提供完整微调脚本,方便业务定制

在 AIGCPanel 上试试看

SenseVoice 把语音识别这件事做到了一个新高度——听得准,还能听出情绪、听出场景。如果你在做语音转写、内容审核、AI 语音助手,这个模型可以放进工具箱试试。

你在实际场景中遇到过哪些语音识别的翻车案例?是方言识别不准,还是长音频处理太慢?说不定 SenseVoice 刚好能解决你的问题。