DSH给我输出了一大段插件架构的选型分析,屏幕滚了好几屏。我坐在屏幕前通读两遍,合上电脑,大半内容已经记不清。
很多时候我们并不需要死死盯着屏幕阅读大段文本。通勤路上、饭后散步,眼睛已经很累,大脑还想继续消化这些方案、思路与概念。
DeepSeek Harness一切皆插件的设计理念,社区已经出现了多款朗读插件,但大多依赖Edge TTS,音色偏机械,长时间听很容易疲劳。于是我在原有Omi朗读助手的基础上,开发了dsh-omi-voice,给DSH接入更自然的豆包音色。
为什么我需要在DSH里听回答
阅读长文本有一个现实问题:盯着屏幕阅读,很容易浅读扫过,很多关键逻辑看过就忘。
走路的时候用耳朵接收信息,用耳朵过一遍,信息在脑子里停留的时间更长,第二天还能复述出大致思路。不需要死盯屏幕,双手、眼睛可以解放出来,碎片时间直接利用起来。
我日常的真实使用场景:当DSH输出架构对比、方案选型、问题排查思路、知识点梳理这类大段文字,我不会继续盯着屏幕逐字啃。直接点击朗读,一边在家走动或者简单收拾,一边完整听完整套论述。听完之后,再回到屏幕上针对重点段落细看。
社区现状:现有朗读插件的局限
DSH社区已经诞生了不少TTS朗读类插件,大多基于系统自带语音或 Edge TTS 这类机械音色。它们的优势是开箱即用,不需要额外密钥,零成本。
但缺点同样明显:音色机器感很重,短句尚可,几十分钟长段内容,听觉体验很折磨人。我自己试过几款,试用几次就关掉,很难长期使用。
我想要的是:保留DSH插件体系的原生体验,同时拿到更接近真人说话的流畅音色,于是就有了dsh-omi-voice。
dsh-omi-voice的几个核心特点
🎵 豆包自然音色,不是Edge TTS 底层调用豆包语音合成接口,相比Edge TTS,断句、语气、语速更贴近真人说话,适合长时间收听长文档、方案分析。Edge TTS像新闻播报,字正腔圆但没感情;豆包像真人在跟你说话,有停顿、有语调,听久了不烦躁。
👆 点🔊直接读,不用复制 深度集成DSH,AI回复旁直接出现朗读按钮。点一下就读,暂停后从断点续播。不用选中文本、不用切窗口、不用按快捷键。
🧹 自动过滤代码和表格 只读最终回答,工具日志、思考过程不会读。代码围栏、表格、纯图形内容在请求前自动过滤——DSH经常输出大段代码,全读出来会疯掉。
🔒 插件零Key,引擎本地跑 API Key存在你本机的macOS Keychain里,插件侧完全不接触Key。播放、暂停续播、缓存、文本清洗全部在本地Omi引擎完成,插件只是个"遥控器"——符合《个人信息保护法》最小必要原则。
怎么装?十分钟搞定
- 装插件:一条命令
dsh plugin --profile web add "github:PolinniZhong/dsh-omi-voice#v0.1.2&path:/"(插件无需克隆、无需构建) - 构建并安装本地引擎:按 README 里
engine/的构建脚本(build-service.sh)生成 Omi DSH.app,放入应用程序文件夹 - 在引擎设置页填一次你的豆包API Key
然后在DSH里点🔊就能听了。完整安装命令、构建脚本和参数配置,全部写在GitHub README里,这里不重复。
⚠️ 当前仅支持macOS Apple Silicon,需要macOS 13+。Windows用户暂时用不了。
诚实说一句:这不是免费的。豆包TTS按字符计费,你用自己的Key自己付费,用量因人而异——轻度听几条回复成本很低,长时间连续听长回答费用会上去。能接受Edge TTS机械音的话,现有插件就够用;追求自然音色、愿意为体验付费的,再考虑这个。
好消息是,只有你手动点🔊才会合成,不自动朗读,还有LRU缓存(最近几条)去重,连续重复听同一段不重复扣费。
插件生态才是DSH的真正魅力
DSH刚发布不久,还处在开发者预览阶段。但短短几天,社区已经冒出工具插件、TTS、子Agent扩展等各式各样的周边。
很多人把目光聚焦在模型能力有多强,但对平台而言,真正的生命力来自上层的生态。
"一切皆插件"不只是一句口号。它意味着普通开发者可以基于底座,补齐自己真实使用中的痛点:有人需要朗读,有人需要特殊工具调用,有人要接入自己内部的子Agent。不用改框架源码,写一个插件就行。
dsh-omi-voice只是很小的一个例子,解决的就是我个人真实的收听痛点。
如果你也部署了DSH,且对Edge TTS的音色不满意,可以试试。
GitHub:github.com/PolinniZhong/dsh-omi-voice
觉得有用的话,一颗Star是对独立开发者最好的鼓励。