Mac 听写工具的技术内幕,从 ASR 管线到语音 Agent,九款怎么选(2026)

126 阅读26分钟

利益相关。 我是 Viora 团队的人。Viora 是这篇会讲到的工具之一,所以我有立场。掘金上的读者大多是工程师,糊弄不过去,所以我把话说前面。别人在某些技术点上做得比我们好,我直接说,也给你贴官网。你看完觉得别的更合适,那就用别的,这才对。文里关于 Viora 的架构,我只讲处理位置和模式,不点名具体的模型供应商,原因后面隐私那节会说。

先说个很多人都有的经历。三四年前在 Mac 上试听写,说了一句带"逗号"的话,屏幕上真打出"逗号"两个字,然后这功能再也没打开过。这不是 Bug,是那一代听写的设计就是给短输入用的。这两年才真的变好,所以值得重新看一看。

这篇不只是横评。我会先把听写背后的技术栈拆开讲,一段语音到底怎么变成字,端侧和云端差在哪,为什么自带听写"够用但难受"。把原理搞清楚,你再看那九款工具,就知道每一款到底在补哪个环节,而不是被宣传词牵着走。

Viora 在 Mac 邮件里听写,整理好的文字落进输入框,右上角是悬浮球

Viora 在 Mac 邮件里听写,整理好的文字落进输入框,右上角是悬浮球

Viora 在 Mac 邮件里听写,整理好的字直接落进输入框,右上角那个是它的悬浮球。


先给结论(TL;DR)

  • Mac 自带听写免费。发短消息、记笔记、填表单都够用。技术上它就是为短输入设计的,很多人不用再装别的。
  • 写长一点就难受。标点要自己念,识别完没有后处理,打错了不好改,专有名词加不进去。这几条都有技术原因,下面讲。
  • 想要离线、音频不出本机,看 Superwhisper,它支持端侧模型。
  • 要跨 Windows 和手机,或者公司在意合规(比如医疗),看 Wispr Flow,它转写始终走云端。
  • 主要写长文、最看重自动整理的,看 Typeless,云端实时处理后即删。
  • 一直用 Mac,又想让语音不只是打字,看 Viora(我们做的)。它在 ASR 之上加了一层意图路由,同一个快捷键能写、能改、能问、还能调工具办事(查日历、搜索、连 Gmail 和 Notion 这些)。这几样在公开定位里明确主打的,这份名单里基本只有它。语言支持 100 种以上,不比别人少。
  • 这几个之外还有不少工具(Voibe、Willow Voice、Aqua Voice、Monologue,还有做会议记录、浏览器免费、Windows 专业、Mac 助手的)。文章最后归好类。

下面先用一张大表给你全貌,再一层一层讲原理。


先上一张大表,九款放一起看

把自带功能和八款第三方放一起,多看几个维度。重点看右边三列,那是"语音能不能不只是打字"的地方,也是技术上最难做的地方。

工具价格平台离线自动整理个人词典选中改写、提问能办事记忆习惯一句话点评
自带听写免费仅 Mac✅ 多数(看设置)短输入够用,系统自带
Superwhisper免费档,Pro 8.49 美元/月(另有年付、买断)Mac、Windows、iPhone✅(Apple 芯片端侧)✅ 可调🟡 半个离线优先,可买断
Wispr Flow免费 2000 词/周,Pro 12 美元/人/月(年付)Mac、Windows、iPhone、安卓❌ 云端🟡🟡跨平台老牌,有医疗等合规
Typeless免费 8000 词/周,Pro 12 美元/席/月年付 或 30 美元/月Mac、Windows、iPhone、安卓❌ 云端✅ 很强🟡🟡长文整理是强项,免费额度大
Viora(我们做的)免费档,Pro 20 美元/月 或 199 美元/年仅 Mac❌ 云端语音不止打字、还能调工具办事,支持 100 种以上语言
Voibe7.50 美元/月、59 美元/年、买断 149 美元仅 Mac✅ 主打本地纯端侧,隐私优先
Willow Voice免费 2000 词/周,Pro 12 美元/月(年付约 10 美元/月)Mac、Windows、iPhone❌ 云端云端,主打快,含 iPhone
Aqua Voice免费 1000 词,Pro 8 美元/月(年付)Mac、Windows❌ 云端云端,打开快,边说边出
Monologue免费 1000 词,Pro 约 100 美元/年Mac、iPhone🟡 看设置🟡 智能排版🟡能看上下文,自动排版

看表小贴士,几个符号是这个意思。

  • ✅ 有,或者能。
  • ❌ 没有。
  • 🟡 有一点,但不是主打(Superwhisper 那个"半个"也算,它的 Super 模式只是把你的话交给 AI 去答,不是真办事)。
  • ➖ 没把这件事当卖点(公开定位就是听写,不代表一定没有)。
  • ❓ 我没查到,各家也没明说。

价格是 2026 年 6 月去各家官网 pricing 页核对的,这类工具改价格很勤,下单前请以官网为准。

右边那三列,选中改写提问、能办事、记忆习惯,技术上要在 ASR 之上再搭一层意图判断和工具调用,工程量比纯听写大不少。在公开定位里把这三件都当主打的,这份名单里基本只有 Viora(别家没把这些当卖点,不代表完全没有)。这就是它和"纯把话变成字"的工具最大的不同。具体架构下面会展开。


先讲清楚听写背后的技术栈

这部分有点干,但搞懂了,后面选工具就不会被宣传词忽悠。

一段语音是怎么变成字的

一个现代听写工具,背后大致是这么一条流水线。

  1. 录音。按住快捷键,麦克风开始采集音频。
  2. VAD,语音活动检测。程序要判断哪段是人说话、哪段是静音,把音频切成一句一句。自带听写"说着说着就停了",本质就是它的 VAD 判定你停了几秒就自动收工,而且这个超时时间你改不了。
  3. ASR,自动语音识别。这是核心。声学模型把声音转成音素,语言模型再拼成最可能的句子。这两年很多工具的底座是开源的 Whisper 系列模型,识别效果比前几代好很多,这也是 Mac 听写体验突然变好的大背景。
  4. 后处理。原始 ASR 出来的是大白话流水账,没标点、带"嗯""那个"。新一代工具会在这一步再过一个大语言模型,补标点、去填充词、按场景改语气。这一层是体验差距的关键,下面单独讲。
  5. 注入。把最终文本塞回你当前的输入框。Mac 上一般通过辅助功能或者模拟键盘事件来落字。

一句原始输出和后处理之后的差别,大概是这样。

原始 ASR 输出(没有后处理)
 嗯 那个 我们 周五 之前 把 报告 发出去 然后 再 同步 一下 进度

经过 AI 后处理之后
 我们周五之前把报告发出去,然后再同步一下进度。

自带听写基本停在第 3 步,没有第 4 步那层 LLM。所以它出来的字是"对的",但不是"能直接发的"。

端侧还是云端,这是第一个分水岭

ASR 到底在哪台机器上跑,决定了隐私、延迟、和能用多大的模型。这是选工具最重要的一个技术维度。

  • 端侧(on-device) 。模型跑在你自己 Mac 上,音频不出本机。隐私最好,断网也能用。代价是模型大小受设备内存和算力限制,长尾语言和复杂场景的准确率通常不如云端大模型。Apple 芯片的 NPU 让端侧 Whisper 跑得动,这是 Superwhisper、Voibe 这类工具的基础。
  • 云端(cloud) 。音频传到服务器,用更大的模型识别。准确率和语言覆盖更容易做高,但音频离开了你的设备,断网用不了,还要算往返延迟。Wispr Flow、Typeless 走的是这条路。
  • 混合。一部分端侧、一部分云端,按场景切。

这里有个常见误区,要替这几家说句公道话。云端不等于不安全,端侧也不等于一定慢。安全看具体怎么传、怎么存、用哪个模型,延迟看工程优化。别只看"云端"两个字就下结论。

为什么自带听写"够用但难受",技术上的三个原因

把上面的流水线套到自带听写,它的天花板就很清楚了。

  1. 没有后处理 LLM。它停在 ASR,不补标点、不去填充词。所以你得自己念"逗号""句号""换行",长句子念下来很累。
  2. 没有自定义词典。它的语言模型是固定的,你没法往里加词。同事叫 Nguyen,公司有个外人没听过的产品名,它会一直按发音猜错,你还教不了它。
  3. VAD 超时写死。几秒静音就自动停,时间改不了。你说话会停下来想,它就替你把句子结束了。

第三方工具,基本就是来补这三个洞的。

双模型 ASR 路由的简化示意,常用语言走自托管主模型,其余语言走云端兜底模型,合计 100 种以上

双模型 ASR 路由的简化示意,常用语言走自托管主模型,其余语言走云端兜底模型,合计 100 种以上

一个现代工具的 ASR 这一层可以做得更细。图为 Viora 的双模型路由(简化示意),常用语言走自己部署的主模型,其余长尾语言切到云端兜底模型,合起来覆盖 100 多种语言,两条路径都在云端完成。


自带听写,怎么开还有那个一定要改的快捷键

原理讲完,先把免费的用明白。不同系统版本设置位置略有差别,下面以 Sonoma 14 和 Sequoia 15 为例。

  1. 打开"系统设置"。(按住 Command 再按一下空格,输入"系统设置"。)
  2. 左边一栏往下滚,找到"键盘"。
  3. 右边中间,找到"听写"这一项。
  4. 把听写打开,给它麦克风权限。

现在任何输入框都能用。

但默认快捷键你大概率不想用。默认是"按听写键"或者"快连按两下 fn"。在同一个地方点"快捷键",挑一个"按住就说"的键,按住、说话、松手,像对讲机一样。下面这些都行,选一个不冲突的。

  • 按住右边的 Command 键
  • 按住 fn 键(每个 Mac 键盘都有,我推荐这个)
  • 右边的 Option 键,或者右边的 Control 键

我们看过很多人配这一步,规律很清楚。挑了"按住就说"的人,一周后还在用。还用"连按两下"的人,基本就不用了。交互方式比识别准确率更能决定你会不会留下来。

然后点"语言",只加你真会说的那两三种。它会自动认语言,但不是万能的。你加了法语却从来不说,它偶尔会把一句话当成法语来认,结果一堆乱码。语言加得越多,识别时要在更多语言里做判断,认错的概率反而上升。

语音听写工具的设置页,麦克风、识别语言、快捷键都在一处,图为 Viora

语音听写工具的设置页,麦克风、识别语言、快捷键都在一处,图为 Viora

这类语音工具的设置大致长这样(图为 Viora)。重点就两条,快捷键设成按住就说,语言只留你常用的。系统自带听写也是调这几项。

几个常见小问题。没出字,多半是没给麦克风权限,去"隐私与安全性"里的"麦克风"检查。认成别的语言,回"语言"里把不用的删掉。说着说着停了,是 VAD 超时,不是坏了。

至于命令,日常九成情况下面这几个就够,说 comma 出逗号、period 出句号、new line 换行、new paragraph 另起一段。要打引号说 open quote 和 close quote。如果你发现自己在一封邮件里念了四遍"句号 换行",那不怪你,这功能本来就不是为写长东西做的。


第三方工具到底在补哪三个技术洞

知道了流水线,就能看清第三方工具的价值不是玄学,而是补在具体环节上。

洞一,ASR 后面那层后处理 LLM

这是体验差距最大的地方。原始 ASR 给你的是流水账,新一代工具在它后面接一个大语言模型,做四件事,补标点和大小写、去掉"嗯""那个"、合并你说了一半又重说的句子、按当前应用换语气(在 Slack 里随意点,在邮件里正式点)。

判断一款工具行不行,主要看这一层。Typeless 把这层做成了主打,长文整理很强。Wispr Flow 的自动改字有四个力度可调。这层活基本都在云端做,因为要跑得动够大的语言模型。

洞二,自定义词典,技术上叫 biasing

自带听写最大的硬伤是加不了词。第三方怎么解决?常见有两种思路。一种是 hotword biasing,在解码时给词典里的词更高权重,让模型更倾向于识别成它们。另一种是把你的词表喂给后处理那层 LLM,让它在润色时把听错的专名纠回来。

对开发者特别有用,因为我们满嘴是 ASR 听不懂的词,Kubernetes、nginx、自家的服务名、英文缩写混中文。能不能加词,是自带和第三方差别最大的一点。这四款第三方都支持个人词典。

洞三,语音 Agent 层,意图路由加 tool calling

这是最新、也是技术上最重的一层。前面两个洞都还在"把话变成更好的字",这一层要让语音去"办事"。

实现上要在 ASR 之上再加一个意图路由。一段语音识别成文本后,先判断你这句是想写字、想改选中的内容、想问个问题、还是想让它去办一件事。判断完再分发到不同处理路径。如果是办事,就走 tool calling,模型把你的话翻译成对工具的结构化调用,比如查日历、发网络搜索、调一个第三方连接器,拿到结果再回给你。

这套和大家熟悉的 function calling、Agent 框架是一回事,只是入口从打字变成了语音。下面四款里,把这层当主打做的只有一款,另外三款公开定位还是听写。

一个快捷键四条路径,语音先识别再做意图路由,分别走听写、改写、提问、办事

一个快捷键四条路径,语音先识别再做意图路由,分别走听写、改写、提问、办事

语音 Agent 层的简化示意(图为 Viora 的做法)。同一个快捷键,识别完先做意图路由,再分流到听写、选中改写、就地提问、Agent 办事四条路。办事这条会走工具调用,结果显示在屏幕角上的卡片里。


四款第三方,按架构挨个老实说

先说一句。下面的价格和免费额度,是 2026 年 6 月我去各家官网看到的,这种工具改价格很勤,真要买之前自己再看一遍。合规那些(比如医疗要的 HIPAA),更要自己核实,别只信宣传页。

Superwhisper,端侧优先的代表

处理位置,端侧加云端双轨。 这是它最大的技术特点。官网说它能在你自己电脑上跑模型,音频不上传,这条端侧路径在 Apple 芯片上跑得最好。它也提供云端模型。所以隐私好不好,要看你选了哪条路、哪个模型,不是看牌子。

它没有的,是真正的"办事"那一层。它有个 Super 模式,是把你说的话交给一个 AI 去答,更像"用嘴问一下 AI",不是真去执行。你说"明天上午排个 30 分钟专注时间",它给你的是这句话的整理稿,不会真在日历上建好。

价格上 2026 年 6 月看,有免费档,Pro 每月约 8.49 美元,月付、年付、买断都有。什么时候选它,你在意端侧离线,或者宁可买断不想订阅,或者想自己挑本地模型。官网是 superwhisper.com[1]。想看和 Viora 的逐项对比,可以参考我们写的 Viora vs Superwhisper[2],这是我们的视角,记得对照官网。

Wispr Flow,全云端的跨平台老牌

处理位置,转写始终在云端。 这点它官网的 Data Controls 写得很明确,识别这一步永远在服务器做。好处是跨平台一致,Mac、Windows、iPhone、安卓都有,词库四端同步。它有 Privacy Mode,可以让你的转写内容不被存储、不拿去训练,但请注意这不等于"不收集任何数据",使用统计仍可能收集。

它的强项是后处理,自动改字四个力度,词库会学你的常用词,语气跟着当前应用变。如果你大部分字打进 Notion、Gmail、Slack,它围着这些场景打磨得最细。它还公开了一些企业合规(比如医疗在意的 HIPAA),具体以你和它签的合同为准。官网是 wisprflow.ai[3]。

Typeless,把后处理那层做成主角

处理位置,云端实时处理后即删。 按它的隐私政策,音频和内容在云端实时处理,处理完就删,所以别把它当离线工具。

它的重点全压在"洞一"那层后处理上,去填充词、把你东一句西一句的话理成条理、按应用换语气、多语言。如果你一天大部分时间在写长东西(邮件、文档、周报),它在整理上帮的忙最多。价格约每人每月 12 美元年付,月付约 30 美元,免费档每周 8000 字,是四款里最大方的。支持 Mac、Windows、iPhone、安卓。官网是 typeless.com[4]。

Viora,在 ASR 之上加了意图路由和工具调用(我们做的)

Viora 是我们的产品,我直说架构,有什么、没什么。

ASR 这一层,双模型路由。 上面那张 ASR 图就是它。最常用的一批语言走我们自己部署、做过重点优化的主模型,遇到它不擅长的长尾语言,自动切到云端的兜底模型,两个加起来覆盖 100 多种语言。中文这块还做了简繁自动处理,粤语会归一到中文。两条路径都在云端,所以我把丑话放前面,它不是离线工具。

ASR 之上,意图路由加工具调用。 这是它和纯听写最大的区别,也是上面第二张图画的东西。同一个按住就说的快捷键,识别完先判断你的意图,再分到四条路。

  • 写。 走后处理 LLM 整理,落到光标处。
  • 改。 选中一段文字,用嘴说怎么改,它替换掉原文。
  • 问。 对着屏幕上的内容直接问,包括截屏选区,答案显示在屏幕角上一个叫 Capsule 的悬浮窗旁边。
  • 办。 走 tool calling,能做网络搜索、查系统日历,还能连一批第三方服务。目前后端实现了 Agent 能读写的连接器是 Gmail、Google Calendar、Notion、Slack。你说"明天上午排个 30 分钟专注时间",它能真去帮你建。

还有个细节工程师会喜欢。默认 Fn 是按住录音,Fn+Ctrl 是强制进 Agent 模式,而且你正在听写的时候按上 Ctrl,能把这次听写直接升级成 Agent 任务。结果用一个叫 Agent Card 的卡片流式显示,工具跑到哪一步你看得见。

Viora 的 Agent Card,把语音办事的结果流式显示在悬浮球旁边

Viora 的 Agent Card,把语音办事的结果流式显示在悬浮球旁边

Viora 的 Agent Card。你说一件要办的事,工具调用的进度和结果就流式显示在 Capsule 旁边。

后端模型,聚合多家云端大模型按任务路由。 聊天、改写、Agent 推理用不同的模型来接,按任务挑合适的那个。具体用哪几家,我这里就不列清单了。这类供应商本来就会换,写死在一篇会过期的文章里没意义,以官网为准。这也是为什么我前面说,只讲架构和处理位置,不点名牌子。

价格上 Pro 每月 20 美元,或每年 199 美元,还有免费档,具体字数以 Viora 价格页[5] 为准(这块官网在调,我不写死)。一部分后台主动能力(比如定时任务、主动记忆这类)放在 Pro,前台的听写和 Agent 免费档就能用,确切的免费和 Pro 边界也以价格页为准。我们只有 Mac,Apple 芯片和 Intel 都行,没有 Windows 和手机版。

我们老实说没有的。 不能离线(识别在云端)、不提供本地 Whisper 模型、不支持自带模型 Key、没有公开 API、没有 HIPAA 合规。这几条里只要有一条是你必须要的,那这份名单里的答案就不是我们。官网是 voice dictation for macOS[6]。什么时候选它,你一直在 Mac 上,又想让语音不只是出字。

下面四款定位偏听写,我没像上面那样长期天天用,只讲定位和处理位置。

Voibe,纯端侧可买断

处理位置,主打全程在本机。 它比 Superwhisper 走得更彻底,就是不想让音频上传那一派。卖点是按住说话、隐私优先、能加词库、有开发者模式、可一次买断。2026 年 6 月看,月付约 7.50 美元、年付 59 美元、买断 149 美元(都是促销价)。你把端侧和隐私当必须,又喜欢买断,它值得放进候选。官网是 getvoibe.com[7]。

Willow Voice,又快又能跨手机

处理位置,云端。 给 Mac、Windows、iPhone 用,主打快。和 Wispr Flow 在"跨设备又快"上很像,差别看订阅价、隐私说法、iPhone 体验。免费档每周 2000 词,Pro 约每月 12 美元,年付能到每月 10 美元。要的就是快又要手机能用,看它。官网是 willowvoice.com[8]。

Aqua Voice,主打打开快、边说边出

处理位置,云端。 给 Mac 和 Windows 用,强调启动快、说话就出字,和 Willow 一样是"云端求快"这一类。免费档 1000 词,Pro 约每月 8 美元年付。最看重打开速度和实时,看它。官网是 aquavoice.com[9]。

Monologue,能看上下文、自动排版

处理位置,看设置,公开定位可能有本地选项(我没独立核实)。 给 Mac 和 iPhone 用,特点是能看屏幕上的内容、自动排版。免费档 1000 词,Pro 约每年 100 美元。这款我了解最少,以官网为准,官网是 monologue.to[10]。


开发者专属,在 Cursor 或 VS Code 里听写

既然在掘金,单独说一句开发者场景。

能不能在代码编辑器里听写?能。听写在系统的输入框里基本都能用,包括 Cursor、VS Code 这类。Wispr Flow 公开说支持 Cursor 和 Windsurf,其它几款一般靠系统把字塞进输入框,所以多数编辑器也能用。

但有两个现实问题。一是代码里的专名密度极高,函数名、包名、缩写,没有个人词典基本没法用,所以这是个"必须能加词"的场景。二是纯语音写代码并不顺手,符号和缩进念起来很别扭。更实际的用法是用语音写注释、写 commit message、写 PR 描述、在 issue 里长篇说明,以及对着一段报错直接问。这种"写散文 + 偶尔问一下"的活,语音比键盘快。

如果你常对着 AI 把一段话再加工成别的东西,那你其实想要的是语音 Agent 那条路,而不只是听写。


名单之外的工具,按需求归个类

下面这些经常被一起搜到,但干的活和"实时 Mac 听写"不完全是一回事。这一类我没一个个细测,给你归好类。

  • 会议记录、文件转录(先录后转,不是边说边出)。 Otter.ai、Notta(能分辨说话人、出摘要)、Sonix(音视频转字、能翻译)、MacWhisper(在本机把文件转字,喜欢离线的会用)。你要的是把已经录好的内容转成字,看它们。
  • 浏览器里用、又免费。 Google Docs 语音输入、Voice In(Chrome 插件)。只在浏览器或文档里用又想免费,看它们。
  • Windows 专业工具。 Dragon Professional,Windows 上很成熟,能用语音下命令,有法律医疗词库。Mac 用户基本用不上,顺带一提。
  • Mac 助手和系统控制(相邻,不是同一类)。 Raycast、ChatGPT 的 Mac 版、Claude 桌面版、Alfred,还有 Mac 自带的"语音控制"。这些是更大的助手、启动器或系统控制,和听写有重叠但目标不同。Viora 不替代它们,它是用语音来写、改、问、办事,不是启动器,也不做操控整个系统的语音控制。要打开软件、和 AI 聊天、或者用语音操控整台电脑,看它们。

怎么选,问自己四个问题

绕了这么多,最后归到四个问题,大概按这个顺序。

  1. 要跨平台吗? 又用 Mac 又用 Windows,或者想在手机上用,那名单就剩 Wispr Flow、Typeless,加上云端的 Willow Voice(有 iPhone)和 Aqua Voice。Superwhisper 也有 Windows 和 iPhone,但它最值钱的端侧模型在 Apple 芯片上才跑得最好。Viora 只有 Mac。
  2. 离线是必须的吗? "音频绝不离开我电脑"不能让步,那就看走端侧的 Superwhisper 和更彻底的 Voibe。自带听写在一些情况下也能在本机处理,但要按 Apple 当前设置和你的语言去核。Viora、Wispr Flow、Typeless 都是云端,直接排除。
  3. 你想让语音办事,还是只想出字? 你是不是老对着 ChatGPT 说话,让它拿你这段话再去做点别的?如果是,你要的是语音 Agent 那条路,这正是 Viora 在做的。如果语音对你就是"用嘴打字",剩下三款随便挑。
  4. 想订阅还是想买断? Superwhisper 和 Voibe 公开有买断。其余几款,包括 Viora,在我看到的公开页上都是订阅。

没有一个对所有人都对的答案。最常见的错,是图省事选了广告打得最响的那款,然后默默不打开,因为它根本不贴你的用法。掏钱之前,先用免费档用一个小时。想先搞清楚"语音助手"和"听写软件"到底差在哪,可以看我们这篇 voice AI assistant vs dictation software[11]。


几个常被问到的问题

2026 年 Mac 上最好的听写是哪款?

没有唯一答案。短输入用自带的。要端侧离线选 Superwhisper 或更彻底的 Voibe。要跨平台又需要企业合规,重点看 Wispr Flow。要快要手机,看 Willow Voice、Aqua Voice。写长文选 Typeless。想让语音办事,看 Viora。上面四个问题是最快的路。

Mac 听写能离线用吗?

自带听写在一些情况下可以在本机处理,但要看语言、地区、系统版本、在哪个框里打字,不是随时都能离线。第三方里,端侧能离线的是 Superwhisper 和 Voibe,其它多数是云端。

端侧和云端,识别准确率差很多吗?

不能一概而论。云端能上更大的模型,长尾语言和嘈杂环境通常更稳。端侧受设备算力限制,但 Apple 芯片上的体验这两年已经很好。真正拉开差距的,往往不是 ASR 本身,而是后面那层后处理做得好不好。

为什么我的 Mac 听写说到一半就停了?

它的 VAD 几秒没声音就自动停,这个超时改不了。你说话会停顿思考的话,按住就说的第三方更合适。

能在 Cursor 或 VS Code 里听写吗?

能。听写在输入框里都能用,包括代码编辑器。代码里专名多,建议选支持个人词典的工具,并且更适合用来写注释、commit、PR 描述,而不是硬念代码。

能给 Mac 听写加自己的词吗?

自带的加不了,它没有加词的入口。这四款第三方都能加词,用来记人名、产品名、专业术语。

Mac 上有免费的听写吗?

自带的就免费。Wispr Flow、Typeless、Viora、Superwhisper 也都有免费档或免费额度,选之前以各家官网为准。


写在最后

这篇是 Viora 团队写的,所以我把立场、架构、还有我们没有的东西都摆在前面了。两个诚实交代。一,我们这次没做严格的对比测试,所以文里关于准不准、快不快的话是大概的感觉,不是实验室结论。二,关于 Viora 后端用哪几家模型,我只讲了架构和处理位置,没点名具体牌子,这类供应商会变,以官网为准。

安静屋里说清楚话,上面这些选项日常都够用。差别主要在吵的环境、口音、专业术语、长句子,还有后处理那层整理得好不好。

如果你在用 Mac,又想专门试一下"让语音办事"这条路,可以去 Viora 官网[12] 看看,也可以直接 下载 Viora for Mac[13],免费档装上不用注册。要是名单里别的更合你的用法,那就用那个。我更希望你用上真正合适你的工具,而不是装了我们的然后再也不打开。

想看更系统的版本,可以读我们站上的 Mac dictation guide[14],或者先搞清楚 What is Viora[15]。


来源。Apple 官方的听写和功能页,以及 Superwhisper、Wispr Flow、Typeless、Viora、Voibe、Willow Voice、Aqua Voice 各家官网的公开定位(2026 年 6 月核对)。Monologue 和相邻类别(会议记录、文件转录、浏览器免费、Windows 专业、Mac 助手)按公开定位归类,没有逐一细测,具体以各家官网为准。文中的 ASR 流水线、端侧与云端、后处理与意图路由属于通用技术说明。Viora 的架构按处理位置和模式描述,不点名具体模型供应商。本文是 Viora 团队视角,已在开头标了利益相关。价格和合规以各家官网当前页面为准。

References

  1. superwhisper.com: superwhisper.com/
  2. Viora vs Superwhisper: viora.io/compare/sup…
  3. wisprflow.ai: wisprflow.ai/
  4. typeless.com: www.typeless.com/
  5. Viora 价格页: viora.io/pricing
  6. voice dictation for macOS: viora.io/features/di…
  7. getvoibe.com: www.getvoibe.com/
  8. willowvoice.com: willowvoice.com/
  9. aquavoice.com: aquavoice.com/
  10. monologue.to: monologue.to/
  11. voice AI assistant vs dictation software: viora.io/blog/voice-…
  12. Viora 官网: viora.io
  13. 下载 Viora for Mac: viora.io/download
  14. Mac dictation guide: viora.io/blog/mac-di…
  15. What is Viora: viora.io/blog/what-i…