利益相关。 我是 Viora 团队的人。Viora 是这篇会讲到的工具之一,所以我有立场。掘金上的读者大多是工程师,糊弄不过去,所以我把话说前面。别人在某些技术点上做得比我们好,我直接说,也给你贴官网。你看完觉得别的更合适,那就用别的,这才对。文里关于 Viora 的架构,我只讲处理位置和模式,不点名具体的模型供应商,原因后面隐私那节会说。
先说个很多人都有的经历。三四年前在 Mac 上试听写,说了一句带"逗号"的话,屏幕上真打出"逗号"两个字,然后这功能再也没打开过。这不是 Bug,是那一代听写的设计就是给短输入用的。这两年才真的变好,所以值得重新看一看。
这篇不只是横评。我会先把听写背后的技术栈拆开讲,一段语音到底怎么变成字,端侧和云端差在哪,为什么自带听写"够用但难受"。把原理搞清楚,你再看那九款工具,就知道每一款到底在补哪个环节,而不是被宣传词牵着走。
Viora 在 Mac 邮件里听写,整理好的文字落进输入框,右上角是悬浮球
Viora 在 Mac 邮件里听写,整理好的字直接落进输入框,右上角那个是它的悬浮球。
先给结论(TL;DR)
- Mac 自带听写免费。发短消息、记笔记、填表单都够用。技术上它就是为短输入设计的,很多人不用再装别的。
- 写长一点就难受。标点要自己念,识别完没有后处理,打错了不好改,专有名词加不进去。这几条都有技术原因,下面讲。
- 想要离线、音频不出本机,看 Superwhisper,它支持端侧模型。
- 要跨 Windows 和手机,或者公司在意合规(比如医疗),看 Wispr Flow,它转写始终走云端。
- 主要写长文、最看重自动整理的,看 Typeless,云端实时处理后即删。
- 一直用 Mac,又想让语音不只是打字,看 Viora(我们做的)。它在 ASR 之上加了一层意图路由,同一个快捷键能写、能改、能问、还能调工具办事(查日历、搜索、连 Gmail 和 Notion 这些)。这几样在公开定位里明确主打的,这份名单里基本只有它。语言支持 100 种以上,不比别人少。
- 这几个之外还有不少工具(Voibe、Willow Voice、Aqua Voice、Monologue,还有做会议记录、浏览器免费、Windows 专业、Mac 助手的)。文章最后归好类。
下面先用一张大表给你全貌,再一层一层讲原理。
先上一张大表,九款放一起看
把自带功能和八款第三方放一起,多看几个维度。重点看右边三列,那是"语音能不能不只是打字"的地方,也是技术上最难做的地方。
| 工具 | 价格 | 平台 | 离线 | 自动整理 | 个人词典 | 选中改写、提问 | 能办事 | 记忆习惯 | 一句话点评 |
|---|---|---|---|---|---|---|---|---|---|
| 自带听写 | 免费 | 仅 Mac | ✅ 多数(看设置) | ❌ | ❌ | ❌ | ❌ | ❌ | 短输入够用,系统自带 |
| Superwhisper | 免费档,Pro 8.49 美元/月(另有年付、买断) | Mac、Windows、iPhone | ✅(Apple 芯片端侧) | ✅ 可调 | ✅ | ➖ | 🟡 半个 | ➖ | 离线优先,可买断 |
| Wispr Flow | 免费 2000 词/周,Pro 12 美元/人/月(年付) | Mac、Windows、iPhone、安卓 | ❌ 云端 | ✅ | ✅ | 🟡 | ➖ | 🟡 | 跨平台老牌,有医疗等合规 |
| Typeless | 免费 8000 词/周,Pro 12 美元/席/月年付 或 30 美元/月 | Mac、Windows、iPhone、安卓 | ❌ 云端 | ✅ 很强 | ✅ | 🟡 | ➖ | 🟡 | 长文整理是强项,免费额度大 |
| Viora(我们做的) | 免费档,Pro 20 美元/月 或 199 美元/年 | 仅 Mac | ❌ 云端 | ✅ | ✅ | ✅ | ✅ | ✅ | 语音不止打字、还能调工具办事,支持 100 种以上语言 |
| Voibe | 7.50 美元/月、59 美元/年、买断 149 美元 | 仅 Mac | ✅ 主打本地 | ❓ | ✅ | ➖ | ➖ | ➖ | 纯端侧,隐私优先 |
| Willow Voice | 免费 2000 词/周,Pro 12 美元/月(年付约 10 美元/月) | Mac、Windows、iPhone | ❌ 云端 | ✅ | ✅ | ➖ | ➖ | ➖ | 云端,主打快,含 iPhone |
| Aqua Voice | 免费 1000 词,Pro 8 美元/月(年付) | Mac、Windows | ❌ 云端 | ✅ | ❓ | ➖ | ➖ | ➖ | 云端,打开快,边说边出 |
| Monologue | 免费 1000 词,Pro 约 100 美元/年 | Mac、iPhone | 🟡 看设置 | 🟡 智能排版 | ❓ | 🟡 | ➖ | ➖ | 能看上下文,自动排版 |
看表小贴士,几个符号是这个意思。
- ✅ 有,或者能。
- ❌ 没有。
- 🟡 有一点,但不是主打(Superwhisper 那个"半个"也算,它的 Super 模式只是把你的话交给 AI 去答,不是真办事)。
- ➖ 没把这件事当卖点(公开定位就是听写,不代表一定没有)。
- ❓ 我没查到,各家也没明说。
价格是 2026 年 6 月去各家官网 pricing 页核对的,这类工具改价格很勤,下单前请以官网为准。
右边那三列,选中改写提问、能办事、记忆习惯,技术上要在 ASR 之上再搭一层意图判断和工具调用,工程量比纯听写大不少。在公开定位里把这三件都当主打的,这份名单里基本只有 Viora(别家没把这些当卖点,不代表完全没有)。这就是它和"纯把话变成字"的工具最大的不同。具体架构下面会展开。
先讲清楚听写背后的技术栈
这部分有点干,但搞懂了,后面选工具就不会被宣传词忽悠。
一段语音是怎么变成字的
一个现代听写工具,背后大致是这么一条流水线。
- 录音。按住快捷键,麦克风开始采集音频。
- VAD,语音活动检测。程序要判断哪段是人说话、哪段是静音,把音频切成一句一句。自带听写"说着说着就停了",本质就是它的 VAD 判定你停了几秒就自动收工,而且这个超时时间你改不了。
- ASR,自动语音识别。这是核心。声学模型把声音转成音素,语言模型再拼成最可能的句子。这两年很多工具的底座是开源的 Whisper 系列模型,识别效果比前几代好很多,这也是 Mac 听写体验突然变好的大背景。
- 后处理。原始 ASR 出来的是大白话流水账,没标点、带"嗯""那个"。新一代工具会在这一步再过一个大语言模型,补标点、去填充词、按场景改语气。这一层是体验差距的关键,下面单独讲。
- 注入。把最终文本塞回你当前的输入框。Mac 上一般通过辅助功能或者模拟键盘事件来落字。
一句原始输出和后处理之后的差别,大概是这样。
原始 ASR 输出(没有后处理)
嗯 那个 我们 周五 之前 把 报告 发出去 然后 再 同步 一下 进度
经过 AI 后处理之后
我们周五之前把报告发出去,然后再同步一下进度。
自带听写基本停在第 3 步,没有第 4 步那层 LLM。所以它出来的字是"对的",但不是"能直接发的"。
端侧还是云端,这是第一个分水岭
ASR 到底在哪台机器上跑,决定了隐私、延迟、和能用多大的模型。这是选工具最重要的一个技术维度。
- 端侧(on-device) 。模型跑在你自己 Mac 上,音频不出本机。隐私最好,断网也能用。代价是模型大小受设备内存和算力限制,长尾语言和复杂场景的准确率通常不如云端大模型。Apple 芯片的 NPU 让端侧 Whisper 跑得动,这是 Superwhisper、Voibe 这类工具的基础。
- 云端(cloud) 。音频传到服务器,用更大的模型识别。准确率和语言覆盖更容易做高,但音频离开了你的设备,断网用不了,还要算往返延迟。Wispr Flow、Typeless 走的是这条路。
- 混合。一部分端侧、一部分云端,按场景切。
这里有个常见误区,要替这几家说句公道话。云端不等于不安全,端侧也不等于一定慢。安全看具体怎么传、怎么存、用哪个模型,延迟看工程优化。别只看"云端"两个字就下结论。
为什么自带听写"够用但难受",技术上的三个原因
把上面的流水线套到自带听写,它的天花板就很清楚了。
- 没有后处理 LLM。它停在 ASR,不补标点、不去填充词。所以你得自己念"逗号""句号""换行",长句子念下来很累。
- 没有自定义词典。它的语言模型是固定的,你没法往里加词。同事叫 Nguyen,公司有个外人没听过的产品名,它会一直按发音猜错,你还教不了它。
- VAD 超时写死。几秒静音就自动停,时间改不了。你说话会停下来想,它就替你把句子结束了。
第三方工具,基本就是来补这三个洞的。
双模型 ASR 路由的简化示意,常用语言走自托管主模型,其余语言走云端兜底模型,合计 100 种以上
一个现代工具的 ASR 这一层可以做得更细。图为 Viora 的双模型路由(简化示意),常用语言走自己部署的主模型,其余长尾语言切到云端兜底模型,合起来覆盖 100 多种语言,两条路径都在云端完成。
自带听写,怎么开还有那个一定要改的快捷键
原理讲完,先把免费的用明白。不同系统版本设置位置略有差别,下面以 Sonoma 14 和 Sequoia 15 为例。
- 打开"系统设置"。(按住 Command 再按一下空格,输入"系统设置"。)
- 左边一栏往下滚,找到"键盘"。
- 右边中间,找到"听写"这一项。
- 把听写打开,给它麦克风权限。
现在任何输入框都能用。
但默认快捷键你大概率不想用。默认是"按听写键"或者"快连按两下 fn"。在同一个地方点"快捷键",挑一个"按住就说"的键,按住、说话、松手,像对讲机一样。下面这些都行,选一个不冲突的。
- 按住右边的 Command 键
- 按住 fn 键(每个 Mac 键盘都有,我推荐这个)
- 右边的 Option 键,或者右边的 Control 键
我们看过很多人配这一步,规律很清楚。挑了"按住就说"的人,一周后还在用。还用"连按两下"的人,基本就不用了。交互方式比识别准确率更能决定你会不会留下来。
然后点"语言",只加你真会说的那两三种。它会自动认语言,但不是万能的。你加了法语却从来不说,它偶尔会把一句话当成法语来认,结果一堆乱码。语言加得越多,识别时要在更多语言里做判断,认错的概率反而上升。
语音听写工具的设置页,麦克风、识别语言、快捷键都在一处,图为 Viora
这类语音工具的设置大致长这样(图为 Viora)。重点就两条,快捷键设成按住就说,语言只留你常用的。系统自带听写也是调这几项。
几个常见小问题。没出字,多半是没给麦克风权限,去"隐私与安全性"里的"麦克风"检查。认成别的语言,回"语言"里把不用的删掉。说着说着停了,是 VAD 超时,不是坏了。
至于命令,日常九成情况下面这几个就够,说 comma 出逗号、period 出句号、new line 换行、new paragraph 另起一段。要打引号说 open quote 和 close quote。如果你发现自己在一封邮件里念了四遍"句号 换行",那不怪你,这功能本来就不是为写长东西做的。
第三方工具到底在补哪三个技术洞
知道了流水线,就能看清第三方工具的价值不是玄学,而是补在具体环节上。
洞一,ASR 后面那层后处理 LLM
这是体验差距最大的地方。原始 ASR 给你的是流水账,新一代工具在它后面接一个大语言模型,做四件事,补标点和大小写、去掉"嗯""那个"、合并你说了一半又重说的句子、按当前应用换语气(在 Slack 里随意点,在邮件里正式点)。
判断一款工具行不行,主要看这一层。Typeless 把这层做成了主打,长文整理很强。Wispr Flow 的自动改字有四个力度可调。这层活基本都在云端做,因为要跑得动够大的语言模型。
洞二,自定义词典,技术上叫 biasing
自带听写最大的硬伤是加不了词。第三方怎么解决?常见有两种思路。一种是 hotword biasing,在解码时给词典里的词更高权重,让模型更倾向于识别成它们。另一种是把你的词表喂给后处理那层 LLM,让它在润色时把听错的专名纠回来。
对开发者特别有用,因为我们满嘴是 ASR 听不懂的词,Kubernetes、nginx、自家的服务名、英文缩写混中文。能不能加词,是自带和第三方差别最大的一点。这四款第三方都支持个人词典。
洞三,语音 Agent 层,意图路由加 tool calling
这是最新、也是技术上最重的一层。前面两个洞都还在"把话变成更好的字",这一层要让语音去"办事"。
实现上要在 ASR 之上再加一个意图路由。一段语音识别成文本后,先判断你这句是想写字、想改选中的内容、想问个问题、还是想让它去办一件事。判断完再分发到不同处理路径。如果是办事,就走 tool calling,模型把你的话翻译成对工具的结构化调用,比如查日历、发网络搜索、调一个第三方连接器,拿到结果再回给你。
这套和大家熟悉的 function calling、Agent 框架是一回事,只是入口从打字变成了语音。下面四款里,把这层当主打做的只有一款,另外三款公开定位还是听写。
一个快捷键四条路径,语音先识别再做意图路由,分别走听写、改写、提问、办事
语音 Agent 层的简化示意(图为 Viora 的做法)。同一个快捷键,识别完先做意图路由,再分流到听写、选中改写、就地提问、Agent 办事四条路。办事这条会走工具调用,结果显示在屏幕角上的卡片里。
四款第三方,按架构挨个老实说
先说一句。下面的价格和免费额度,是 2026 年 6 月我去各家官网看到的,这种工具改价格很勤,真要买之前自己再看一遍。合规那些(比如医疗要的 HIPAA),更要自己核实,别只信宣传页。
Superwhisper,端侧优先的代表
处理位置,端侧加云端双轨。 这是它最大的技术特点。官网说它能在你自己电脑上跑模型,音频不上传,这条端侧路径在 Apple 芯片上跑得最好。它也提供云端模型。所以隐私好不好,要看你选了哪条路、哪个模型,不是看牌子。
它没有的,是真正的"办事"那一层。它有个 Super 模式,是把你说的话交给一个 AI 去答,更像"用嘴问一下 AI",不是真去执行。你说"明天上午排个 30 分钟专注时间",它给你的是这句话的整理稿,不会真在日历上建好。
价格上 2026 年 6 月看,有免费档,Pro 每月约 8.49 美元,月付、年付、买断都有。什么时候选它,你在意端侧离线,或者宁可买断不想订阅,或者想自己挑本地模型。官网是 superwhisper.com[1]。想看和 Viora 的逐项对比,可以参考我们写的 Viora vs Superwhisper[2],这是我们的视角,记得对照官网。
Wispr Flow,全云端的跨平台老牌
处理位置,转写始终在云端。 这点它官网的 Data Controls 写得很明确,识别这一步永远在服务器做。好处是跨平台一致,Mac、Windows、iPhone、安卓都有,词库四端同步。它有 Privacy Mode,可以让你的转写内容不被存储、不拿去训练,但请注意这不等于"不收集任何数据",使用统计仍可能收集。
它的强项是后处理,自动改字四个力度,词库会学你的常用词,语气跟着当前应用变。如果你大部分字打进 Notion、Gmail、Slack,它围着这些场景打磨得最细。它还公开了一些企业合规(比如医疗在意的 HIPAA),具体以你和它签的合同为准。官网是 wisprflow.ai[3]。
Typeless,把后处理那层做成主角
处理位置,云端实时处理后即删。 按它的隐私政策,音频和内容在云端实时处理,处理完就删,所以别把它当离线工具。
它的重点全压在"洞一"那层后处理上,去填充词、把你东一句西一句的话理成条理、按应用换语气、多语言。如果你一天大部分时间在写长东西(邮件、文档、周报),它在整理上帮的忙最多。价格约每人每月 12 美元年付,月付约 30 美元,免费档每周 8000 字,是四款里最大方的。支持 Mac、Windows、iPhone、安卓。官网是 typeless.com[4]。
Viora,在 ASR 之上加了意图路由和工具调用(我们做的)
Viora 是我们的产品,我直说架构,有什么、没什么。
ASR 这一层,双模型路由。 上面那张 ASR 图就是它。最常用的一批语言走我们自己部署、做过重点优化的主模型,遇到它不擅长的长尾语言,自动切到云端的兜底模型,两个加起来覆盖 100 多种语言。中文这块还做了简繁自动处理,粤语会归一到中文。两条路径都在云端,所以我把丑话放前面,它不是离线工具。
ASR 之上,意图路由加工具调用。 这是它和纯听写最大的区别,也是上面第二张图画的东西。同一个按住就说的快捷键,识别完先判断你的意图,再分到四条路。
- 写。 走后处理 LLM 整理,落到光标处。
- 改。 选中一段文字,用嘴说怎么改,它替换掉原文。
- 问。 对着屏幕上的内容直接问,包括截屏选区,答案显示在屏幕角上一个叫 Capsule 的悬浮窗旁边。
- 办。 走 tool calling,能做网络搜索、查系统日历,还能连一批第三方服务。目前后端实现了 Agent 能读写的连接器是 Gmail、Google Calendar、Notion、Slack。你说"明天上午排个 30 分钟专注时间",它能真去帮你建。
还有个细节工程师会喜欢。默认 Fn 是按住录音,Fn+Ctrl 是强制进 Agent 模式,而且你正在听写的时候按上 Ctrl,能把这次听写直接升级成 Agent 任务。结果用一个叫 Agent Card 的卡片流式显示,工具跑到哪一步你看得见。
Viora 的 Agent Card,把语音办事的结果流式显示在悬浮球旁边
Viora 的 Agent Card。你说一件要办的事,工具调用的进度和结果就流式显示在 Capsule 旁边。
后端模型,聚合多家云端大模型按任务路由。 聊天、改写、Agent 推理用不同的模型来接,按任务挑合适的那个。具体用哪几家,我这里就不列清单了。这类供应商本来就会换,写死在一篇会过期的文章里没意义,以官网为准。这也是为什么我前面说,只讲架构和处理位置,不点名牌子。
价格上 Pro 每月 20 美元,或每年 199 美元,还有免费档,具体字数以 Viora 价格页[5] 为准(这块官网在调,我不写死)。一部分后台主动能力(比如定时任务、主动记忆这类)放在 Pro,前台的听写和 Agent 免费档就能用,确切的免费和 Pro 边界也以价格页为准。我们只有 Mac,Apple 芯片和 Intel 都行,没有 Windows 和手机版。
我们老实说没有的。 不能离线(识别在云端)、不提供本地 Whisper 模型、不支持自带模型 Key、没有公开 API、没有 HIPAA 合规。这几条里只要有一条是你必须要的,那这份名单里的答案就不是我们。官网是 voice dictation for macOS[6]。什么时候选它,你一直在 Mac 上,又想让语音不只是出字。
下面四款定位偏听写,我没像上面那样长期天天用,只讲定位和处理位置。
Voibe,纯端侧可买断
处理位置,主打全程在本机。 它比 Superwhisper 走得更彻底,就是不想让音频上传那一派。卖点是按住说话、隐私优先、能加词库、有开发者模式、可一次买断。2026 年 6 月看,月付约 7.50 美元、年付 59 美元、买断 149 美元(都是促销价)。你把端侧和隐私当必须,又喜欢买断,它值得放进候选。官网是 getvoibe.com[7]。
Willow Voice,又快又能跨手机
处理位置,云端。 给 Mac、Windows、iPhone 用,主打快。和 Wispr Flow 在"跨设备又快"上很像,差别看订阅价、隐私说法、iPhone 体验。免费档每周 2000 词,Pro 约每月 12 美元,年付能到每月 10 美元。要的就是快又要手机能用,看它。官网是 willowvoice.com[8]。
Aqua Voice,主打打开快、边说边出
处理位置,云端。 给 Mac 和 Windows 用,强调启动快、说话就出字,和 Willow 一样是"云端求快"这一类。免费档 1000 词,Pro 约每月 8 美元年付。最看重打开速度和实时,看它。官网是 aquavoice.com[9]。
Monologue,能看上下文、自动排版
处理位置,看设置,公开定位可能有本地选项(我没独立核实)。 给 Mac 和 iPhone 用,特点是能看屏幕上的内容、自动排版。免费档 1000 词,Pro 约每年 100 美元。这款我了解最少,以官网为准,官网是 monologue.to[10]。
开发者专属,在 Cursor 或 VS Code 里听写
既然在掘金,单独说一句开发者场景。
能不能在代码编辑器里听写?能。听写在系统的输入框里基本都能用,包括 Cursor、VS Code 这类。Wispr Flow 公开说支持 Cursor 和 Windsurf,其它几款一般靠系统把字塞进输入框,所以多数编辑器也能用。
但有两个现实问题。一是代码里的专名密度极高,函数名、包名、缩写,没有个人词典基本没法用,所以这是个"必须能加词"的场景。二是纯语音写代码并不顺手,符号和缩进念起来很别扭。更实际的用法是用语音写注释、写 commit message、写 PR 描述、在 issue 里长篇说明,以及对着一段报错直接问。这种"写散文 + 偶尔问一下"的活,语音比键盘快。
如果你常对着 AI 把一段话再加工成别的东西,那你其实想要的是语音 Agent 那条路,而不只是听写。
名单之外的工具,按需求归个类
下面这些经常被一起搜到,但干的活和"实时 Mac 听写"不完全是一回事。这一类我没一个个细测,给你归好类。
- 会议记录、文件转录(先录后转,不是边说边出)。 Otter.ai、Notta(能分辨说话人、出摘要)、Sonix(音视频转字、能翻译)、MacWhisper(在本机把文件转字,喜欢离线的会用)。你要的是把已经录好的内容转成字,看它们。
- 浏览器里用、又免费。 Google Docs 语音输入、Voice In(Chrome 插件)。只在浏览器或文档里用又想免费,看它们。
- Windows 专业工具。 Dragon Professional,Windows 上很成熟,能用语音下命令,有法律医疗词库。Mac 用户基本用不上,顺带一提。
- Mac 助手和系统控制(相邻,不是同一类)。 Raycast、ChatGPT 的 Mac 版、Claude 桌面版、Alfred,还有 Mac 自带的"语音控制"。这些是更大的助手、启动器或系统控制,和听写有重叠但目标不同。Viora 不替代它们,它是用语音来写、改、问、办事,不是启动器,也不做操控整个系统的语音控制。要打开软件、和 AI 聊天、或者用语音操控整台电脑,看它们。
怎么选,问自己四个问题
绕了这么多,最后归到四个问题,大概按这个顺序。
- 要跨平台吗? 又用 Mac 又用 Windows,或者想在手机上用,那名单就剩 Wispr Flow、Typeless,加上云端的 Willow Voice(有 iPhone)和 Aqua Voice。Superwhisper 也有 Windows 和 iPhone,但它最值钱的端侧模型在 Apple 芯片上才跑得最好。Viora 只有 Mac。
- 离线是必须的吗? "音频绝不离开我电脑"不能让步,那就看走端侧的 Superwhisper 和更彻底的 Voibe。自带听写在一些情况下也能在本机处理,但要按 Apple 当前设置和你的语言去核。Viora、Wispr Flow、Typeless 都是云端,直接排除。
- 你想让语音办事,还是只想出字? 你是不是老对着 ChatGPT 说话,让它拿你这段话再去做点别的?如果是,你要的是语音 Agent 那条路,这正是 Viora 在做的。如果语音对你就是"用嘴打字",剩下三款随便挑。
- 想订阅还是想买断? Superwhisper 和 Voibe 公开有买断。其余几款,包括 Viora,在我看到的公开页上都是订阅。
没有一个对所有人都对的答案。最常见的错,是图省事选了广告打得最响的那款,然后默默不打开,因为它根本不贴你的用法。掏钱之前,先用免费档用一个小时。想先搞清楚"语音助手"和"听写软件"到底差在哪,可以看我们这篇 voice AI assistant vs dictation software[11]。
几个常被问到的问题
2026 年 Mac 上最好的听写是哪款?
没有唯一答案。短输入用自带的。要端侧离线选 Superwhisper 或更彻底的 Voibe。要跨平台又需要企业合规,重点看 Wispr Flow。要快要手机,看 Willow Voice、Aqua Voice。写长文选 Typeless。想让语音办事,看 Viora。上面四个问题是最快的路。
Mac 听写能离线用吗?
自带听写在一些情况下可以在本机处理,但要看语言、地区、系统版本、在哪个框里打字,不是随时都能离线。第三方里,端侧能离线的是 Superwhisper 和 Voibe,其它多数是云端。
端侧和云端,识别准确率差很多吗?
不能一概而论。云端能上更大的模型,长尾语言和嘈杂环境通常更稳。端侧受设备算力限制,但 Apple 芯片上的体验这两年已经很好。真正拉开差距的,往往不是 ASR 本身,而是后面那层后处理做得好不好。
为什么我的 Mac 听写说到一半就停了?
它的 VAD 几秒没声音就自动停,这个超时改不了。你说话会停顿思考的话,按住就说的第三方更合适。
能在 Cursor 或 VS Code 里听写吗?
能。听写在输入框里都能用,包括代码编辑器。代码里专名多,建议选支持个人词典的工具,并且更适合用来写注释、commit、PR 描述,而不是硬念代码。
能给 Mac 听写加自己的词吗?
自带的加不了,它没有加词的入口。这四款第三方都能加词,用来记人名、产品名、专业术语。
Mac 上有免费的听写吗?
自带的就免费。Wispr Flow、Typeless、Viora、Superwhisper 也都有免费档或免费额度,选之前以各家官网为准。
写在最后
这篇是 Viora 团队写的,所以我把立场、架构、还有我们没有的东西都摆在前面了。两个诚实交代。一,我们这次没做严格的对比测试,所以文里关于准不准、快不快的话是大概的感觉,不是实验室结论。二,关于 Viora 后端用哪几家模型,我只讲了架构和处理位置,没点名具体牌子,这类供应商会变,以官网为准。
安静屋里说清楚话,上面这些选项日常都够用。差别主要在吵的环境、口音、专业术语、长句子,还有后处理那层整理得好不好。
如果你在用 Mac,又想专门试一下"让语音办事"这条路,可以去 Viora 官网[12] 看看,也可以直接 下载 Viora for Mac[13],免费档装上不用注册。要是名单里别的更合你的用法,那就用那个。我更希望你用上真正合适你的工具,而不是装了我们的然后再也不打开。
想看更系统的版本,可以读我们站上的 Mac dictation guide[14],或者先搞清楚 What is Viora[15]。
来源。Apple 官方的听写和功能页,以及 Superwhisper、Wispr Flow、Typeless、Viora、Voibe、Willow Voice、Aqua Voice 各家官网的公开定位(2026 年 6 月核对)。Monologue 和相邻类别(会议记录、文件转录、浏览器免费、Windows 专业、Mac 助手)按公开定位归类,没有逐一细测,具体以各家官网为准。文中的 ASR 流水线、端侧与云端、后处理与意图路由属于通用技术说明。Viora 的架构按处理位置和模式描述,不点名具体模型供应商。本文是 Viora 团队视角,已在开头标了利益相关。价格和合规以各家官网当前页面为准。
References
- superwhisper.com: superwhisper.com/
- Viora vs Superwhisper: viora.io/compare/sup…
- wisprflow.ai: wisprflow.ai/
- typeless.com: www.typeless.com/
- Viora 价格页: viora.io/pricing
- voice dictation for macOS: viora.io/features/di…
- getvoibe.com: www.getvoibe.com/
- willowvoice.com: willowvoice.com/
- aquavoice.com: aquavoice.com/
- monologue.to: monologue.to/
- voice AI assistant vs dictation software: viora.io/blog/voice-…
- Viora 官网: viora.io
- 下载 Viora for Mac: viora.io/download
- Mac dictation guide: viora.io/blog/mac-di…
- What is Viora: viora.io/blog/what-i…