FluidVoice:macOS 上最快的本地语音听写,开源免费平替 Wispr Flow

1 评论 301 浏览 0 收藏 16 分钟

你刚在会议室里录完一场客户需求讨论,打开 Wispr Flow 准备转录,发现免费额度刚好用完。续费页面弹出来:$12/月。你不是付不起这 12 刀,你是不爽。你说的话为什么要先传到别人的服务器才能变成文字?这个不爽就是 FluidVoice 存在的理由。

它是 GitHub 上一个开源 macOS 语音听写应用,截至 2026 年 7 月已经积累了超过 5000 Stars,最新版本 v1.6.1。和 Wispr Flow 做的事一样:你说,它写。区别在于 FluidVoice 的语音识别全在本地跑,数据不离开你的 Mac。8 个语音模型随便选,从 75MB 的轻量 Whisper 到 1.4GB 的高精度 Cohere Transcribe。

还有一套叫 Fluid Intelligence 的本地 AI 增强模型,3.5GB 下载后能自动帮你格式化、加标点、智能大写,整个过程你的语音数据没上传过一个字节。这个定位让它直接对标了 macOS 语音听写的几个主流选择,而它的筹码只有一个:本地优于云端。

这张对比表里最刺眼的一行是价格:Wispr Flow 每月 12 刀,SuperWhisper 要 8.49 刀或 249 刀买断,FluidVoice 零。但价格不是我最在意的点。真正让我决定写这篇文章的,是它选择的架构路线:100% 本地推理,连增强模型都可以不下云。

为什么值得关注

FluidVoice 不是一个普通的”又一个语音输入法”。它在 macOS 语音听写这件事上做了几个很少见的选择。

首先是模型自由度。 大多数商业听写工具给你一个模型,爱用不用。FluidVoice 给了 8 个。从 NVIDIA 的 Nemotron Speech 3.5(约 40 种语言流式听写)到 NeMo 团队重建的 Parakeet Flash(近乎零延迟的英语听写),再到 Cohere Transcribe(14 种语言高精度)和 Apple 原生 Speech 引擎(零下载,系统自带)。

你要延迟低就切 Parakeet Flash,要准确率高就上 Cohere,要兼容旧款 Intel Mac 就用 Whisper。这种选择权在语音听写领域不常见,通常只有付费工具才让你挑模型。而 FluidVoice 把这种选择权免费交给你,这在同赛道上是一个真正的差异化点。

然后是 Fluid Intelligence。 它是 FluidVoice 团队单独维护的本地 AI 运行时,能把原始转录结果做一轮智能增强。比如你说”schedule a meeting at three pm tomorrow”——转录出来是原始文本,增强后变成”Schedule a meeting at 3:00 PM tomorrow”。大写、标点、数字格式全给你理好。这个模块是闭源的,团队的解释是:核心听写免费开源,增强层靠私有化维持开发,未来不排除开源。目前已有超过 3.5GB 的增强模型在本地运行,对听写体验的提升确实显著。

Command Mode 和 Write Mode 的双模式设计也值得提。 语音听写工具大多只有转录功能,把你说的话原样搬到屏幕上就完事了。FluidVoice 把”说写”和”说做”分开了。Write Mode 在任何文本框直接写字或重写已有内容,Command Mode 让语音控制 Mac 启动应用、运行快捷指令、触发系统操作。给不同 App 分配不同的提示词集这个设计很聪明,写邮件和写代码时你对格式的要求不一样,FluidVoice 允许你分别配。

这三件事加在一起,FluidVoice 给我的感觉不是一个语音输入法,更像一个本地优先的语音工作流基础设施。它关心的不只是”把语音变成字”这一件事,而是你说了之后电脑应该怎么反应。不过,说到这里你可能觉得它什么都好。但功能说得再漂亮,装起来才知道是不是那么回事。

上手什么感觉

装起来很简单,一行 Homebrew 命令就能搞定:

brew install --cask fluidvoice

打开后的引导流程设计得相当清爽。先授麦克风权限,再授辅助功能权限(向其他 App 输入文字需要),然后选一个语音模型等下载,最后设置全局热键。整个过程没有晦涩的配置项,每个步骤都带一句话说明,1.6.0 版本专门优化过的 onboarding 体验确实用了心。如果你的 Mac 是 Apple Silicon,建议从 Parakeet TDT v3 开始,500MB 左右下载量,25 种语言支持,延迟和准确率平衡得最好。只想英文的话 Parakeet Flash 更快,250MB 几乎零延迟。

# 设置完成后,在任何 App 的文本框里按下设置的快捷键
# 开始说话,松开热键,文字自动插入光标位置

如果你需要本地 AI 增强,在设置里下载 Fluid Intelligence 模型。3.5GB 不小,建议连 Wi-Fi 的时候先让它跑着,不要用热点。

说到模型,选哪个直接影响体验。8 个模型的体积差距很大,少到 75MB 的 Whisper Tiny,多到 3.5GB 的 Fluid Intelligence,不是越大越好,要看你的语言、硬件和延迟要求。

从上图能看出来,纯英文用户的最佳路线是 Parakeet Flash(250MB 极低延迟),多语言首选 Parakeet TDT v3(500MB 性价比最高),追求极致准确率再考虑 Cohere Transcribe(1.4GB)。别上来就下 Cohere,先试试小的管不管用。

几个常见卡点。Intel Mac 只能用 Whisper 模型,其余都限制 Apple Silicon,README 里写了但藏在模型对比表里,不太显眼。首次下载大模型时网络慢的话体验很差,Cohere 的 1.4GB 包在百兆宽带下也得等几分钟,进度条也没给个时间预估。第三,Fluid Intelligence 是闭源的这件事在开源社区确实引起了争议,GitHub Issue 里有人问过会不会开源,维护者回复大意是”目前靠它维持免费开发,以后再说”。这话不讨所有人喜欢,但至少是实话。

什么时候用,什么时候别用

场景 典型用户 优势 局限
日常写作与灵感捕捉 写作者、内容创作者 Write Mode 无缝嵌入写作流程,无网络也工作 对中文的增强效果不如英文
会议记录与办公 商务人士、PM 本地处理保护敏感内容,Audio History 可回溯 多人说话不加区分,纯单人听写
隐私敏感场景 律师、医生、记者 全本地运算,零数据上传 Fluid Intelligence 闭源,安全审计无法全链路
多语言听写 多语言工作者 40+ 语言支持,模型可切换 中文增强尚不如英文成熟
语音控制 Mac 效率控、有障碍用户 Command Mode 启动应用跑快捷指令 仅限 macOS,不支持 iOS/Windows

下面几种情况下这个工具不是最优解,对应的替代选择一并标出:

多人会议角色转录 → Otter.ai 或飞书妙记
对开源有洁癖 → 可接受纯听写,但绕过 Fluid Intelligence 增强
Windows / Linux 用户 → 官方规划中但无时间表,建议持续关注

信息都摊开了,剩下的问题是:这个项目能不能活到 iOS 和 Windows 版发布那天?

社区怎么样了

指标 数据 说明
Stars ~5,400(截至 2026-07) v1.6.0 Parakeet 重建后有明显增长,6 月底曾单日 +830
核心维护者 2-3 人(altic-dev 团队) Bus Factor 偏低,但响应速度不慢
最近 30 天 Commits 活跃(898 total) 2026-07-21 仍有新提交,迭代频率健康
协议 GPLv3 2026-02-23 从 Apache 2.0 改协议,旧版本可继续用 Apache 2.0

Stars 数不算惊人,但增速值得注意。v1.6.0 的 Parakeet 重建让这个项目连续几天上了 GitHub Trending,单日最高增 830 Stars。这不是那种靠营销推上去的数字,是因为 Parakeet 的”几乎零延迟”确实击中了 macOS 用户的痛点。对比同类项目:Wispr Flow 虽然用户基数大得多,但它不开源也不免费,社区贡献几乎为零。SuperWhisper 有更精美的 UI 和买断制选项,但同样闭源。FluidVoice 的开源属性让它有机会吸引那些愿意贡献代码的开发者,这是闭源竞品永远做不到的。

从 Issue 区的风格可以看出维护者是认真在做开源。README 里给了完整的 PR 规范、pre-commit hook 建议和 CI 测试命令,对想贡献代码的人算友好了。Discord 社区大约活跃,主要是功能反馈和模型效果讨论,气氛不错,维护者偶尔出没回消息。值得关注的是该项目最近从 Whisper 迁移到了自研的 TranscribeCpp 后端,用 GGUF 格式加载模型,这套基础设施的搭建说明团队不满足于”调个开源模型的壳”,而是在认真做底层优化。

Reddit 上有一条评论我印象很深:“I cancelled my Wispr Flow subscription 2 days after installing FluidVoice. The Parakeet Flash model is faster than Wispr on my M2.”(“装了 FluidVoice 两天后我取消了 Wispr Flow 订阅。Parakeet Flash 模型在我的 M2 上比 Wispr 还快。”)这条评论的点赞数不高,但指向了一个事实:本地推理在 Apple Silicon 上的延迟已经足以和云端服务掰手腕了。

我的真实看法

我对 FluidVoice 的基本看法是:它在做一件对的事,macOS 语音听写的本地化,而且做得比预期中好。Parakeet 重建这件事说明团队有技术深度,不是简单把开源模型包个壳。能在 Apple Silicon 上实现近乎零延迟的本地 STT,这需要的工程能力不是”调个 API”能比的。但它的风险也很清楚,拆开看有三层:

  • 协议风险:GPLv3 改协议加上 Fluid Intelligence 闭源,这个组合在开源社区有争议。如果你打算基于 FluidVoice 做二次开发或商业集成,GPLv3 的传染性是个需要考虑的问题。如果你是个人用户,这件事对你的影响是零。
  • 团队规模:2-3 人的团队维持一个跨 8 个模型、4 个平台的雄心,时间长了撑不住的概率大于撑得住的概率。目前 macOS 版迭代很稳,但 iOS、Windows、Linux 三条线拉起来后,质量能不能维持是个问号。
  • 闭源核心:Fluid Intelligence 不开放代码,意味着即使你是开发者,也无法审计增强层的具体逻辑。团队说明了这是为了维持免费开发,这个理由可以理解,但不代表没有风险。如果未来 Fluid Intelligence 转向收费,或者团队放弃维护,这部分本地增强能力就会变成一个黑洞。

趋势上我看好。本地 AI 推理是 2026 年最明显的技术方向之一,从 LLM 到 TTS 到 STT,所有能下本地的模型都在往下走。FluidVoice 踩在这个趋势上,而且它在 macOS 语音听写这个细分赛道目前没有同级别的开源竞品。SuperWhisper 和 Ottex 也是本地方案,但都不开源,也不免费。所以 FluidVoice 的窗口期还在,关键是能不能在这段时间把社区做厚、把维护者团队扩起来。判断做完了,该说点实用的了:你到底要不要装一个?

资源地址

资源 地址
GitHub https://github.com/altic-dev/FluidVoice
官网 https://altic.dev/fluid
Discord https://discord.gg/VUPHaKSvYV

资源就这些。但怎么用、从哪开始,比链接本身更重要。

先用 Parakeet Flash 跑起来

如果你有一台 Apple Silicon Mac,升级到了 macOS 15,我的建议很直接:装一个。brew install --cask fluidvoice,选 Parakeet Flash 模型,设个顺手的热键。先别管 Fluid Intelligence,用纯听写模式跑几天,感受一下本地 STT 的延迟到底有没有传说中的那么低。等你习惯了语音输入的节奏,再下载 Fluid Intelligence 模型做增强,效果会更明显。

如果你在观望,盯两个信号。第一是 Fluid Intelligence 的开源进展,这件事决定了项目的长期可信度。第二是 iOS 版的上线时间,跨平台能力决定了它能走多远。这两个变量任何一个出现积极变化,都可能让 FluidVoice 从”好用的个人工具”升级为”靠谱的生产力依赖”。

嘴上说来都抽象。按住热键,说句话,看到字跳出来的那一刻,你大概就知道值不值得了。那个瞬间的延迟感,比任何评测文章和对比表格都更诚实,也更难被收费页面说服。

 

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. Fluid Intelligence闭源这个设计确实有点尴尬,一方面打着开源免费的旗号,一方面又把增强层锁起来。团队解释说是为了维持开发,对个人用户影响不大,但站在开源社区的角度,这就像只开了公共厨房的灯,却没把冰箱门打开。希望能早点看到开源进展,不然口碑上的裂缝会越来越明显。

    来自广东 回复