一款语音输入法值 20 亿美元,Wispr 为什么敢抢所有 AI 的输入框?

1 评论 93 浏览 0 收藏 15 分钟

Wispr Flow以2.8亿美元B轮融资将估值推至20亿美元,核心赌注不是更准的听写,而是占据AI时代的意图入口。从语音输入到会议摘要再到可穿戴设备,三层路线指向同一个目标:在发送按钮之前截获模糊想法。

上周,一款语音输入法拿到了 2.8 亿美元 B 轮融资,估值 20 亿美元。它叫 Wispr Flow。把键盘上的文字改成对着电脑说话,这项功能已经被行业做了很多年。投资人这次押下的,显然超出了一款更准确的听写工具。

Wispr 想占住的位置更靠前。每次你准备给同事回消息、给 Claude 写提示词、整理一场会议,甚至只是在脑子里冒出一个还没成形的念头,它都希望成为第一个听见的人。

AI 公司争了三年谁更聪明,下一场争夺已经移到另一个问题。人到底怎样把意图交给 AI。

01 20 亿美元买到的是什么

这笔融资由 Menlo Ventures 领投。加上此前轮次,Wispr 累计融资 3.61 亿美元。公司称,用户已经通过 Flow 说出了超过 600 亿个单词,产品进入超过一万家企业,使用者来自几乎所有《财富》500 强公司。

Fortune 给出的另一组公司口径更夸张。Wispr 已有数百万消费者和十万家企业用户,连续四个季度收入增长均超过 150%。这些数字没有经过公开财务文件审计,却足够解释资本为什么突然加速。

20 亿美元估值押注的三层价值,从听写习惯走向意图入口

Wispr 在 2021 年成立。最初三年,它做的是可穿戴设备和无声语音,希望通过神经与肌肉信号,让人不张嘴也能控制电脑。技术很炫,团队自己却不常用。后来他们又做出一个能订餐、发邀请的语音助手,使用频率仍然只有几周一次。

公司后来做出一款朴素得多的产品,命运随之改变。先把每天发生上百次的打字替掉。

Wispr 公布的产品使用曲线,累计 600 亿个单词,错误率下降六倍

这段绕路很重要。过去的语音创业公司喜欢从终点开始,先造一个什么都能做的贾维斯。Wispr 从最窄、最高频的一步重新出发。听写带来日常习惯,习惯带来上下文,上下文才有机会变成行动。

市场给出的 20 亿美元估值,可以拆成三层。第一层是已经成立的语音输入业务。第二层是用户每天反复打开形成的入口。第三层仍在想象中,它要把输入框升级成理解意图并调度 AI 的操作层。

02 语音等了 15 年,缺的不是速度

人说话通常比打字快四到五倍。这个优势从 Siri 和 Alexa 诞生时就存在。语音仍然没有替代键盘,原因也很直接。一次看似微小的错误,就会打断整段表达。

键盘很慢,却可预测。按下哪个键,屏幕上就出现哪个字。语音产品只要把人名、数字或专业术语听错一次,用户就要停下来找错误、删掉、重说。省下的十秒,很快被修正成本吃光。

Wispr 给自己设的北极星指标叫 零修改率。它同时统计词错率和一段听写能否不经编辑直接发送。同一个词被用户纠正两次,系统应该永远记住。

这比做出一场漂亮演示难得多。演示追求十分钟里的惊艳,输入法要经受一天几百次调用。前者允许偶尔翻车,后者每次翻车都在消耗习惯。

Canto 在最困难测试条件下把词错率从 30% 以上降到 5% 至 10%

Wispr 在融资同时发布了自研语音模型 Canto。按照公司测试,在背景噪声、重口音和生僻词等最困难条件下,词错率从 30% 以上降到 5% 至 10%。公司预计,需要修改的听写会再减少 30% 到 35%。

这里也藏着一个容易被忽略的产品判断。语音入口的护城河未必来自一次识别有多准,更可能来自每次纠错都被记住。 通用模型能迅速补齐平均能力,很难自动拥有你的姓名表、工作语境和表达习惯。

03 从文字到行动,中间隔着上下文

8 月 5 日,Wispr 推出 Notetaker。这是它第一次公开跨出听写。产品不派机器人加入 Zoom 或 Meet,而是在本机捕捉会议,结合日历里的人名、个人词典和实时转写生成摘要与行动项。

Wispr Notetaker 在本机捕捉会议,把对话转成摘要和行动项

Notetaker 看上去属于一个已经很拥挤的会议记录市场。Granola、Fireflies、Read AI 都在这里。它对 Wispr 的意义却不同。听写只能看见你说出的句子,会议能暴露谁在讨论、事情怎样推进、接下来需要做什么。

这正好接上 Wispr 的三阶段路线。

Wispr 的三步路线,先建立可靠输入,再进入行动,最后延伸到可穿戴设备

第一阶段用可靠听写建立信任。第二阶段让语音触发行动。第三阶段把这套交互带进耳机、戒指、眼镜等设备。

路线图里有一句话,讨论的甚至不是那些清晰命令。订一家餐厅、设置一个闹钟,需求明确,传统助手也能做。人类更多的想法处在模糊地带。比如你说,最近一直在考虑重组工程团队。你还没有给出任务,只暴露了一团尚未整理的意图。

一套可用的语音操作层,需要先保存这团模糊信息,再结合日历、文档、对话对象和过去决定,逐渐提出下一步。它接收的单位从一句命令变成一段持续生长的上下文。

最值钱的入口,可能藏在发送按钮之前。那时,一个想法还没有被整理成提示词。

04 一条越来越私人的数据飞轮

如果 Wispr 只做语音转文字,Apple、Google、OpenAI 或任何操作系统厂商都能把能力塞进系统。创业公司的窗口来自个性化。

你纠正过的名字、常用缩写、写邮件时的语气、对不同同事的称呼、在哪个应用里说了什么,这些细小反馈不断降低下一次修改成本。用得越多,系统越像你的输入层。迁移到另一个工具,会同时丢掉词典与长期积累的表达记忆。

语音入口的数据飞轮,更多使用带来更多纠错与上下文,最终提高零修改率

这条飞轮解释了 Wispr 为什么执着于高频输入,而没有一开始就做万能助手。一个每周调用一次的助手,拿不到足够密集的反馈。一个每天工作数小时的输入层,可以观察用户接受了什么、改了什么、最后发出了什么。

融资公告把目标写得很直白。Wispr 要做一层独立于模型的智能路由,根据质量、延迟、成本和体验,把任务交给不同模型或工具。它想站在 Claude、ChatGPT 以及各种应用前面,先理解用户,再决定后端该调用谁。

投资人兴奋的正是这个位置。大模型提供智力,应用提供执行工具,Wispr 试图拥有两者之间最靠近人的那层上下文。

05 越靠近人,隐私成本越高

同一条数据飞轮也构成了 Wispr 最大的风险。

语音输入会经过邮件、私聊、提示词和内部文档。Notetaker 还会处理参会人的声音、姓名、对话和行动项。为了提高准确率,Context Awareness 可以读取当前应用窗口里的相关文字。产品越懂你,越需要接触那些原本不会集中在一家公司手里的信息。

Wispr 的最新数据控制页面写明,转写始终在云端完成。用户可以关闭用于模型改进的数据共享,也可以控制听写数据是否进入云端存储。第三方模型供应商受零数据留存协议约束。Notetaker 的转写为了跨设备同步和恢复会议,会保存在 Wispr 的私有云中,保留期限由用户设置。

这里需要把营销承诺和真实选择分开看。公司强调用户拥有数据、不会出售数据。面向个人用户的最新帮助文档同时显示,初次引导里的“帮助所有人改进模型”选项为预选,用户可以改成不共享。企业版则默认关闭训练用途,并允许管理员统一执行。

这类产品的信任无法靠一句隐私优先解决。默认设置是否克制,数据路径能否看懂,删除是否彻底,出现质量波动时能否解释,都会直接决定用户愿不愿意继续把未完成的想法交出去。

06 Wispr 最难打败的对手,是操作系统

Wispr 有一个漂亮的创业公司叙事。大厂把语音当功能,它把语音当全部业务,因此能在最后 5% 的准确率和交互细节上投入更多。

这个优势真实存在,窗口却未必很长。语音天然依赖麦克风、系统权限、活动窗口和输入框。Apple、Google、Microsoft 已经占住这些底层位置。OpenAI 和 Anthropic 则控制用户最常交谈的 AI。任何一方把足够好的听写、记忆和行动合在一起,都可能截走 Wispr 的入口。

Wispr Advanced Interfaces Lab 把目标从语音转文字推向理解意图与生成界面

Wispr Advanced Interfaces Lab 的负责人 Ariya Rastrow 曾参与早期 Alexa。他给出的判断很准确。AI 的瓶颈正在从后端智力转向人与智力之间的界面。未来的系统会把语音、视觉、记忆、上下文和生成式界面放在一起,直接产出结果。

问题随之变得尖锐。Wispr 能否在大厂补齐体验前,用零修改率建立足够深的习惯,用个人上下文形成足够高的迁移成本,再把 Notetaker 这样的单点产品连成一个操作层。

20 亿美元估值押的就是这个时间差。

键盘不会突然消失。语音也不会因为融资变成新的操作系统。但当人类开始同时管理五个、十个 AI Agent,逐个打开输入框、整理背景、写出精确提示词,会越来越像一种过渡形态。

那时最自然的交互,也许是直接说出一个还不完整的想法。系统知道你正在看什么、刚和谁开过会、过去做过什么决定,再把模糊意图变成可检查的行动。

如果这个未来到来,今天看似普通的语音输入法,就不再只是替代键盘。它会成为每一个 AI 共同的前门。

资料来源

Wispr Flow 融资公告与 Canto 模型说明,2026 年 8 月 17 日

Wispr Flow Master Plan,2026 年 3 月 3 日

Wispr Flow Notetaker 产品公告,2026 年 8 月 5 日

Wispr Flow Advanced Interfaces Lab 公告,2026 年 7 月 24 日

Wispr Flow Data Controls 与 Privacy Policy,2026 年 8 月更新

TechCrunch 对 Wispr B 轮融资与竞争格局的报道,2026 年 8 月 17 日

Fortune 对 Wispr 创业路径、用户规模与融资的报道,2026 年 8 月 17 日

本文由人人都是产品经理作者【深思SenseAI】,微信公众号:【深思SenseAI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自作者提供

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 语音输入再聪明,也替代不了键盘的“静音”场景。办公室和图书馆里对着电脑说话,真的很不自然,而且很多念头是打字过程中才逐渐清晰的。直接把想法说出来,反而可能少了那种边敲边想的整理感。所以Wispr或许能拿下“独处、口语化、不用长时间沉默”的场景,但要把所有输入框都变成语音,大概率不会发生。

    来自广东 回复