Instinct,硅谷突然爆火的 AI 私人助理

0 评论 125 浏览 0 收藏 13 分钟

还没正式开放的 Instinct 正用短信和电话帮人处理邮件、订票、买菜甚至筹备婚礼,估值在几周内从5亿美元冲到25亿美元。这个23岁创始人 Noah Shinn 带来的不只是新交互,更把 AI Agent 的可靠性与信任问题推到了台前。

硅谷最近有一个突然爆火的 AI 产品叫 Instinct,https://instinct.co/,目前甚至都没有正式对公众开放。

它的“官网”就长这样

用户要做的事情,是先把邮箱、日历、短信、WhatsApp,以及设备的屏幕、音频、位置等权限交给它。

之后,你甚至不需要再打开 Instinct,只要像联系真人助理一样,给它发短信或者打电话:

“帮我处理一下邮件。”

“给我订一个今晚的中餐餐厅。”

“重新找一张便宜一点去非洲的机票。”

接下来,它不告诉你应该怎么做,它直接替你做完了。

今年2月,Instinct 才开始私人测试,到了8月,硅谷投资人们就突然开始密集讨论这家公司。

8月初,公司刚以超过5亿美元估值完成一轮融资;几周后,新一轮2.5亿美元B轮融资又把估值推到了 25亿美元,累计融资达到3.5亿美元。

也就是说,这家公司的产品仍然处于邀请制测试阶段,估值却在几周里涨了接近5倍。

同时,Instinct 的创始人 Noah Shinn 只有23岁。

01 一个几乎不需要打开的 AI 产品

过去两年,我们已经看过太多所谓的 AI Agent(的视频演示)。

AI 打开浏览器,自己点击网页、填写表格、搜索航班、操作软件。演示视频都很惊艳,但真正到了普通消费者手里,还有很多问题:

需要安装复杂环境,需要不断确认步骤,任务执行一半可能失败,最后用户还是得坐在电脑前盯着它。

而 Instinct 在做的,就是试图把这些复杂性全部藏起来。

Instinct 官网对产品的描述很简单:

Instinct 会连接用户的应用和设备,理解你正在做什么、什么对你重要;它被训练成像人一样使用手机和电脑,而用户与它交流的方式就是短信和电话

换句话说,它没有让用户学习一种新的 AI 交互方式,而是把 AI 塞进了一种已经存在几十年的关系里:

你有一个私人生活助理,有事情直接告诉他去处理就行。

比如你晚上临时想吃一家餐厅,你可以直接告诉 Instinct:

“帮我看看今晚 8点附近有没有不错的意大利餐厅。”它可以搜索餐厅、寻找位置,甚至完成预订。

要出差时,也可以让它查航班、重新订票、安排去机场的车;

邮箱太乱,可以让它整理邮件、跟进之前遗漏的事情;

此外,生活里还有买菜、买演唱会门票、取消订阅、找维修工、比较保险和寻找出租公寓等任务,都可以交给它。

Instinct 创始人后来披露了一些测试用户的真实使用方式

有人让它规划跨美国公路旅行,有人每周让它买菜,有人让它购买演唱会门票,还有人让它把长期不用的订阅一个个取消掉,省下几百美元。

甚至已经有人开始让 Instinct 帮忙筹备婚礼。

这些任务单独拿出来,其实没有一个是特别新颖的。

真正的变化在于,过去需要分别打开邮件、日历、航空公司、餐厅预订、电商、打车等多个 App 完成的事情,现在被压缩成了一个电话或者一个短信。

但是,从“回答问题”到“完成任务”,看起来只差几个字,实际上意味着 AI 产品需要获得完全不同级别的权限。

02 23 岁的创始人,一直在研究“AI 怎么把事情做对”

Noah Shinn 的背景,也让 Instinct 这家公司颇有意思。

他曾在(美国)东北大学和 MIT 从事机器学习和程序语言研究,后来加入企业AI Agent公司Sierra,而且是公司很早期的员工之一。

2023年,Shinn 还是论文 Reflexion 的第一作者,这项研究讨论的就是一个后来对 AI Agent 非常重要的问题:

当 AI 执行任务失败之后,能不能总结自己的错误,把经验存下来,并在下一次行动时改善结果,而不是每次都从头开始。

这篇论文后来被 NeurIPS 2023 收录。

在 Sierra 期间,他又参与开发了一个叫 τ-bench 的 AI Agent 测试标准。

这个测试不只是问模型一道数学题,而是故意让 Agent 处理更接近真实世界的事情。

比如用户要求修改机票。

AI 不仅需要理解要求,还要查询航空公司的规则、调用订票系统、找到合适航班、和用户确认信息,最后真的把数据库里的订单修改正确。

当时测试发现,即使是最先进的模型,在这些真实任务上的单次成功率也不到50%;如果要求同一个任务连续成功 8次,成功率甚至会跌到 25%左右。

这段经历其实很好地解释了 Instinct 这个产品。

Shinn 不是从“给聊天机器人加几个插件”开始做私人助理,而是过去几年一直在研究一个问题:

怎么让 AI 从会说话,变成可靠地使用工具完成任务。

也就是说:

一个研究 Agent 可靠性的创业者,现在做出了一个能力越来越强的 Agent;而它刚刚爆红,最先暴露出来的,恰恰还是可靠性和信任问题

03 AI 越有用,需要交出去的东西就越多

Instinct 最吸引人的地方,与它最危险的地方,是同一件事。

它知道得很多,而且可以替你行动。

为了做到这一点,用户需要允许它访问邮件、消息、日历、屏幕、音频和位置等信息。

查看 Instinct 的服务条款后发现,其条款一度允许公司获得非常广泛的用户数据使用许可,包括存储和使用用户材料训练模型;设备数据还可能涉及屏幕截图、鼠标移动和键盘输入。

条款甚至允许 Instinct 代表用户进入某些“协议、承诺或交易”。

问题很快就在测试用户身上出现了。

创业者 Claire Vo 断开了 Instinct 与 Google 账户的连接,但几小时之后,她仍然收到了 Instinct 生成的邮箱摘要。

她随后询问 Instinct 发生了什么,发现此前读取的部分邮件已经被保存到了 Instinct 自己的记录里,因此关闭连接并不意味着之前的数据立即消失。

另一名测试者 Peter Yang 也发现,自己当时无法直接删除 Instinct 已经索引的 Gmail 数据。

事件曝光后,Instinct 增加了删除外部数据的功能。

但更麻烦的问题来自所谓的提示词注入攻击

Hello Patient 联合创始人 Alex Cohen 专门创建了一个新邮箱,然后给自己的真实邮箱发送一封包含针对 AI Agent 指令的邮件,用来测试 Instinct 会不会把邮件正文里的恶意文字误认为应该执行的命令。

测试之后,他直接删除了自己的 Instinct 账户。

这种攻击对于普通聊天机器人影响可能有限,但如果一个 Agent 同时拥有你的邮箱读取权限、购物权限、支付信息和网页操作能力,事情就完全不同了。

比如,以前的钓鱼邮件,是想骗点击链接;而未来的钓鱼邮件,可能直接骗你的 AI 助手执行操作。

还有一个案例更加简单,也更能说明问题。

Moxxie Ventures 创始人 Katie Jacobs Stanton 使用 Instinct 处理个人事务时,Instinct 曾经没有再次征得确认,就直接替她发送了一封邮件。

邮件本身并没有造成严重后果,但她随后断开了邮箱权限。

她对这件事的总结很贴切:

一个 AI 连续正确完成很多任务,才能慢慢建立信任;但一次未经授权的行动,就足以把这种信任重新降到零。

这可能也是所有消费级 AI Agent 接下来都绕不过去的问题。

04 私人 AI 最大的门槛,已经不是“聪明”

从融资速度看,资本市场显然非常相信这条路线。

Instinct 本月早些时候完成 7500万美元 A 轮融资,当时估值刚超过 5亿美元。

几周之后,Benchmark 和 Index Ventures 又联合领投 2.5亿美元 B 轮,公司估值达到 25亿美元。

而它现在甚至还只是一个邀请制产品。

所以这个估值目前更多反映的是投资人对于“私人 AI 入口”的预期,而不是一门已经被验证的生意。

但 Instinct 确实已经把一个此前比较抽象的趋势变得很具体:

过去的软件需要你自己操作,搜索引擎帮你找到机票,你自己购买;外卖 App 给你展示餐厅,你自己下单;邮箱帮你收到邮件,你自己决定怎么回复。

Agent 的逻辑则完全不同。

它首先需要理解你的习惯、关系、日程和偏好,然后代表你去使用这些软件。

这意味着未来真正有价值的私人AI,掌握的可能不仅是一个聊天入口,而是用户生活中的三个东西:

上下文、权限和行动权。

而一旦这三个东西集中在同一个 AI 手里,用户就会开始问另外几个问题:

  • 它会不会做错?
  • 它什么时候必须征得我的确认?
  • 它记住了我多少东西?
  • 我删除的数据真的删除了吗?
  • 一封恶意邮件,能不能骗它替我做一件事?

以上,祝你今天开心。

作者:张艾拉 公众号:Fun AI Everyday

本文由 @张艾拉 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!