Personal Agent 神仙打架 用五个维度看懂六条海外路线

0 评论 250 浏览 0 收藏 31 分钟

Personal Agent 赛道正上演六路争锋:OpenAI 想成为你的第二身份,Meta 接管生活交易,Google 调度邮件日历,还有产品让界面彻底消失。本文拆解 dots、Muse、Gemini Spark 等六款产品的入口、权限与执行逻辑,揭示真正的胜负手不是功能数量,而是谁能赢得用户的默认委托权。

假设你对一个 AI 说:“帮我安排下周去纽约的三天行程,避开已有会议,订好合适的酒店,再通知同行的同事。”

如果它只是列出航班、酒店和行程建议,它还是一个回答问题的助手;如果它能读取日历、比较选项、打开网站、填写信息,并在付款和发信前找你确认,它才开始接近 Personal Agent,也就是个人智能体。

最近海外产品密集涌现,容易让人产生一个直觉:把 dots、Muse、Gemini Spark、Instinct、Grok Bot 和 OpenClaw 拉成表格,比较谁能调用更多工具、谁能记住更多信息、谁的模型更聪明,就能得出胜负。

但这种横向排名很容易失真。它们看似都在做“个人助理”,实际争夺的是不同入口、不同数据和不同授权关系:有的想成为你的第二身份,有的先接管旅行和购物,有的依托邮件与文档做数字生活调度,有的希望界面彻底消失,有的给你组一支数字员工队伍,还有的把控制权交回用户自己。

所以,这一轮 Personal Agent 的“神仙打架”,争的不是谁先做出一个更大的聊天框,而是谁能成为用户的默认委托入口。

本文依据各产品截至 2026 年 10 月 1 日公开的官方页面与文档整理,没有把发布演示写成实测结果。文中的“六条路线”与评价框架是基于公开信息做的产品分析,不是厂商给出的行业分类。

一 为什么把 Personal Agent 做成排行榜 往往比不排更误导

传统 AI 产品对比,通常围绕模型能力、响应速度、价格和功能数量展开。Personal Agent 多了一层麻烦:同一个能力词,背后可能是完全不同的产品机制。

比如“能处理邮件”,至少可能指四件事:读取一封指定邮件、持续监控收件箱、代拟回复,或者直接把邮件发出去。前两项主要涉及信息访问,后两项已经触及外部行动和责任承担。把它们都写成一个“邮件能力:有”,会抹掉真正决定用户是否敢用的部分。

“记忆”也一样。记住这一轮对话中的名字,和长期保存用户偏好、项目文件、浏览器登录状态,不是同一层能力;“使用浏览器”可能是调用结构化接口,也可能是像人一样操作网页;“主动工作”可能是定时生成摘要,也可能是在用户没有下指令时自行发现问题。它们带来的收益、风险与授权成本都不一样。

更重要的是,这些产品不在同一条起跑线上。Google 已经拥有 Gmail、Calendar、Docs 和 Photos 的上下文;Apple 控制操作系统和设备;Meta 有 WhatsApp、Instagram 与社交关系;OpenAI 试图从 ChatGPT 向外连接应用;OpenClaw 则让愿意配置系统的人自己选择模型、数据位置与工具。

因此,比“功能多不多”更有解释力的问题是:谁在什么入口遇见它,它知道什么,用户允许它做到哪一步,出了问题又如何停下和恢复。

图:从“回答”走向“受托执行”的能力链(原创示意)

二 先划一条线 什么才算 Personal Agent

我认为,Personal Agent 至少要同时具备四个条件。

第一,它不是一次性会话,而是有持续身份。用户下次回来,不必重新解释自己是谁、项目做到哪里、什么结果算合格。

第二,它不只生成内容,还能进入真实工具执行动作。整理资料可以只停在草稿,但订酒店、改日程、提交表单、发送消息,都要求它跨过“建议”与“行动”的边界。

第三,它能处理跨时间任务。工作可以在应用关闭、电脑合上以后继续,或者由计划、事件和新信息触发,而不是每一步都等用户继续输入。

第四,用户仍能控制它。控制不只是一个总开关,还包括数据接入范围、单次动作审批、过程查看、撤回与纠错。

沿着这四个条件,可以把产品拆成五个连续维度:

  1. 入口:用户在哪里把事情交给它,是聊天应用、手机系统、浏览器、消息软件,还是家庭设备?
  2. 上下文:它能获得哪些持续信息,是单次对话、邮件与文档,还是屏幕、位置、设备和长期偏好?
  3. 权限:它能读什么、能改什么、哪些动作必须确认?授权是一次性的,还是可以细分到应用和动作?
  4. 执行:它能否把任务真正送到终点,并在网站阻挡、登录失效或信息冲突时把问题交还给人?
  5. 信任:用户是否看得见它做了什么,能否纠正、撤回、追责,以及是否愿意把更多个人信息长期交给它?

这五个维度不是五项孤立功能,而是一条相互牵制的链。上下文越深,执行越容易贴近个人需求;执行半径越大,权限设计和审计能力越重要。Personal Agent 的产品难点,不是把这五项都拉满,而是在具体场景里找到用户愿意接受的组合。

图:六款产品争夺“默认委托权”的不同路线(原创分析图,不代表厂商定位)

先看它们目前大致处在什么位置:

这张表只能说明产品状态,不能说明真实完成率。厂商页面展示的是设计目标、公开能力和开放范围,不等于每个网站、账户与任务都能稳定跑通。

三 六条路线 它们想成为什么 而不只是能做什么

1 OpenAI dots 把一个 Agent 变成你的 第二身份

OpenAI 在 2026 年 9 月 29 日发布 dots,给出的关键词不是某个单点功能,而是“always-on”。官方介绍称,每个 dot 有自己的云端电脑,其插件生态可连接超过 4000 个应用,并通过 ChatGPT、Slack 和 Teams 与用户协作;目前先从一个 primary dot 开始,未来再扩展为多个 dot。

这个设计的重点,是让同一个 Agent 跨任务、跨渠道保留你的目标、标准和反馈。它不只是“替我完成这次研究”,而是逐渐知道我如何判断证据、怎样写内容、哪些问题需要提前提醒。OpenAI 公开的案例也围绕这种持续关系展开:跟进客户反馈、更新发布资料、随着新数据重跑分析,再把需要人决定的地方提出来。

图:dots 任务与进度界面;来源:OpenAI 官方发布页,2026 年 9 月 29 日

这条路线的优势,是“一个主 Agent”可以降低用户管理多个工具和线程的成本。它更像长期搭档,而不是临时外包平台。

但同样的设计也把信任问题推到了最前面。OpenAI 明确区分了后台的“主动研究”和外部行动:用户不在场时,dot 使用已连接应用做的主动研究被限制为只读;应用权限由用户选择,Custom Rules 可以允许、要求批准或阻止某类动作;改密码等敏感任务仍必须由用户自己完成。官方还提醒,dots 仍可能出错,重要工作需要复核。

从产品角度看,dots 的真正挑战不是能不能再接一个工具,而是用户是否愿意让一个主体积累越来越多的长期上下文。它获得的信任越多,替换成本就越高;一旦判断出错,影响范围也会比单次聊天更大。

2 Meta Muse 从生活事务和交易切进去

Meta Muse 的切口更生活化。它运行在专用的 Muse Secure VM 中,用户可以在 Muse 应用或 WhatsApp 里交代事情。Meta 列出的动作包括发邮件、预订旅行、打开浏览器、填写表单,甚至代表用户进行协商;长任务可以在应用关闭后继续。

如果说 dots 强调“了解你如何工作”,Muse 更像一位生活与交易管家。官方举的例子包括把 Instagram 收藏的食谱转成购物清单,记住朋友的饮食限制,或者在付款时调用 Stripe Link 为 Agent 生成的一次性卡。这里的产品逻辑很直接:用户愿意付费或长期留下,不是因为聊天次数更多,而是因为它替用户完成了原本分散在搜索、比较、沟通和支付中的麻烦动作。

交易也是最难含糊的终点。推荐酒店可以有很多“看起来不错”的答案,真正付款以后,日期、价格、取消规则和责任都落到了现实世界。因此 Muse 会在发送邮件或购买前请求批准,并提供已经做过和计划要做事项的审计记录。用户还可以分别决定邮件只读还是允许代发,随时断开服务。

Muse 于 2026 年 9 月在美国向 iOS、Android 和网页端滚动开放,大部分基础使用免费,高需求用户有订阅计划。Meta 把它称为面向所有人的产品愿景,但当前实际开放仍有地区边界,不能把“为全球数十亿人设计”的表述等同于已经全球可用。

图:Muse Shopping 官方演示静帧;来源:Meta 官方发布,2026 年 9 月 8 日。发布演示不等于独立实测结果。

3 Gemini Spark 把 Google 数据变成调度优势

Google 的筹码不是先造一个陌生入口,而是把 Gemini Spark 放进用户已经存在的数字生活里。Spark 是一个云端 24/7 Agent,深度连接 Gmail、Docs、Slides 等 Workspace 工具,即使电脑关闭或手机锁屏,也能继续处理后台任务。

官方给出的例子很能说明它的方向:每月解析信用卡账单并标出新增订阅;跟踪孩子学校的邮件和截止日期;把邮件与聊天中的会议记录整理成文档,再起草项目启动邮件。到 2026 年 9 月,Google AI 计划更新 又把 Spark 与 Chrome、Google Photos 的连接列为美国 AI Pro 和 Ultra 计划能力。

Spark 的壁垒未必是“点网页按钮”本身,而是它天然站在 Gmail、Calendar、Docs、Chrome 和 Photos 之间。一个 Personal Agent 要做对事情,往往先要回答“用户现在在忙什么、承诺了什么、资料放在哪里”。Google 已经拥有大量答案。

但数据优势不会自动变成授权。Spark 由用户决定是否开启和连接哪些应用,高风险消费和发送邮件前会先询问。它还面临另一个典型问题:Google 生态外的任务,需要依赖更多连接器、MCP 或浏览器操作,稳定性和权限体验未必与原生应用一致。

图:Gemini 与 Spark 官方发布主图;来源:Google 官方发布,2026 年 5 月 19 日。当前开放状态以 9 月计划更新为准。

4 Instinct 最激进的设计 是让 Agent 没有新界面

Instinct 的官网第一句话就把路线说得很清楚:没有新的界面。它连接邮件、消息、屏幕、音频与位置,经过训练去使用手机和电脑,用户可以直接给它发消息或打电话。

这不是简单的“支持语音”。Instinct 希望把 Agent 从一个需要主动打开的目的地,变成日常沟通关系中的一个联系人。它可以跟进用户遗漏的线索,主动打电话或发消息,安排机场用车、预约上门维修。入口一旦消失,Agent 就不再和其他 App 争夺打开频次,而是进入用户本来就在做的动作。

这条路线的产品魅力也正是它的风险。读取屏幕、音频和位置,能够提供最贴近当下的上下文,同时意味着最敏感的一组权限;主动来电和提醒可能减少遗忘,也可能变成高成本打扰。用户什么时候愿意被打断、哪些信息不该形成长期记忆、误操作如何撤回,都需要比“聊天记录可删除”更细的机制。

截至本文截稿,Instinct 官网主要公布了产品定位和案例,没有清晰列出完整地区、订阅层级与普遍开放状态。因此,这里分析的是它所代表的“无新界面”方向,不把官网展示的能力当作所有用户都已可获得的成熟服务。

5 Grok Bot 不是一个全能助手 而是一支会协作的数字员工队伍

xAI 的 Grok Bot 官方文档 把 Bot 描述为可以长期保留的 AI 队友:每个 Bot 有名字、岗位和持续累积的上下文,并在带浏览器、文件系统和终端的云端电脑上工作。用户可以设立不同角色,让多个 Bot 并行执行、互相发消息、共享上下文和交接任务。

它与 dots 的差别不只是“数量更多”。dots 当前强调一个 primary dot 学会用户的整体偏好;Grok Bot 更像组织设计:研究、销售、运营等角色分别积累自己的上下文,稳定流程还能保存为技能并按计划重跑。对跨多个工具、边界清楚、可分工的任务,这种结构能减少用户自己在 Agent 之间搬运信息。

但多 Agent 也会制造新的管理成本。官方文档说明,同一账户下的 Bots 共用一台云端电脑及其文件、浏览器会话和应用登录,而不同 Bot 的对话和学习上下文保持分开。这样的共享有利于交接,也要求用户理解数据边界。网站仍可能阻止自动化、让登录过期或要求人工步骤;草稿发送等动作需要用户批准。

目前 Grok Bot 可运行在 macOS、Windows、Linux、iOS 和 Android,包含在付费 Cursor 个人与团队计划中,也可绑定部分个人 SuperGrok 订阅。它把 Personal Agent 从“一个了解我的人”,推进到“我如何配置一支队伍”。

6 OpenClaw 把 Agent 的所有权当作产品本身

OpenClaw 走的是另一条路:助手运行在用户自己的基础设施上,可以通过常用消息渠道访问,Gateway 作为持续在线的控制层。官方文档将它描述为 local-first、模型无关、可扩展和可自托管的开放系统;用户可以选择模型提供商,也可以采用本地模型方案,让数据留在自己的设备上。

图:OpenClaw 浏览器与控制界面;来源:OpenClaw 官方文档

OpenClaw 竞争的不是最低学习成本,而是所有权。用户能决定系统跑在哪里、使用哪个模型、接入什么渠道、怎样配置多个 Agent 与工具,也能检查和修改系统本身。对于有技术能力、对数据边界敏感,或者不愿被单一云服务锁定的用户,这种可控性本身就是价值。需要注意的是,2026 年 8 月的 v2026.8.1 曾以“OpenClaw 2.0”发布,但截至 10 月 1 日官方版本目录已经出现 v2026.9.6,2.0 不是当前最新版。

代价也很清楚。自托管不会让风险自动消失,它只是把更多责任从厂商转移给使用者:安装、升级、密钥、网络暴露、插件质量、模型成本和备份都需要有人负责。官方文档也建议,外联和广告投放等动作保持人在回路中,先由 Agent 起草,再由人批准。

所以,OpenClaw 不是“大厂产品的免费替代品”。它代表的是另一种交换:用户用配置和维护成本,换取更高的部署自由、模型选择权与数据控制权。

图:六款产品的“上下文深度—执行半径”位置(基于公开定位的分析示意,不代表实测排名)

四 Siri AI 和 Alexa Plus 为什么既在局内 又不完全属于同一类

还有两类产品不能忽略:操作系统里的 Siri AI,以及家庭环境里的 Alexa+。它们可能不完全符合前面“长期云端工作者”的定义,却拥有后来者很难复制的入口。

Apple 在 2026 年 9 月推出的 Siri AI 具备个人上下文理解、屏幕感知和跨系统 App 动作。官方案例中,它能从消息里找到家人提过的活动,从邮件取出食谱,再把配料加入提醒事项;也能根据屏幕内容把比赛日程加入日历。Siri AI 于 2026 年 9 月先以英语 Beta 开始推出,中国不可用,欧盟部分系统首发也不可用。

图:Siri AI 根据个人上下文起草邮件。来源:Apple Newsroom,2026 年 9 月 14 日。

Siri AI 的优势是系统级上下文和动作,不需要用户先决定“我要打开哪个 Agent”。但它目前更像随叫随到的系统助手,和 dots、Spark 那种持续在云端推进长任务的工作方式仍有差异。这个边界提醒我们:Personal Agent 不一定都以独立产品存在,操作系统可能把它吸收成默认能力。

Alexa+ 则占据家庭与环境入口。Amazon 将它定位为下一代生成式 AI 助手,可通过自然对话管理智能家居、预订服务、购物、播放内容和提供个性化建议;目前已在美国和加拿大全面开放,其他多个市场仍处于 Early Access 或分阶段上线。

图:Alexa+ 官方购物场景。来源:Amazon Alexa+ 产品页;不同国家可执行的服务和开放阶段并不相同。

Alexa+ 的核心不是一块屏幕,而是房间里的声音、家庭设备和 Amazon 商业体系。它说明了另一种可能:最常用的 Personal Agent 未必拥有最深的工作上下文,但可能因为“随口就能委托”和可连接现实设备,先占据高频生活任务。

Siri AI 与 Alexa+ 都说明,入口不是引流渠道,而是权限与上下文的来源。控制设备的人,天然更接近用户发生需求的时刻。

五 这场竞争对产品经理真正有用的五个判断

1 不要从 做一个通用 Agent 开始 先找独占上下文

模型和浏览器操作会逐渐成为可采购能力,独特上下文更难复制。邮件、日历、行业系统、设备状态、团队历史和长期偏好,都可能成为 Agent 做对事情的前提。

产品经理需要问的不是“我们也能不能加 Agent”,而是:我们掌握什么别人拿不到、用户又愿意授权的上下文?如果答案只是用户在聊天框里临时输入的一段话,产品很难形成持续优势。

2 权限设计就是核心体验 不是上线前补一页隐私协议

Personal Agent 的价值来自行动,行动必然触碰权限。好的设计不是让用户在第一天勾选一长串范围,而是形成清晰的授权阶梯:先读,后写;先生成草稿,后允许发送;先单次确认,后对稳定规则有限放行。

每次升级权限,都应该让用户看见它解决了什么问题、可能造成什么后果、如何收回。Muse 对邮件区分只读与代发,dots 用规则决定允许、审批或阻止动作,都是把权限变成产品交互,而不是隐藏在设置页里。

3 任务完成 必须有可验证的终点

Agent 最容易制造的错觉,是过程很热闹,结果却停在“差不多”。产品定义完成状态时,需要明确交付物和证据:文件保存在哪里、邮件是否真的发送、订单是否生成、日历是否更新、哪些步骤因网站阻挡没有完成。

对高风险动作,还要区分“已准备”“待批准”“已执行”和“执行失败”。用户需要看到差异,系统也需要据此决定是否重试、撤回或交给人处理。

4 真正要优化的是委托率 而不是对话次数

聊天产品习惯关注打开频次、消息数和停留时间,但 Personal Agent 的价值可能恰好表现为用户少操作。更合适的指标包括:有多少任务被完整委托、多少步骤不需要人工接管、批准前的修改比例、失败后恢复时间,以及用户是否愿意逐步开放更多权限。

不过,“自动化比例越高越好”也不成立。购买、公开发布、删除数据等高后果动作,保留确认可能是信任增长的前提。减少一次确认带来的效率收益,要和误操作成本一起计算。

5 最终形态很可能是 一个总入口 加多个专业 Agent

用户不会愿意同时管理十几个都声称了解自己的总管。更可能的结构是:一个 Agent 负责理解意图、掌握主要上下文和分发任务,多个专业 Agent 在旅行、财务、销售、研究或设备控制中执行。

dots 从一个 primary dot 起步,Grok Bot 直接强调多角色队伍,OpenClaw 提供多 Agent 路由,已经展示了三种不同组织方式。下一阶段的竞争,不只发生在 Agent 与用户之间,也会发生在 Agent 与 Agent 之间:谁拿到总入口,谁负责专业执行,权限和结果如何交接。

六 如果现在要做一款 Personal Agent 先回答这份决策清单

在画界面、接模型之前,团队至少需要把下面的问题写清楚:

  1. 用户最愿意交出的第一类任务是什么?它有明确、可验证的终点吗?
  2. 我们拥有什么独特上下文?用户为什么愿意持续授权?
  3. 产品的自然入口在哪里?用户需要专门打开它,还是能在原有动作中完成委托?
  4. 哪些步骤只能读取,哪些可以修改,哪些必须由人确认?
  5. 权限能否按应用、数据类型、动作和时间范围拆分,而不是只有“全部允许”?
  6. Agent 遇到登录过期、网页阻挡、信息冲突和模型不确定时,怎样把任务交还给用户?
  7. 用户如何查看过程、纠正记忆、撤回动作和删除数据?
  8. “完成”由什么证据证明?系统是否保留操作记录和结果回执?
  9. 如果任务跨多个专业 Agent,谁拥有最终上下文,谁对结果负责?
  10. 收费依据是什么:模型消耗、完成任务数量、节省时间,还是更高的权限与服务保障?

这份清单里没有“模型参数多大”。不是模型不重要,而是模型能力越来越强以后,真正拉开产品差距的,会是它能进入什么场景、拿到什么上下文、获得多大授权,以及出了问题能不能让用户安心收回控制。

结语 胜负手是那句 这件事交给你

六款产品正在把 Personal Agent 拉向六个方向:dots 想成为持续理解你的第二身份,Muse 先接生活事务与交易,Gemini Spark 借 Google 数据做数字生活调度,Instinct 让界面消失,Grok Bot 把一个助手扩成数字团队,OpenClaw 则把系统所有权还给用户。

Siri AI 和 Alexa+ 又提醒我们,操作系统、家庭设备和自然入口随时可能改写竞争。没有哪一条路线已经证明自己通吃所有场景,也没有一个官方演示足以证明长期可靠。

但竞争目标已经越来越清楚:真正的胜负,不是谁回答得更像人,而是谁最终获得了用户那句——“这件事交给你。”

一旦这句话从偶尔尝试变成默认习惯,Personal Agent 才真正从一个功能,变成了人与数字世界之间的新一层关系。

主要官方资料

  • OpenAI:Introducing dots,2026-09-29
  • Meta:Introducing Muse,2026-09-08
  • Google:The Gemini app becomes more agentic,2026-05-19
  • Google:Fall 2026 AI plan updates,2026-09-09
  • Instinct 官网
  • xAI:Grok Bot 官方文档,更新于 2026-09-21
  • OpenClaw:What is OpenClaw?
  • Apple:Siri AI,2026-09-14
  • Amazon:Alexa+

本文由 @系阿铃 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自作者提供

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!