关了电脑还在替你干活:Personal Agent的技术内核与医疗落地

0 评论 218 浏览 0 收藏 29 分钟

当急诊医生关掉电脑,AI仍在替他写病历、排随访——这不是科幻,而是Personal Agent(个人智能体)的日常。它和聊天机器人最本质的区别是:你合上电脑,它还在干活。本文以医疗场景为试金石,拆解分层记忆、MCP协议、权限分级三大技术支柱,并对比OpenAI Dots、Gemini Spark等四款产品,揭示这场AI产品革命的真正内核。

急诊医生Haroun Zayed走出渥太华医院急诊室的时候,已经是夜里十点。八个小时的班次里他接诊了27个患者,缝合了三个伤口,处理了一例急性心梗。换作以前,他至少还要留一个小时写病历、核对检查单、给随访患者回邮件。但这天他直接换衣服走了——车里的孩子还在等他接回家。

他的手机没有弹工作消息,电脑也已经关机。但医院系统里,DAX Copilot还在工作:它把诊室里的对话转成结构化病历,对照检查结果补充病程记录,按照医保编码规则整理好收费项目,甚至把第二天需要随访的三个患者,按轻重缓急排进了他的日程草稿。第二天早上他打开系统,只需要通读一遍、签上名字,就可以直接去查房。

这不是科幻场景,是2025年以来北美数百家医院的日常。很多人以为这只是“更会聊天的ChatGPT”,但其实我们正在见证一个品类的诞生:Personal Agent——个人智能体。它和聊天机器人最本质的区别是:你关掉对话框、合上电脑,它还在替你干活。

而医疗,是这个新品类最好的试金石。没有哪个领域比医疗对权责边界更敏感、对数据隐私要求更高、对错误的容忍度更低。看懂了医疗场景里的Personal Agent,你才能看懂这场AI产品革命的真正内核,以及它终将走向何方。

一、不是聊天换皮:Personal Agent的三根技术支柱

很多人对Personal Agent的认知还停留在“能帮你发邮件、订机票的AI”,觉得无非是给大模型多加几个插件。这是典型的误解。插件是“你点一下,它动一下”,而Personal Agent是“你交代一句,它全程负责”。支撑这个差别的,是三套完整的技术体系,缺一不可。

1. 分层记忆系统:它不只是“记得”,而是“懂怎么记”

普通大模型的记忆是上下文窗口,对话一关就清零。就算有历史记录,也只是把过往对话重新塞进上下文,本质上还是“复读”。而Personal Agent的记忆是分层的,像人脑一样有工作记忆、短期记忆、长期记忆和技能记忆。

目前行业主流的三层架构已经非常清晰:第一层是工作记忆,只存当前任务的上下文,存在内存里,响应速度最快,任务结束就清空;第二层是长期记忆,存在向量数据库或者关系型数据库里,记录你的所有偏好、历史、关键事实,比如你对青霉素过敏、你写病历喜欢先写主诉再写现病史、你每周三下午要出门诊,需要的时候通过语义检索调用;第三层是技能记忆,它不记事实,记的是“做事的方法”,比如规范的病历怎么写、医保报销的流程是什么、给患者回邮件的语气要怎么把握。

放到医疗场景里,这个差异就是生死之别。一个普通的聊天机器人,你每次都要重新告诉它“患者有高血压、糖尿病、青霉素过敏”;而一个合格的临床Agent,会自动从历史病历里提取这些信息,写处方的时候自动做冲突检查,甚至会提醒你“这个患者上个月刚做过CT,这次优先建议核磁”。

更重要的是,记忆不是越多越好,而是“该记的记牢,不该记的绝不碰”。医疗数据是最高级别的敏感信息,合格的Agent必须做到记忆隔离:不同患者的数据绝对不能串,不同场景的记忆绝对不能混,用户删除的数据必须彻底清除,不能留任何备份用于模型训练。这也是为什么很多通用Agent看起来功能很强,一进医院就碰壁——它们的记忆系统从设计之初,就没考虑过这么高的安全边界。

2. MCP协议:不是插件堆得多,而是工具接得通

很多人以为Agent的能力取决于接了多少个插件,其实恰恰相反。插件越多,模型越容易混乱,成本越高,出错概率也越大。Personal Agent真正的核心基础设施,是MCP(Model Context Protocol)——模型上下文协议。

你可以把MCP理解成Agent世界的“USB接口”。以前每个应用都要单独写对接插件,每个Agent都要重新适配一遍;现在只要应用支持MCP协议,任何兼容的Agent都能直接调用,不用重复开发。它定义了标准的工具调用方式、数据传输格式和权限控制,让Agent可以安全地对接外部系统,而不是直接裸奔。

在医疗场景里,这一点尤其关键。医院里有HIS系统、LIS检验系统、PACS影像系统、电子病历系统,每个系统都是独立的,数据格式都不一样。以前做AI集成,要一家一家做接口,耗时几个月甚至几年。有了MCP协议之后,Agent可以通过标准接口安全地调取各个系统的数据,不用把数据倒来倒去,也不用在每个系统里都部署一遍模型。

当然,MCP不是万能的。工具越多,模型的选择负担就越重。一个合格的Personal Agent,不会把所有工具都摆在模型面前,而是会根据场景动态加载需要的工具。比如写病历的时候,只加载病历模板、检验系统、医保编码工具;做随访的时候,只加载邮件、日历、患者档案。这不是技术问题,是产品设计问题——好的Agent懂得克制,而不是炫耀能力。

3. 权限分级体系:核心不是“能做什么”,而是“不能做什么”

这是Personal Agent和聊天机器人最本质的区别,也是医疗场景里的生命线。聊天机器人只有“能回答”和“不能回答”的区别,而Personal Agent有清晰的权限分级:哪些事可以自己做,哪些事必须问你,哪些事绝对不能碰。

OpenAI Dots的设计很有代表性:它把权限分成三档——只读操作(比如看邮件、查日程、读文档)默认允许;低风险操作(比如整理文件、写草稿、排日程)可以设置自动执行;高风险操作(比如发邮件、删文件、付款)必须每次人工确认。除此之外还有一套独立的Auto-review系统,在动作执行前再做一遍检查,哪怕用户已经授权,只要不符合安全规则就会拦截。

放到医疗场景里,这个分级还要再严格十倍。一个临床Agent的权限边界必须像手术刀一样精准:它可以听医患对话、可以整理病历草稿、可以查询检验结果、可以提醒医生漏项,但绝对不能自己开处方、绝对不能给出诊断结论、绝对不能修改已经确认的病历。哪怕它的准确率比医生还高,也不行。

因为医疗的核心规则是:谁签字,谁负责。AI可以替医生干活,但不能替医生担责。这条线划不清,再好的技术也落不了地。

二、四款产品拆解:比的不是参数,是边界

现在市面上的Personal Agent很多,但真正能拿到医疗场景里比的,其实就四类。它们走了完全不同的路线,也对应了完全不同的落地可能性。比的从来不是模型参数有多高、功能列表有多长,而是“能动手到哪一步,谁来拍板”。

1. OpenAI Dots:云端常驻的“全能实习生”

OpenAI在2026年9月发布的Dots,是目前通用Personal Agent里标杆级的产品。它最核心的设计是每个Dot都有一个独立的云端沙盒,相当于给AI配了一台专属的云电脑。你关掉自己的电脑,它还在那台云电脑里继续干活,浏览网页、整理文件、调用工具,24小时不关机。

它可以连接超过4000个应用,支持自定义规则,你可以详细规定什么事它可以自己决定,什么事必须汇报。比如你可以设定“低于100美元的订阅自动续费,超过的问我”,也可以设定“所有工作邮件先写草稿,我确认了再发”。再加上Auto-review的二次校验,整套权限体系非常完整。

但放到医疗场景里,它的短板立刻就显现了。首先是合规问题:Dots运行在OpenAI的公有云上,默认不支持HIPAA合规,不能处理受保护的健康信息(PHI)。医生可以用它查文献、写综述、整理学术邮件,但绝对不能把患者的病历导进去。其次是数据主权问题:你的数据存在OpenAI的服务器上,虽然官方说不会用来训练模型,但医疗机构根本不敢冒这个险。

所以Dots更像一个“全能实习生”,帮你处理各种杂事、做研究、安排行程都很好用,但涉及核心敏感数据的临床场景,它暂时还进不去。

2. Gemini Spark:谷歌生态的“生活调度员”

Google的Gemini Spark走的是另一条路:深度绑定谷歌生态。它运行在谷歌云的Antigravity Agent平台上,和Gmail、日历、云端硬盘、文档原生打通,24小时后台运行。它最擅长的是处理谷歌生态里的日常事务:整理收件箱、排日程、管理待办、同步各个应用的数据。

它的特点是“自定义技能”:它会学习你的工作习惯,比如你写邮件的风格、你整理文件的方式、你每周的例会时间,然后自动套用。用得越久,它就越懂你。2026年7月它更新了Mac桌面端之后,也能操作本地文件了,能力边界进一步拓宽。

但在医疗场景里,它和Dots面临同样的问题:公有云部署,HIPAA合规支持有限,不能碰临床数据。医生个人用它管理日程、处理行政事务、整理学术资料非常合适,但想直接对接医院系统、处理患者数据,基本不可能。它更像一个“生活调度员”,把你的数字生活打理得井井有条,但专业领域的深水区,它还下不去。

3. Claude Cowork:本地隔离的“文档处理专家”

Anthropic的Claude Cowork走的是完全相反的路线:它不跑在云端,而是跑在你电脑本地的虚拟机里。你可以精确控制它能访问哪个文件夹、哪个应用,数据完全不离开你的设备。它的长文档处理能力是公认的第一,整理几百页的病历、综述几十篇论文,都非常顺手。

它的权限设计非常保守:默认什么权限都没有,每访问一个应用、每做一个操作都要问你。你可以开Auto模式,让它自己判断安全的操作自动放行,危险的再拦截。官方也明确说了:不支持HIPAA、FedRAMP等监管场景,不要用来处理敏感医疗数据。

所以它在医疗场景的定位很清晰:本地文档处理工具。医生可以把本地的病历资料、文献论文交给它整理、总结、撰写草稿,数据全程不离开自己的电脑,隐私性非常好。但它不能联网对接医院系统,不能跨应用执行复杂工作流,更像一个能力很强的“文档处理专家”,而不是全能的事务总管。

4. Nuance DAX Copilot:垂直领域的“专业医疗助理”

和前面三个通用Agent不一样,Nuance的DAX Copilot是专门为医疗场景做的Personal Agent,也是目前落地最成功的临床智能体。它不做别的,就做一件事:帮医生写病历。

它的工作方式很简单:诊室里放一个麦克风,医生和患者对话的时候它就在旁边听。看完病,它自动把对话整理成符合规范的电子病历,包括主诉、现病史、既往史、诊断、处方建议,直接写进医院的EHR系统里。医生只需要检查一遍,签字确认就行。

根据微软2024年的调研数据,它平均每次接诊帮医生节省5分钟文书时间,70%的医生说工作生活平衡变好了,93%的患者觉得医生更专注、更有人情味了。渥太华医院的急诊部用了之后,患者满意度直接提升了2个百分点。

它为什么能成?核心不是模型更聪明,而是它把边界划得无比清晰:

  • 它只听对话、写草稿,绝对不做诊断;
  • 所有数据都在医院内网,符合HIPAA要求,全程留痕可审计;
  • 最终决策权100%在医生手里,AI永远只是辅助。

它没有几千个插件,没有花里胡哨的功能,就把一件事做透、做安全、做合规。而这,恰恰是通用Agent最难做到的事。

国内也在快速跟进。华西医院2025年上线的医疗文书智能体,到年底已经生成了近60万份病历,覆盖门诊、住院、出院等7类文书,还能自动做病历质控。清华大学的Agent Hospital系统在北京清华长庚医院18个科室测试,医生诊疗效率提升了30%,诊疗建议采纳率达到95%。但和DAX一样,它们的核心都不是“替代医生”,而是“把医生从文牍里解放出来”。

三、医疗为什么是Personal Agent的试金石?

很多人觉得,医疗只是Personal Agent的一个应用场景而已。但实际上,医疗是整个行业的试金石。能在医疗场景落地的Agent技术,放到任何行业都够用;但在通用场景里很好用的Agent,放到医疗里大概率不合格。

因为医疗把三个核心矛盾推到了极致。

1. 容错成本:错答案升级成错动作

聊天机器人答错一个问题,你笑一笑就过去了,最多再问一次。但Personal Agent是要动手做事的。在医疗场景里,写错一个过敏史、开错一个药、漏看一个检查结果,后果可能是患者的生命。

这就是Personal Agent和聊天机器人最大的风险差异:以前AI的错误是“信息错误”,现在AI的错误是“动作错误”。信息错误可以纠正,动作错误造成的后果,很多时候不可逆。

美国的HIPAA法案规定,泄露500人以上的健康信息,必须在60天内上报联邦政府,还可能面临巨额罚款。而如果医生用未经合规审核的AI工具处理患者数据,哪怕只是为了写病历,也属于违规。这不是技术问题,是法律问题。

国内也是一样。《个人信息保护法》把医疗健康信息列为敏感个人信息,处理必须有明确的目的和充分的必要性,还要取得个人的单独同意。很多通用Agent默认收集用户数据用来优化模型,这在医疗场景里是绝对的红线。

所以做医疗Agent,首先想的不是“能做多好”,而是“出了事怎么办”。容错成本越高,对风控体系的要求就越苛刻。而风控,恰恰是很多通用Agent最薄弱的地方。

2. 数据敏感:信任比智能重要一万倍

每个人的医疗数据,都是最核心的隐私。你可以接受AI看你的邮件、看你的日程、看你的购物记录,但你未必愿意AI知道你得过什么病、吃过什么药、做过什么手术。

这就是Personal Agent的核心悖论:它越了解你,就越好用;但它越了解你,风险就越大。你愿意把多少隐私交给它,决定了它能发挥多大价值。

医疗场景把这个悖论推到了极致。患者的病历里有姓名、身份证号、家庭住址、病史、家族遗传史,全都是最高级别的敏感信息。所以医疗Agent的设计原则,从一开始就和通用Agent反过来:

  • 通用Agent想的是“怎么拿到更多数据”,医疗Agent想的是“怎么尽量少碰数据”;
  • 通用Agent想的是“怎么更聪明”,医疗Agent想的是“怎么更可信”;
  • 通用Agent追求“用户体验顺滑”,医疗Agent追求“边界绝对清晰”。

很多人以为,AI产品的竞争力是模型能力。但在医疗这个场景里,信任才是唯一的护城河。一个能力弱一点但绝对安全的Agent,远比一个能力很强但可能泄露数据的Agent受欢迎得多。

3. 权责边界:谁拍板,谁负责

医疗行业有一条铁则:谁签字,谁负责。这条规则看起来简单,却是Personal Agent发展的核心命题。

Personal Agent的本质,是把一部分决策权让渡给AI。但哪些可以让渡,哪些绝对不行?在普通场景里,这个边界很模糊:AI帮你订机票,订错了大不了改签;AI帮你发邮件,发错了道歉就行。但在医疗场景里,这条线必须画得清清楚楚。

现在临床落地的所有AI Agent,无一例外都坚守一个原则:AI只做建议,不做决策;AI只写草稿,不签字。所有最终的诊疗行为,必须由医生来确认、来负责。

这不是技术落后,这是行业底线。很多技术爱好者总觉得“AI准确率比人高,为什么不能让AI直接诊断”,但他们忽略了:医疗从来不是纯技术问题,它涉及责任、伦理、法律、人性。就算AI诊断准确率99%,那1%的错误,谁来承担后果?是AI公司,是医院,还是医生?

这个问题没有答案之前,所有越界的尝试,最终都会撞墙。而Personal Agent整个行业,其实都在医疗这个极端场景里,寻找那个最合理的权责边界。找到了,就能通吃所有行业;找不到,就永远只是玩具。

四、行业终局:从“回答问题”到“接管事务”

聊完技术和案例,我们回到更本质的问题:Personal Agent这个品类,到底会往哪里走?整个AI行业,正在经历一场怎样的形态变革?

1. 第一个误区:模型越聪明,Agent就越好

很多人觉得,Agent不好用是因为模型还不够聪明,等模型达到AGI了,一切问题就都解决了。这是最大的误区。

你可以想一下:你雇一个助理,最重要的是他最聪明吗?不是。最重要的是靠谱、懂分寸、知道什么事该自己做、什么事该请示、什么事绝对不能碰。聪明但不靠谱的助理,你敢用吗?

Personal Agent也是一样。模型能力是基础,但过了及格线之后,决定体验的就不再是智商了,而是记忆准不准、工具稳不稳、权限清不清、风控严不严。一个60分的模型配上90分的权限体系,远比90分的模型配上60分的权限体系好用。

尤其是在专业场景里。医生不需要一个能和他聊哲学的AI,他需要一个写病历格式永远正确、永远不泄露患者隐私、永远不替他做诊断的AI。笨一点没关系,慢慢改进;但只要出一次安全事故,信任就彻底归零了。

整个行业正在从“比谁更聪明”,转向“比谁更靠谱”。这是一个非常重要的信号,意味着Personal Agent已经从技术演示阶段,进入了真实落地阶段。

2. 四个发展阶段:从对话到共生

Personal Agent不是突然冒出来的,它是个人助理演进的必然结果。到今天为止,我们其实已经走过了两个阶段,正在进入第三个阶段。

第一个阶段是对话式助手,代表是早期的Siri、小爱同学,还有初代ChatGPT。它的模式是“你问,我答”,被动响应,只输出信息,不执行操作。这个阶段的核心是“回答问题”,价值是获取信息的效率。

第二个阶段是单点执行Agent,代表是各种AI插件、AI工具。它的模式是“你给指令,我完成”,可以执行单个具体任务,比如订个票、写篇文档、做个表格。但它没有记忆,不会主动规划,做完就结束。这个阶段的核心是“执行任务”,价值是单点效率的提升。

第三个阶段就是我们现在的后台常驻Personal Agent。它有长期记忆,有自主规划能力,24小时后台运行,你交代一个目标,它自己拆分步骤、调用工具、遇到问题自己解决,搞不定了再找你。它不再是一个工具,而是你的“事务代管”。这个阶段的核心是“管理事务”,价值是把你的注意力从琐碎事务里解放出来。

而第四个阶段,也就是终局,会是多Agent协作的数字共生。你不会只有一个Agent,而是有一个“总管Agent”,下面管着一堆专业Agent:有管日程的、有管财务的、有管医疗的、有管工作的。总管Agent懂你的偏好,负责分配任务、协调进度、把控边界;专业Agent各司其职,把具体事做好。它们之间自己沟通,不用你事事操心。

到那个时候,AI就不再是一个你需要打开的APP了。它像空气一样,在你的数字生活里无处不在,默默帮你处理好所有琐碎的事。你不需要知道它做了什么,你只需要知道:一切都安排好了。

3. 再一步思考:我们让渡的不是权力,是注意力

很多人讨论Personal Agent的时候,总喜欢聊“AI会不会替代人”“会不会失控”,其实都聊偏了。

Personal Agent的本质,从来不是替代人做决策,而是替人处理不需要决策的琐事。我们让渡给AI的,从来不是决策权,而是注意力。

医生每天花一半的时间写病历、填表格、走流程,这些事情需要决策吗?不需要。但它们消耗了医生大量的注意力,导致医生真正留给患者的时间少得可怜。Personal Agent做的,就是把这些注意力还给医生,让医生可以把精力放在真正需要他的地方:和患者沟通、思考病情、做出判断。

我们每个人都是这样。每天被邮件、消息、日程、各种琐碎的事务淹没,真正用来思考、用来创造、用来和身边人相处的时间,少之又少。Personal Agent的终极意义,就是帮我们把这些注意力抢回来。

它不是让机器变得更像人,而是让人能更像人一样活着。

五、结尾

文章开头的那位急诊医生Haroun Zayed说过一句话:“我现在已经无法想象没有它的班次了。不是因为我离不开AI,而是因为我离不开它帮我省下来的时间——那些可以看着患者眼睛说话的时间。”

这大概就是Personal Agent最好的注脚。

很多年以后回头看,我们会发现,2026年不是AI变得更聪明的一年,而是AI开始真正走进我们生活的一年。它不再是对话框里那个只会聊天的程序,而是变成了后台那个默默干活的身影。你看不见它,但它一直在。

这场革命的终点,不会是一个无所不能的超级AI。它会是一个边界清晰、分寸得当、让人放心的数字事务总管。它不会替你活,但它会替你处理所有那些不值得你花时间的事。

而你,只需要把注意力留给真正重要的人和事。

这,才是Personal Agent真正的价值所在。

本文由 @壮年女子AIGC版 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!