从对话到执行:WorkBuddy 对企业桌面 AI 智能体的实践探索
当AI从聊天框走向桌面,它不再只是回答问题的工具,而是能直接操作文件、联动软件、定时执行任务的数字搭档。本文以WorkBuddy为例,拆解桌面Agent如何通过工作空间、连接器和自动化,让AI真正“长记性”,从被动应答转向主动执行,重塑知识管理的工作流。

前段时间有个事让我想了很久
一个朋友把自己过去几年写的几万字随笔,没有特定目的、纯粹写给自己看的那种,一股脑扔给了 WorkBuddy。他就是临时起意,让它以这些文章为素材,仿照自己的写作风格,整理成一本结构完整的文集
十几分钟后,一份逻辑清晰、章节分明的书稿躺在他的文件夹里。质量之高让他不敢相信
他又试了一次。把自己长期积累的几十万字行业研究素材全部提交,让 WorkBuddy 以此为基础写一本深度分析的书稿。结果再次超出预期
这事让我重新审视了一个问题:当我们谈论 AI 的时候,是不是一直把它的天花板想得太低了
过去两年我们习惯了在聊天框里和 AI 对话。你问一句,它答一句。每次打开新对话,它都不记得你是谁。你把文档贴进去,它现场读几段给你一个回答,用完即丢。下次再用,从零开始。这种体验说白了就是一个高级点的搜索引擎加上文字润色功能
但 WorkBuddy 这类的桌面 Agent,正在改变这件事
它不是在聊天框里等你问,而是直接操作你的文件、联动你的软件、在你关电脑之后还能定时跑任务。AI 的角色正在从”回答者”变成”执行者”。这中间的跨越,可能比我们从 GPT-3 到 GPT-4 的体验升级还要大
为什么桌面 Agent 是今年最重要的 AI 产品形态
说它是”最重要”不是因为技术最前沿,而是因为它离用户的真实工作最近
我问过很多产品经理和创业者同一个问题:你现在用 AI 最烦的是什么
排名第一的回答永远是——每次都要重新解释我是谁
你花半小时贴资料、讲背景、描述自己的偏好,终于调出一个满意的结果。第二天打开新对话,一切归零。它不记得你教几年级、用什么教材、上次那个方案改过几版
排名第二的是——它只能聊,不能干
你让它写一份方案,它能写。但你让它把方案保存到指定文件夹、按照你的模板调好格式、然后发一份到你的邮箱——做不到。你得复制粘贴出来,自己处理后续的所有步骤
这两个痛点的根源是同一个:Chat 式 AI 是一个无状态的、纯文本交互的工具。它没有记忆,没有操作权限,没有和你的工作环境产生任何连接
桌面 Agent 走了另一条路
它把工作空间指向你的本地文件夹,这意味着它能读写你硬盘上的真实文件。它通过连接器接入你日常使用的软件——邮箱、文档、知识库、浏览器。它还能设置定时任务,在你不在电脑前的时候自动运行
这三个能力叠加在一起,AI 就不再是一个聊天工具了,它变成了一个驻扎在你电脑里、了解你的工作习惯、能替你执行任务的数字搭档
这就是”从对话到执行”的核心
WorkBuddy 的产品逻辑:不是”聊”,是”干”
拆开来看,WorkBuddy 的产品设计透露着一个很清晰的思路
工作空间是最关键的设定
你把一个文件夹指定为 WorkBuddy 的工作空间,它就能在里面读、写、建目录、改文件。这听起来是个很小的功能点,但产品逻辑上它是整个桌面 Agent 的基石。因为这意味着 AI 的输出不再只是聊天框里的一段文本,而是你电脑上一个真实存在的文件
有人用这个配合 Obsidian 搭了一套会自动更新的个人知识库。你把网上看到的好文章剪藏进一个叫 raw 的文件夹,跟 WorkBuddy 说一句把这些新文章编译成知识页,它就自己一篇篇读、提取关键信息、写成相互链接的知识页面存进 wiki 文件夹
整个过程不需要你手动整理,不需要你开新的对话重新贴文章。你只负责往 raw 里扔东西,剩下的编译、归类、更新目录、写日志,全是它自己跑
连接器让它不再是一座孤岛
桌面 Agent 如果只能操作本地文件,那它的价值还是有限。真正让它进入工作流的,是它和外部工具的连接能力
WorkBuddy 目前接入了 ima 知识库、乐享知识空间、微信小程序、腾讯文档和邮箱等。这意味着它能从你的知识库里调资料来回答问题,能在腾讯文档里直接生成文件,能去你的邮箱里翻审稿意见然后整理成表格
有个科研用户的用法让我印象很深。他把几年的文献 PDF 全传进 ima,在 WorkBuddy 里连接了知识库之后,说了一句话:读取这个知识库里的所有论文,帮我梳理这个领域的研究脉络和待解决的问题
几十分钟后,一份完整的文献综述框架躺在他的文件夹里。而且每一处引用都来自他知识库里的真实论文,不是模型编造出来的假文献
这个场景背后是一个产品逻辑的质变。以前的 AI 是基于通用语料给你一个泛泛的答案,现在它是基于你的专属知识库给你一个针对性的输出。知识的纯度和密度完全不同,结果的质量自然天差地别
定时自动化让 AI 从被动变主动
这是最容易被忽视的功能。WorkBuddy 可以设定时任务,到点了自动执行一段指令
什么意思呢
你设一个每天早上七点半的任务:扫一眼 raw 文件夹,有新文件就编译进知识库,没动静就什么都不干。再设一个每周六晚上的任务:给知识库做一轮体检,看看有没有断掉的链接、被孤立的页面、互相矛盾的说法,有问题列出来等你确认
设完之后你就不用管了。知识库自己更新,自己检查健康状态。你唯一要做的事就是往里面扔新资料
这种体验和”打开聊天框问一句”完全不同。前者是你找 AI,后者是 AI 找你。这是一个用户心智的根本转变
知识库 + Agent:AI 终于长记性了
说到知识库,有一个背景值得展开
这套”让 AI 提前整理知识而不是等提问再翻资料”的玩法,叫做 LLM Wiki。它是 OpenAI 创始成员 Karpathy 今年提出来的思路
他的逻辑很简单。平时你上传文件给 AI 提问,流程是这样的:你提问,AI 临时去资料里扒几段沾边的拼个回答,答完就扔。下次再问,重新读一遍。文件越多,找得越慢,回答越泛
Karpathy 把这事倒了过来:别等提问了再理解,提前让 AI 把每份资料读透,整理成一页一页互相链接的知识页面。新资料进来就往上补,所有的理解都被存下来
他说了一句很精准的话:Obsidian 是工作台,大模型是程序员,wiki 是它写出来的东西
WorkBuddy 实践这套玩法,核心就四步
第一步,存资料。网上的文章用浏览器插件一键剪藏,本地 PDF 和 Markdown 文件直接拖进 raw 文件夹。不用分类,不用打标签,全扔进去就行
第二步,编译。跟 WorkBuddy 说一句:去把 raw 里新到的那批文章编进 wiki,该开页开页,该并页并页。它就会自己一篇篇读,概念归概念,人物归人物,摘要归摘要。页和页之间自动打上关联链接
第三步,查询。编译完之后你可以问它各种问题,它不会把整个库翻一遍,而是先看目录,圈出相关的页面,只读这几页然后回答。每个回答末尾附上依据来自哪一页
第四步,检查。用定时任务让它每周做一轮知识库体检,查断链、查孤页、查冲突。发现的问题列出来等你确认,确认了再改
这套流程跑通之后,知识库就不再是一个文件堆了,而是一个会自我更新的有机体
更重要的是,新资料不断进来,知识库不断变厚,每一次查询都站在之前所有理解的基础上。AI 终于不再”失忆”了
同样的逻辑在企业场景里被放大得更明显
一个教师把几年的教案、试卷、学情记录全存进知识库。新学期备课时让 WorkBuddy 调出库里的资料,直接生成基于真实学情的新教案和配套 PPT。产物出来后回存进库,下一次再教这一课,它就站在上一次的肩膀上
这才是真正意义上的经验沉淀。不是存在某个文件夹里再也不打开,而是每一次产出都变成下一次可调用的资产
软件联动:从孤岛到生态的质变
到这我想聊一个更深的问题
桌面 Agent 的真正威力不在于自己有多强,而在于它能把已有工具串联起来
过去我们每装一个软件,就是建了一座孤岛。你的笔记在 Obsidian 里,文档在腾讯文档里,知识在 ima 里,邮件在邮箱里。数据是割裂的,工作流是断裂的
WorkBuddy 通过一个文件协议就把这事解决了——两个软件共享同一个文件夹,一个写,一个看
你用 Obsidian 打开知识库文件夹,看到的是 WorkBuddy 刚编译好的知识页。你在浏览器里剪藏了一篇文章,WorkBuddy 扫描到 raw 文件夹的新文件就开始自动编译。两个软件之间没有任何绑定,全靠同一个文件夹接上头。哪天你想把其中一个换掉,另一个照常用,资料一直都在
更进一步的是连接器体系
ima 知识库是你的资料柜,负责把零散的文件、论文、教案收好、管好、权限分级。WorkBuddy 是你的执行搭档,负责调用这些资料帮你干活、交付成品
取、用、存三个字
从知识库调资料,在 WorkBuddy 里执行任务,产物回存进知识库。闭环一旦跑通,知识就不再只是躺着的文件,而是会流动起来的生产资料
乐享知识空间让这个逻辑在团队场景里更完整。它支持企业级权限管理,哪些知识能被谁调用、谁可以编辑、谁只能查看,边界清晰。WorkBuddy 从乐享调取资料生成方案或报告时,团队也更容易回到原始资料确认依据——不会出现”AI 写完了但没人知道它参考了哪版材料”的尴尬
有一个人用法特别有意思
他把老板两年的邮件、周报、会议纪要、录音转写全沉淀进乐享知识库,然后在 WorkBuddy 里问了一个问题:老板会怎么批这个方案
输出的吐槽语气、决策偏好、甚至那句口头禅,相似度接近九成
这不是简单的信息提取,是多源异构数据的连接、清洗、提炼和建模。四个割裂的信息源,通过知识库和 Agent 的组合,被还原成了一个人的决策风格
定时自动化:AI 从”等人问”到”主动干”
说实话,定时任务是 WorkBuddy 目前最被低估的能力
大多数人理解的 AI 还是”我打开对话框,输入问题,等它回答”。但定时任务的逻辑刚好反过来——你设置一个时间、写好一段指令,到点了它自动跑,你甚至不需要在场
这听起来是个很小的功能点,但产品哲学的含义很不一样
它意味着一部分工作不再需要”发起”了
比如每天早上开工前,知识库里新存的资料已经被自动编译好了,你坐下来就能直接查询。比如每周日晚上,一份知识库健康报告已经躺在你的文件夹里,告诉你这周新增了哪些页面、有哪些链接断掉了、哪些说法之间存在冲突
你不需要记得去做这些事,不需要分心去手动触发。AI 变成了一个前台后台同时运行的操作系统,而不是一个随叫随到的客服
有个场景让我觉得这个方向的空间还很大
一个研究生给 WorkBuddy 设了两个定时任务。第一个是每天早上九点,自动搜索他研究方向的最新论文和资讯,整理成简报存到文件夹。第二个是每周五下午,汇总他这一周所有的实验数据和工作记录,生成周报初稿
效果是每天早上到工位,泡好咖啡,一份研究领域今日动态已经等在那里了。别人还在刷公众号追热点,他的热点是自己送上门来的
这就是从主动到被动的范式转变。而真正成熟的企业级桌面 Agent,未来可能有几十个这样的定时任务在后台持续运转——知识更新、数据清洗、报表生成、风险监控、竞品追踪。它们不需要你来发起,它们自己知道什么时候该做什么事
企业场景全貌:从科研到管理的一手实践
前面讲了很多方法论,这一章把镜头拉近,看看不同角色在实际工作中怎么把这些方法用起来
科研工作者
文献综述是研究生的共同噩梦。导师一句”把这个方向梳理一下”,背后是几十篇 PDF 和无数个通宵
实际的工作流分成三步。把下载好的 PDF 全扔进一个文件夹,导入知识库,让 WorkBuddy 每篇都读完,输出一张对比表格——研究问题、方法、核心结论、局限性全部列清楚。以前一篇精读四十分钟,三十篇就是二十个小时。现在几十分钟后表格就躺在那了
然后追问细节。表格里看到某篇有意思,直接问这篇的实验设计是怎么控制变量的,和另一篇的方法有什么区别。最后搭综述框架:基于这张对比表,梳理这个领域的三个研究脉络和待解决的问题
数据分析是另一大场景。一个真实案例是三十万条消费行为数据,原计划两周洗完,实际三天搞定。更妙的是追问能力——这个 p 值说明什么、这组数据适合用什么模型、把图改成期刊风格配色换成蓝灰色系。相当于身边坐了个不嫌你烦的统计助教
AI 负责跑,你负责想。前提是你的知识库里真的有货
教师
教师最典型的一个痛点:每次打开 AI 都要从头解释”我教什么”
课标、教参、去年教案、优秀课例,每次新对话都得重新贴一遍。AI 不知道你教几年级、用什么版本,也不知道你学生的薄弱点在哪里
解决方法是把教学资料全存进 ima 知识库,在 WorkBuddy 里连接之后,先说一句:先读这几份材料,接下来只基于我的知识库回答,分析这节课学生最容易卡住的地方,每一条注明依据来自哪份材料,先别写教案
等它分析完,你确认方向对了,再说:基于以上分析,帮我写一份完整的教学设计,保存为 Word 文档
产物出来后记得回存进知识库。下次再教这一课,或者明年再备这节课,知识库里已经有了现成的参考。它知道上次的教学设计长什么样、学生哪里容易卡,不用再解释一遍
取、用、存三个字,闭环一次,AI 就进步一次
开发者和创作者
独立开发者的效率提升是最直观的
每天写完代码,让 WorkBuddy 把当天的技术决策和架构演进写成开发日志,沉淀进知识空间。技术选型、API 文档、项目背景,按目录树整齐归档。要查什么,一键检索。后来做新项目,直接让 WorkBuddy 基于知识库里已有的项目资料生成面向外部交付的说明文档,整个过程不需要手动复制粘贴
内容创作者也是重度用户。有人把公众号发布流程和乐享知识库打通,让内容在知识空间里形成选题、创作、自迭代的完整闭环。也有人把十几期读书会录音整理后沉淀进知识库,让 WorkBuddy 自动萃取出五大主题和可迁移思维模型,直接输出成可发布的视觉卡片
沉睡的会议记录,被唤醒成一整套可以发布的知识体系
企业管理者
最出圈的案例是一个零售企业信息中心的负责人。他一个人统筹全公司的信息化项目,没有专职开发团队
他的做法是把所有方案文档、项目进度、分享文章全部沉淀在乐享知识空间里。用 WorkBuddy 写代码、修 Bug、做测试。知识库负责管文档,Agent 负责执行
一个人打出了六个人的效率
这不是夸张。当知识不再是散落在个人电脑里的文件,而是被系统治理、统一检索、随时可调用的资产时,信息检索的成本断崖式下降,决策的响应速度指数级提升
数据安全与产品哲学:增强,而非替代
聊了这么多功能,最后我想说一个被讨论得很少但非常重要的话题
桌面 Agent 和云 AI 有一个根本性的区别——数据放在哪里
WorkBuddy 这个知识库模型说到底,就是你硬盘上一个普通文件夹。几个子目录加几个 Markdown 文件,全是你自己的东西,不经过任何人的服务器。哪天你把两个软件都卸了,这堆文件还在原地。换台电脑,整个文件夹拷走接着用
这意味着企业场景的数据安全不是一个”承诺”,而是一个物理事实。你的数据从来没有离开过你的控制范围
乐享知识库在这个基础上加了企业级权限管理——哪些人能调用哪些知识、哪些内容对哪些角色可见、所有操作日志可追溯。不是为了限制,而是在开放的协作和数据安全之间找到一个平衡
这里面藏着一个更深的产品哲学选择
市面上关于 AI 的主流叙事一直是”替代”——AI 替代程序员、替代分析师、替代客服。WorkBuddy 走了另一条路,叫增强
它的定位不是让 AI 取代人,而是让 AI 成为人的数字搭档。不是裁掉五个人让你自己干,而是让你一个人打出以前需要团队才能完成的工作量
这个定位有几个好处
员工不会抗拒。当你告诉一个人”这个工具能让你省掉百分之八十的杂活”,他会主动去学。当你告诉他”这个工具可能要取代你的岗位”,他会本能地抵触
经验不会流失。AI 增强人的逻辑是把个人的隐性知识转化为团队的显性资产。一个老教师几十年的教学经验,沉淀进知识库之后,新教师在这个库里提问,就能获得接近老教师水平的指导。人走了,经验留下
组织不会僵化。替代路线走到头是少数人控制 AI 取代多数人,组织规模收缩但活力下降。增强路线走到头是每个人都拥有了倍增的能力,一个人的团队可以做到以前不敢想的事
这也是 WorkBuddy 背后那家公司一贯的产品哲学——不争首发、不急变现、在一个方向上做长期持续的投入。即时通讯不是最先做的,游戏不是最先做的,支付和短视频都不是最先做的,但最终都在正确的产品逻辑下实现了追赶甚至超越
AI 这个赛道也正在重演这个模式
写在最后
回到这篇文章的标题——从对话到执行
这不是一句口号,而是一个正在发生的范式转移
对话式 AI 的天花板非常清晰:你问,它答。你有多少问题它就能给多少答案,但它永远不会主动帮你想一步。它的所有价值都取决于你够不够主动
执行式 AI 打开了完全不同的想象空间
它驻扎在你的电脑里,连接你的软件,读取你的知识库,在你不在的时候自己运转。你不需要学会怎么和它对话,你只需要告诉它你要什么、什么时候要。剩下的——找资料、理解上下文、跨软件操作、定时执行——它自己搞定
就像当年智能手机把计算能力从机房搬到了每个人的口袋里一样,桌面 Agent 正在把 AI 的执行能力从云端服务器搬到每个人的电脑桌面上
如果你还没试过,建议从一件最小的事开始。把你手头最近用到的一些核心资料存进一个文件夹,让 WorkBuddy 连接它,问一句”基于我的这些资料,帮我做一件事”
看看出来的结果
可能会有惊喜。这个惊喜不在于它有多聪明,而在于它居然真的记得你给它看过什么
这是之前所有的 AI 工具都没能做到的事
本文由 @学不会AI 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议

起点课堂会员权益





增强路线确实比替代路线好听,但企业里推行时,老板可能还是先问:那能不能用这个工具裁掉两个人?产品哲学再正,落到组织里也会被绩效压力扭曲。工具本身是中性的,最后是增强还是替代,取决于用它的那个组织的文化。