从对话到执行:WorkBuddy 对企业桌面 AI 智能体的实践探索

hh
1 评论 417 浏览 0 收藏 26 分钟

当AI从聊天框走向桌面,它不再只是回答问题的工具,而是能直接操作文件、联动软件、定时执行任务的数字搭档。本文以WorkBuddy为例,拆解桌面Agent如何通过工作空间、连接器和自动化,让AI真正“长记性”,从被动应答转向主动执行,重塑知识管理的工作流。

前段时间有个事让我想了很久

一个朋友把自己过去几年写的几万字随笔,没有特定目的、纯粹写给自己看的那种,一股脑扔给了 WorkBuddy。他就是临时起意,让它以这些文章为素材,仿照自己的写作风格,整理成一本结构完整的文集

十几分钟后,一份逻辑清晰、章节分明的书稿躺在他的文件夹里。质量之高让他不敢相信

他又试了一次。把自己长期积累的几十万字行业研究素材全部提交,让 WorkBuddy 以此为基础写一本深度分析的书稿。结果再次超出预期

这事让我重新审视了一个问题:当我们谈论 AI 的时候,是不是一直把它的天花板想得太低了

过去两年我们习惯了在聊天框里和 AI 对话。你问一句,它答一句。每次打开新对话,它都不记得你是谁。你把文档贴进去,它现场读几段给你一个回答,用完即丢。下次再用,从零开始。这种体验说白了就是一个高级点的搜索引擎加上文字润色功能

但 WorkBuddy 这类的桌面 Agent,正在改变这件事

它不是在聊天框里等你问,而是直接操作你的文件、联动你的软件、在你关电脑之后还能定时跑任务。AI 的角色正在从”回答者”变成”执行者”。这中间的跨越,可能比我们从 GPT-3 到 GPT-4 的体验升级还要大

为什么桌面 Agent 是今年最重要的 AI 产品形态

说它是”最重要”不是因为技术最前沿,而是因为它离用户的真实工作最近

我问过很多产品经理和创业者同一个问题:你现在用 AI 最烦的是什么

排名第一的回答永远是——每次都要重新解释我是谁

你花半小时贴资料、讲背景、描述自己的偏好,终于调出一个满意的结果。第二天打开新对话,一切归零。它不记得你教几年级、用什么教材、上次那个方案改过几版

排名第二的是——它只能聊,不能干

你让它写一份方案,它能写。但你让它把方案保存到指定文件夹、按照你的模板调好格式、然后发一份到你的邮箱——做不到。你得复制粘贴出来,自己处理后续的所有步骤

这两个痛点的根源是同一个:Chat 式 AI 是一个无状态的、纯文本交互的工具。它没有记忆,没有操作权限,没有和你的工作环境产生任何连接

桌面 Agent 走了另一条路

它把工作空间指向你的本地文件夹,这意味着它能读写你硬盘上的真实文件。它通过连接器接入你日常使用的软件——邮箱、文档、知识库、浏览器。它还能设置定时任务,在你不在电脑前的时候自动运行

这三个能力叠加在一起,AI 就不再是一个聊天工具了,它变成了一个驻扎在你电脑里、了解你的工作习惯、能替你执行任务的数字搭档

这就是”从对话到执行”的核心

WorkBuddy 的产品逻辑:不是”聊”,是”干”

拆开来看,WorkBuddy 的产品设计透露着一个很清晰的思路

工作空间是最关键的设定

你把一个文件夹指定为 WorkBuddy 的工作空间,它就能在里面读、写、建目录、改文件。这听起来是个很小的功能点,但产品逻辑上它是整个桌面 Agent 的基石。因为这意味着 AI 的输出不再只是聊天框里的一段文本,而是你电脑上一个真实存在的文件

有人用这个配合 Obsidian 搭了一套会自动更新的个人知识库。你把网上看到的好文章剪藏进一个叫 raw 的文件夹,跟 WorkBuddy 说一句把这些新文章编译成知识页,它就自己一篇篇读、提取关键信息、写成相互链接的知识页面存进 wiki 文件夹

整个过程不需要你手动整理,不需要你开新的对话重新贴文章。你只负责往 raw 里扔东西,剩下的编译、归类、更新目录、写日志,全是它自己跑

连接器让它不再是一座孤岛

桌面 Agent 如果只能操作本地文件,那它的价值还是有限。真正让它进入工作流的,是它和外部工具的连接能力

WorkBuddy 目前接入了 ima 知识库、乐享知识空间、微信小程序、腾讯文档和邮箱等。这意味着它能从你的知识库里调资料来回答问题,能在腾讯文档里直接生成文件,能去你的邮箱里翻审稿意见然后整理成表格

有个科研用户的用法让我印象很深。他把几年的文献 PDF 全传进 ima,在 WorkBuddy 里连接了知识库之后,说了一句话:读取这个知识库里的所有论文,帮我梳理这个领域的研究脉络和待解决的问题

几十分钟后,一份完整的文献综述框架躺在他的文件夹里。而且每一处引用都来自他知识库里的真实论文,不是模型编造出来的假文献

这个场景背后是一个产品逻辑的质变。以前的 AI 是基于通用语料给你一个泛泛的答案,现在它是基于你的专属知识库给你一个针对性的输出。知识的纯度和密度完全不同,结果的质量自然天差地别

定时自动化让 AI 从被动变主动

这是最容易被忽视的功能。WorkBuddy 可以设定时任务,到点了自动执行一段指令

什么意思呢

你设一个每天早上七点半的任务:扫一眼 raw 文件夹,有新文件就编译进知识库,没动静就什么都不干。再设一个每周六晚上的任务:给知识库做一轮体检,看看有没有断掉的链接、被孤立的页面、互相矛盾的说法,有问题列出来等你确认

设完之后你就不用管了。知识库自己更新,自己检查健康状态。你唯一要做的事就是往里面扔新资料

这种体验和”打开聊天框问一句”完全不同。前者是你找 AI,后者是 AI 找你。这是一个用户心智的根本转变

知识库 + Agent:AI 终于长记性了

说到知识库,有一个背景值得展开

这套”让 AI 提前整理知识而不是等提问再翻资料”的玩法,叫做 LLM Wiki。它是 OpenAI 创始成员 Karpathy 今年提出来的思路

他的逻辑很简单。平时你上传文件给 AI 提问,流程是这样的:你提问,AI 临时去资料里扒几段沾边的拼个回答,答完就扔。下次再问,重新读一遍。文件越多,找得越慢,回答越泛

Karpathy 把这事倒了过来:别等提问了再理解,提前让 AI 把每份资料读透,整理成一页一页互相链接的知识页面。新资料进来就往上补,所有的理解都被存下来

他说了一句很精准的话:Obsidian 是工作台,大模型是程序员,wiki 是它写出来的东西

WorkBuddy 实践这套玩法,核心就四步

第一步,存资料。网上的文章用浏览器插件一键剪藏,本地 PDF 和 Markdown 文件直接拖进 raw 文件夹。不用分类,不用打标签,全扔进去就行

第二步,编译。跟 WorkBuddy 说一句:去把 raw 里新到的那批文章编进 wiki,该开页开页,该并页并页。它就会自己一篇篇读,概念归概念,人物归人物,摘要归摘要。页和页之间自动打上关联链接

第三步,查询。编译完之后你可以问它各种问题,它不会把整个库翻一遍,而是先看目录,圈出相关的页面,只读这几页然后回答。每个回答末尾附上依据来自哪一页

第四步,检查。用定时任务让它每周做一轮知识库体检,查断链、查孤页、查冲突。发现的问题列出来等你确认,确认了再改

这套流程跑通之后,知识库就不再是一个文件堆了,而是一个会自我更新的有机体

更重要的是,新资料不断进来,知识库不断变厚,每一次查询都站在之前所有理解的基础上。AI 终于不再”失忆”了

同样的逻辑在企业场景里被放大得更明显

一个教师把几年的教案、试卷、学情记录全存进知识库。新学期备课时让 WorkBuddy 调出库里的资料,直接生成基于真实学情的新教案和配套 PPT。产物出来后回存进库,下一次再教这一课,它就站在上一次的肩膀上

这才是真正意义上的经验沉淀。不是存在某个文件夹里再也不打开,而是每一次产出都变成下一次可调用的资产

软件联动:从孤岛到生态的质变

到这我想聊一个更深的问题

桌面 Agent 的真正威力不在于自己有多强,而在于它能把已有工具串联起来

过去我们每装一个软件,就是建了一座孤岛。你的笔记在 Obsidian 里,文档在腾讯文档里,知识在 ima 里,邮件在邮箱里。数据是割裂的,工作流是断裂的

WorkBuddy 通过一个文件协议就把这事解决了——两个软件共享同一个文件夹,一个写,一个看

你用 Obsidian 打开知识库文件夹,看到的是 WorkBuddy 刚编译好的知识页。你在浏览器里剪藏了一篇文章,WorkBuddy 扫描到 raw 文件夹的新文件就开始自动编译。两个软件之间没有任何绑定,全靠同一个文件夹接上头。哪天你想把其中一个换掉,另一个照常用,资料一直都在

更进一步的是连接器体系

ima 知识库是你的资料柜,负责把零散的文件、论文、教案收好、管好、权限分级。WorkBuddy 是你的执行搭档,负责调用这些资料帮你干活、交付成品

取、用、存三个字

从知识库调资料,在 WorkBuddy 里执行任务,产物回存进知识库。闭环一旦跑通,知识就不再只是躺着的文件,而是会流动起来的生产资料

乐享知识空间让这个逻辑在团队场景里更完整。它支持企业级权限管理,哪些知识能被谁调用、谁可以编辑、谁只能查看,边界清晰。WorkBuddy 从乐享调取资料生成方案或报告时,团队也更容易回到原始资料确认依据——不会出现”AI 写完了但没人知道它参考了哪版材料”的尴尬

有一个人用法特别有意思

他把老板两年的邮件、周报、会议纪要、录音转写全沉淀进乐享知识库,然后在 WorkBuddy 里问了一个问题:老板会怎么批这个方案

输出的吐槽语气、决策偏好、甚至那句口头禅,相似度接近九成

这不是简单的信息提取,是多源异构数据的连接、清洗、提炼和建模。四个割裂的信息源,通过知识库和 Agent 的组合,被还原成了一个人的决策风格

定时自动化:AI 从”等人问”到”主动干”

说实话,定时任务是 WorkBuddy 目前最被低估的能力

大多数人理解的 AI 还是”我打开对话框,输入问题,等它回答”。但定时任务的逻辑刚好反过来——你设置一个时间、写好一段指令,到点了它自动跑,你甚至不需要在场

这听起来是个很小的功能点,但产品哲学的含义很不一样

它意味着一部分工作不再需要”发起”了

比如每天早上开工前,知识库里新存的资料已经被自动编译好了,你坐下来就能直接查询。比如每周日晚上,一份知识库健康报告已经躺在你的文件夹里,告诉你这周新增了哪些页面、有哪些链接断掉了、哪些说法之间存在冲突

你不需要记得去做这些事,不需要分心去手动触发。AI 变成了一个前台后台同时运行的操作系统,而不是一个随叫随到的客服

有个场景让我觉得这个方向的空间还很大

一个研究生给 WorkBuddy 设了两个定时任务。第一个是每天早上九点,自动搜索他研究方向的最新论文和资讯,整理成简报存到文件夹。第二个是每周五下午,汇总他这一周所有的实验数据和工作记录,生成周报初稿

效果是每天早上到工位,泡好咖啡,一份研究领域今日动态已经等在那里了。别人还在刷公众号追热点,他的热点是自己送上门来的

这就是从主动到被动的范式转变。而真正成熟的企业级桌面 Agent,未来可能有几十个这样的定时任务在后台持续运转——知识更新、数据清洗、报表生成、风险监控、竞品追踪。它们不需要你来发起,它们自己知道什么时候该做什么事

企业场景全貌:从科研到管理的一手实践

前面讲了很多方法论,这一章把镜头拉近,看看不同角色在实际工作中怎么把这些方法用起来

科研工作者

文献综述是研究生的共同噩梦。导师一句”把这个方向梳理一下”,背后是几十篇 PDF 和无数个通宵

实际的工作流分成三步。把下载好的 PDF 全扔进一个文件夹,导入知识库,让 WorkBuddy 每篇都读完,输出一张对比表格——研究问题、方法、核心结论、局限性全部列清楚。以前一篇精读四十分钟,三十篇就是二十个小时。现在几十分钟后表格就躺在那了

然后追问细节。表格里看到某篇有意思,直接问这篇的实验设计是怎么控制变量的,和另一篇的方法有什么区别。最后搭综述框架:基于这张对比表,梳理这个领域的三个研究脉络和待解决的问题

数据分析是另一大场景。一个真实案例是三十万条消费行为数据,原计划两周洗完,实际三天搞定。更妙的是追问能力——这个 p 值说明什么、这组数据适合用什么模型、把图改成期刊风格配色换成蓝灰色系。相当于身边坐了个不嫌你烦的统计助教

AI 负责跑,你负责想。前提是你的知识库里真的有货

教师

教师最典型的一个痛点:每次打开 AI 都要从头解释”我教什么”

课标、教参、去年教案、优秀课例,每次新对话都得重新贴一遍。AI 不知道你教几年级、用什么版本,也不知道你学生的薄弱点在哪里

解决方法是把教学资料全存进 ima 知识库,在 WorkBuddy 里连接之后,先说一句:先读这几份材料,接下来只基于我的知识库回答,分析这节课学生最容易卡住的地方,每一条注明依据来自哪份材料,先别写教案

等它分析完,你确认方向对了,再说:基于以上分析,帮我写一份完整的教学设计,保存为 Word 文档

产物出来后记得回存进知识库。下次再教这一课,或者明年再备这节课,知识库里已经有了现成的参考。它知道上次的教学设计长什么样、学生哪里容易卡,不用再解释一遍

取、用、存三个字,闭环一次,AI 就进步一次

开发者和创作者

独立开发者的效率提升是最直观的

每天写完代码,让 WorkBuddy 把当天的技术决策和架构演进写成开发日志,沉淀进知识空间。技术选型、API 文档、项目背景,按目录树整齐归档。要查什么,一键检索。后来做新项目,直接让 WorkBuddy 基于知识库里已有的项目资料生成面向外部交付的说明文档,整个过程不需要手动复制粘贴

内容创作者也是重度用户。有人把公众号发布流程和乐享知识库打通,让内容在知识空间里形成选题、创作、自迭代的完整闭环。也有人把十几期读书会录音整理后沉淀进知识库,让 WorkBuddy 自动萃取出五大主题和可迁移思维模型,直接输出成可发布的视觉卡片

沉睡的会议记录,被唤醒成一整套可以发布的知识体系

企业管理者

最出圈的案例是一个零售企业信息中心的负责人。他一个人统筹全公司的信息化项目,没有专职开发团队

他的做法是把所有方案文档、项目进度、分享文章全部沉淀在乐享知识空间里。用 WorkBuddy 写代码、修 Bug、做测试。知识库负责管文档,Agent 负责执行

一个人打出了六个人的效率

这不是夸张。当知识不再是散落在个人电脑里的文件,而是被系统治理、统一检索、随时可调用的资产时,信息检索的成本断崖式下降,决策的响应速度指数级提升

数据安全与产品哲学:增强,而非替代

聊了这么多功能,最后我想说一个被讨论得很少但非常重要的话题

桌面 Agent 和云 AI 有一个根本性的区别——数据放在哪里

WorkBuddy 这个知识库模型说到底,就是你硬盘上一个普通文件夹。几个子目录加几个 Markdown 文件,全是你自己的东西,不经过任何人的服务器。哪天你把两个软件都卸了,这堆文件还在原地。换台电脑,整个文件夹拷走接着用

这意味着企业场景的数据安全不是一个”承诺”,而是一个物理事实。你的数据从来没有离开过你的控制范围

乐享知识库在这个基础上加了企业级权限管理——哪些人能调用哪些知识、哪些内容对哪些角色可见、所有操作日志可追溯。不是为了限制,而是在开放的协作和数据安全之间找到一个平衡

这里面藏着一个更深的产品哲学选择

市面上关于 AI 的主流叙事一直是”替代”——AI 替代程序员、替代分析师、替代客服。WorkBuddy 走了另一条路,叫增强

它的定位不是让 AI 取代人,而是让 AI 成为人的数字搭档。不是裁掉五个人让你自己干,而是让你一个人打出以前需要团队才能完成的工作量

这个定位有几个好处

员工不会抗拒。当你告诉一个人”这个工具能让你省掉百分之八十的杂活”,他会主动去学。当你告诉他”这个工具可能要取代你的岗位”,他会本能地抵触

经验不会流失。AI 增强人的逻辑是把个人的隐性知识转化为团队的显性资产。一个老教师几十年的教学经验,沉淀进知识库之后,新教师在这个库里提问,就能获得接近老教师水平的指导。人走了,经验留下

组织不会僵化。替代路线走到头是少数人控制 AI 取代多数人,组织规模收缩但活力下降。增强路线走到头是每个人都拥有了倍增的能力,一个人的团队可以做到以前不敢想的事

这也是 WorkBuddy 背后那家公司一贯的产品哲学——不争首发、不急变现、在一个方向上做长期持续的投入。即时通讯不是最先做的,游戏不是最先做的,支付和短视频都不是最先做的,但最终都在正确的产品逻辑下实现了追赶甚至超越

AI 这个赛道也正在重演这个模式

写在最后

回到这篇文章的标题——从对话到执行

这不是一句口号,而是一个正在发生的范式转移

对话式 AI 的天花板非常清晰:你问,它答。你有多少问题它就能给多少答案,但它永远不会主动帮你想一步。它的所有价值都取决于你够不够主动

执行式 AI 打开了完全不同的想象空间

它驻扎在你的电脑里,连接你的软件,读取你的知识库,在你不在的时候自己运转。你不需要学会怎么和它对话,你只需要告诉它你要什么、什么时候要。剩下的——找资料、理解上下文、跨软件操作、定时执行——它自己搞定

就像当年智能手机把计算能力从机房搬到了每个人的口袋里一样,桌面 Agent 正在把 AI 的执行能力从云端服务器搬到每个人的电脑桌面上

如果你还没试过,建议从一件最小的事开始。把你手头最近用到的一些核心资料存进一个文件夹,让 WorkBuddy 连接它,问一句”基于我的这些资料,帮我做一件事”

看看出来的结果

可能会有惊喜。这个惊喜不在于它有多聪明,而在于它居然真的记得你给它看过什么

这是之前所有的 AI 工具都没能做到的事

本文由 @学不会AI 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 增强路线确实比替代路线好听,但企业里推行时,老板可能还是先问:那能不能用这个工具裁掉两个人?产品哲学再正,落到组织里也会被绩效压力扭曲。工具本身是中性的,最后是增强还是替代,取决于用它的那个组织的文化。

    来自广东 回复