从 ChatGPT 到 Agent:AI 每半年换一次牌桌,我们靠什么不掉队?
从ChatGPT到Agent,AI正从生成内容走向执行任务。本文梳理2022-2025年AI能力演进,揭示Prompt、RAG、Workflow等概念背后的主线:AI系统化,人的价值随之重排。掌握底层逻辑,才能在变革中保持竞争力。

2022年底,很多人第一次打开 ChatGPT 时,体验很像突然遇见了一个“什么都能聊”的陌生人。
你问它一个问题,它能顺着往下说;你让它改一封邮件、写一段文案、解释一个概念,它几秒钟就能给出像模像样的答案。那时人们讨论最多的,还是“Prompt应该怎么写”“AI会不会胡说”“它能不能代替搜索引擎”。
几年后,我们面对的已经不是同一个问题。
AI可以读完一批文件再回答,可以搜索网页、调用数据库、运行代码,也可以看着屏幕移动鼠标、点击按钮。它不再满足于给你一段文字,而是开始接过一个目标,连续工作几十分钟甚至更久。人们谈论的词也从Prompt迅速扩展到RAG、Workflow、Agent、MCP、Computer Use、Context Engineering、Skills、Evals……
这些词总带着一点催促感:刚弄懂一个,新的又来了。今天还在研究Prompt,过两个月,别人已经开始谈Agent和Skills。
于是,AI时代最真实的焦虑,并不是“我今天不会用某个工具”,而是:如果工具三个月一变、范式半年一换,我们究竟要掌握什么,才能在五年后仍然有竞争力?
我越来越觉得,要回答这个问题,不能再追着产品名单跑,而要把过去几年的变化重新摆在一起看。那些看似零散的新名词,其实指向同一条主线:AI正在从一个生成内容的工具,变成一个能够理解目标、连接资源并执行任务的系统。
而人的价值,也会沿着这条主线被重新排列。

图1:2022—2026,AI能力从生成、连接、感知、执行走向系统化。
一、先澄清一件事:新名词,不等于新发明
如果按网络热度来写AI史,很容易产生一种错觉:好像ChatGPT出现以后,RAG、Agent、Workflow才接连被发明出来。
事实并非如此。
“智能体”在人工智能研究中是一个很早的概念。1995年的经典论文《Intelligent Agents: Theory and Practice》,已经在讨论智能体的理论、架构和应用。今天的LLM Agent之所以重新受到关注,不是因为“Agent”这个词刚刚诞生,而是大语言模型第一次让普通开发者可以用自然语言搭出相当通用的智能体。
RAG也是类似的情况。Lewis等人在2020年发表的论文,已经系统提出“检索增强生成”:先从外部知识中找出相关内容,再让模型基于这些内容生成答案。2023年以后,企业纷纷建设大模型知识库,RAG才从论文术语变成产品经理、运营和普通用户都经常听到的词。
Workflow更不是AI专属名词。企业软件早就在用流程编排解决“先做什么、再做什么、失败后怎么办”。大模型出现后,只是把原本完全由规则控制的流程,加入了自然语言理解、内容生成和动态判断。
所以,下面这条时间线不是严格的“技术发明史”,而是一条大众认知与产品化的演进史。它更关心一项能力在什么时候真正进入产品、工作和普通人的生活。
这一区分很重要。它能让我们不被名词牵着走,而是看见每个名词背后究竟补上了AI的哪块能力。

图2:Agent、RAG等概念有更早源流,2022年以后发生的是大规模产品化与破圈。
二、2022:AI第一次让普通人感到“我也能创造”
2022年是生成式AI真正破圈的一年。
这一年,DALL·E 2进入公开测试,Midjourney早期版本开始被大量创作者使用,Stable Diffusion公开发布。过去需要画师、摄影师或设计软件才能实现的视觉想法,突然可以从一句自然语言开始。
同年11月30日,OpenAI发布ChatGPT研究预览版。它未必是当时能力最强的模型,但它把复杂的语言模型装进了人人都能理解的聊天窗口。普通用户不需要学API,不需要懂机器学习,也不需要先读一本使用手册,只要开口说话就行。
过去,人使用软件,需要先理解软件的菜单、按钮和操作逻辑;从ChatGPT开始,软件第一次大规模地反过来适应人的语言。自然语言开始成为一种新的交互界面。
这一阶段,人们最先意识到的能力是Prompt:怎么把要求说清楚,怎么补充背景,怎么指定语气和格式。
但当时大多数使用仍停留在“一问一答”:人提出一个请求,AI生成一段文字或一张图。结果好不好,很依赖用户是否会描述,也依赖模型训练时已经学过什么。它能生成,却很难知道你公司昨天更新了什么规则;它能给建议,却不能真的替你打开系统完成操作。
2022年解决的主要是“AI能不能生成”。也是从这里开始,表达第一次如此直接地影响生产结果。
三、2023:AI开始连接知识,也开始伸出“手”
2023年,竞争不再只是“谁更会聊天”。人们开始追问:AI能不能看懂图片?能不能读取我的资料?能不能调用外部工具?能不能进入真实业务?
3月,GPT-4发布,图像输入和更强的复杂任务能力让“多模态”进入大众讨论。6月,OpenAI在API中加入函数调用能力:开发者可以把外部函数的名称和参数告诉模型,让模型判断何时调用,并返回结构化参数。
这一步看起来很技术,实际意义却很直白:模型开始从“只能说”走向“能够驱动软件做事”。
比如,用户说“帮我看看上海明天会不会下雨”,模型本身不必记住天气,而是识别意图、调用天气接口,再组织答案;用户说“把这个客户下周的拜访安排进日历”,模型可以把自然语言转换成日历系统需要的字段。
同一时期,RAG迅速成为企业落地大模型的常见路径。原因也不复杂:企业真正需要的,不是一个只懂公共知识的模型,而是一个能基于内部制度、商品资料、合同、客服案例和实时数据回答问题的系统。
这时,AI应用逐渐有了今天熟悉的样子:
用户提出问题,系统先判断意图;需要知识时去检索;需要数据时调用接口;模型结合上下文生成答案;涉及风险时再交给人工。
Workflow也因此走到台前。因为真实业务很少靠一次模型调用就能完成。资料要先清洗,问题要先分类,结果要经过格式检查,高风险操作还要确认和留痕。很多可靠的AI产品,本质上不是“接入一个最强模型”,而是把模型放进一条设计清楚的流程里。
2023年补上的,是知识与工具的连接能力。只会提问已经不够了,人还得会拆任务、找信息源、设计流程,并且验证答案。
四、2024:AI开始看见更完整的世界,也开始走出聊天框
到了2024年,三个方向同时加速:多模态、长上下文和行动能力。
GPT-4o把文本、图像和音频放进更自然的实时交互中;Gemini 1.5把长上下文推到百万Token级别的产品讨论中;Sora展示了文本生成长视频的可能。模型能接收的不再只是几段文字,而可能是一批文件、一段录音、一段视频、一套代码。
这改变了“会使用AI”的含义。

图3:AI开始同时处理资料、视觉与声音,并尝试操作软件。
上下文窗口变长,并不等于把所有资料一股脑扔进去就会得到好结果。信息越多,噪声也越多。什么资料该进入当前任务,哪些是长期规则,哪些只是临时参考,彼此冲突时以谁为准,开始成为新的工程问题。后来被频繁讨论的Context Engineering,正是从“把一句Prompt写漂亮”转向“为模型组织一个有效的信息环境”。
10月,Anthropic公开测试Computer Use:模型可以看屏幕、移动鼠标、点击和输入。一个原本只能通过API连接软件的模型,现在也开始尝试操作那些没有专门接口、只为人设计的图形界面。
11月,Anthropic开源MCP。它试图用一套标准,连接AI应用与外部数据、工具和开发环境。可以把它理解成AI世界的通用插口:没有统一协议时,每个AI应用连接每个系统都要单独适配;有了协议,数据源和工具可以用更一致的方式被发现和调用。
12月发布技术报告的DeepSeek-V3,则让全球进一步看见中国团队在大模型架构、训练效率和开放权重路线上的能力。需要说得准确一点:DeepSeek并不是在2024年才突然出现,开源模型也不是从DeepSeek才开始。但V3以及随后出现的R1,确实让“高性能模型能否以更开放、更低成本的方式扩散”成为全球议题。
到了这一步,AI得到更多“感官”、更大的工作台和连接外部世界的接口。真正稀缺的也不再只是表达,而是组织上下文、配置权限和搭建系统的能力。
五、2025:从回答问题,转向接过任务
2025年的关键词,是Reasoning与Agent。
1月,DeepSeek-R1公开模型与论文。它受到广泛关注,不只是因为基准成绩,还因为它展示了强化学习驱动的推理行为,并开放了R1、R1-Zero及多款蒸馏模型。对普通用户而言,更直接的变化是:模型在数学、代码和复杂问题上,不再只是迅速给出一个看起来合理的答案,而是愿意投入更多计算去推演步骤。
3月,OpenAI发布Responses API与Agents SDK,把网页搜索、文件搜索、Computer Use、智能体编排、护栏和执行追踪放到一组更完整的开发工具中。5月发布的Codex研究预览版,则把Coding Agent带进更明确的任务形态:用户不再逐行告诉AI怎么写,而是交给它一个代码库和目标,让它读文件、修改代码、运行测试,再把结果交回来。
这就是“聊天助手”和“智能体”最实用的区别。
聊天助手主要等待问题,然后给出回答;智能体围绕目标循环工作:观察当前状态,决定下一步,调用工具,检查结果,再根据变化继续行动。它并不意味着完全自主,更不意味着可以不受监督。恰恰相反,任务越长、工具权限越大,越需要沙箱、审批、日志、失败恢复和人工验收。

图4:Agent围绕目标持续观察、规划、行动和检查,过程需要权限、沙箱、日志与人工确认。
这一年,多Agent也从演示走向真实产品探索。Anthropic公开介绍的研究系统,会由一个主智能体规划研究过程,再让多个子智能体并行搜索。多Agent的价值不是“开更多聊天窗口”,而是把可以并行、可以分工的任务交给不同执行单元,再由上层协调和汇总。
10月,Anthropic推出Agent Skills。一个Skill可以包含说明、脚本、参考资料和模板,智能体在需要时加载。它像给一名通用员工配了一本岗位手册:MCP解决“能连接什么”,Skill更接近“拿到这些工具后,按什么方法把事情做好”。
2025年,AI从“给我答案”走向“替我推进任务”。人的工作重点也开始移动:不一定亲自完成每一步,但必须定义目标、配置环境、看住过程并验收结果。
六、2026:模型竞争之外,真正的战场变成“工作系统”
2026年还没有结束,现在当然谈不上盖棺定论。但截至目前,一个变化已经很清楚:行业不再只比较模型一次回答有多聪明,而是越来越关心它能不能稳定工作。
这背后出现了几个新的重点。
第一,智能体开始承接更长时间的任务。它需要在受控环境里读写文件、执行命令、保存进度,在上下文耗尽或任务中断后继续推进。模型能力固然重要,但决定任务能否完成的,往往还有外层的Agent Harness,也就是负责工具调用、状态管理、权限、安全和反馈循环的执行框架。
第二,Skills开始从一家产品的功能走向可移植的开放格式。2026年,OpenAI也把Skills用于ChatGPT、Codex和API。过去,个人经验经常散落在聊天记录里;现在,它可以被整理成说明、脚本、模板和验收规则,成为能被智能体重复调用的能力包。
第三,Evals的重要性迅速上升。单轮聊天时,人看一眼答案大致就知道好不好;智能体执行几十个步骤后,最后一句“已完成”并不能证明事情真的做对了。是否生成了正确文件、是否修改了不该修改的数据、是否满足业务规则、换一个模型后是否退化,都需要明确的测试和验收机制。
第四,人机协作的基本单位正在变化。过去是一名员工使用一个软件;现在可能是一个人同时管理多个并行任务,让不同智能体研究、编码、分析、制作,再由人处理冲突和最终决策。
所以,2026年的关键词未必是某个更大的模型,而可能是:Skills、Harness、Sandbox、Permissions、Evals、Memory、Multi-Agent。它们共同回答的是同一个问题:怎样把偶尔惊艳的模型能力,变成长期稳定、可控、可复用的生产能力?
七、把这些名词放回一张地图里
名词很多。我更愿意把它们想成一支临时组建的“AI工作队”。
Prompt是你这一次交代的任务;Context是它开工时能看到的全部现场信息;RAG像资料室,负责在需要时找回相关知识;Tool是它能够使用的手;MCP是连接这些手和外部系统的通用接口;Workflow是预先规定好的流程;Agent是能够根据现场情况决定下一步的执行者;Skill是沉淀下来的岗位方法、模板和脚本;Memory负责保留跨任务有价值的状态;Eval则是验收标准与质检机制。
它们并不是相互替代的流行词。
有了Agent,Workflow不会消失。退款审批、风控拦截、财务结算这类流程,仍然需要确定性的规则。智能体适合处理不确定、需要理解和调整的部分,传统代码适合处理可计算、可校验、必须稳定的部分。
有了长上下文,RAG也不会自动失去价值。能装下一座图书馆,不等于每次都应该把整座图书馆搬到桌面上。检索的意义仍然在于找到当前真正相关、更新及时、来源明确的信息。
有了MCP,也不等于AI自然会把工作做好。插上工具,只代表它“可以使用”;流程怎么走、什么情况要停、结果什么样算合格,仍然需要Workflow、Skill和Eval。
看清这些关系后,我们就能得到一条更稳定的技术主线:
模型负责理解和生成,Context与RAG负责提供信息,Tool与MCP负责连接外部世界,Workflow与Agent负责任务推进,Skill负责复用经验,Eval与权限系统负责把结果变得可信。

图5:真正可用的AI系统,不只是一颗模型,而是一组互相连接、彼此制约的能力模块。
这条主线,比背诵任何一份产品名单更重要。
八、AI时代,人的六种能力会被重新定价
如果AI的能力从“生成”走向“执行”,人的竞争力就不能再只靠熟练操作某个工具。
一个工具可能半年后改版,一种Prompt技巧可能随着模型升级失去意义。但下面六种能力,会随着AI变强而更有价值。
1. 定义问题:知道真正要解决的是什么
AI最容易放大的,不只是好想法,也包括错误方向。
“帮我做一个竞品分析”并不是一个清晰问题。分析是为了决定要不要进入市场,还是为了确定功能优先级?比较的是用户规模、商业模式、产品体验,还是技术架构?时间范围是什么?最后谁要用这份结论做什么决定?
这些问题没有想清楚,AI越能干,越可能快速生产一大堆没有决策价值的内容。
定义问题的本质,是把“我隐约想要什么”变成“我们要改变哪个结果”。这是人的第一责任,也是最难外包给AI的部分。
2. 结构化表达:让意图能够被执行
AI时代确实会把表达能力推到一个新的位置,但这里的表达,不是话多,不是会写华丽Prompt,也不是对AI使用客气或神秘的咒语。
真正有效的表达,至少包含六件事:目标是什么,背景是什么,输入在哪里,有哪些约束,希望它怎么推进,最后如何验收。
这与一个优秀管理者给同事布置任务、一个产品经理写需求、一个导演给团队讲戏,本质上是同一种能力。
以前表达不清,可能导致一次会议低效;当智能体可以连续调用工具并修改真实环境时,表达不清可能让错误被自动放大。自然语言成为操作界面之后,逻辑清晰本身就是生产力。
3. 任务拆解与系统思维:知道哪里用AI,哪里不用
复杂工作很少适合一句话全交给AI。
研究一家公司,可以拆成资料搜集、来源分级、事实核对、业务分析、反例查找和结论撰写;制作一篇文章,可以拆成选题、结构、资料、初稿、事实核查、自然化、配图和发布检查。
拆解之后,才能判断哪些步骤适合规则,哪些适合检索,哪些适合模型判断,哪些必须人工确认。也只有这样,失败时才能知道问题发生在输入、知识、工具、流程、模型还是验收标准。
未来真正熟练使用AI的人,不一定最会写Prompt,但往往最会设计一个能运行、能检查、能调整的系统。
4. 跨领域迁移:把一个地方练成的能力带到另一个地方
AI降低了进入陌生领域的门槛。它可以解释术语、整理资料、生成样例、补充代码,也可以陪你快速试错。这意味着一个人不必先花几年成为另一个行业的专家,才能开始做一次有价值的尝试。
但这不代表专业会消失,也不代表人人都应该变成“什么都懂一点”的泛泛全才。
更有竞争力的结构,可能是:一个足够深的专业锚点,一套可以迁移的方法,再加上一片不断扩大的认知边界。
一个在产品领域练过用户研究、需求判断和项目推进的人,可以把这套方法迁移到内容、咨询或个人创业;一个在写作中练过结构、叙事和读者意识的人,也可以把它迁移到Prompt设计、智能体指令和产品交互。
真正可复用的,不是某个岗位的表面动作,而是你在做到优秀的过程中形成的观察、建模、验证和复盘能力。
5. 验证与判断:不把“像答案”当成答案
AI最危险的地方,往往不是完全不会,而是能给出一个非常像正确答案的结果。
模型会产生幻觉,检索会找到过时材料,工具可能调用失败,智能体也可能把中间失败误判为完成。任务越长,错误越可能沿着流程累积。
因此,AI时代的判断力至少包括三层:事实能不能由可靠来源支持,推理有没有遗漏关键条件,结果能不能经受真实环境的测试。
写文章要查原始资料,做数据分析要核对口径,写代码要运行测试,执行操作要确认最终状态。人可以把大量过程交给AI,但不能把最终责任也一并交出去。
6. 资产化:把一次成功变成下一次的起点
很多人每天都在使用AI,却没有形成积累。今天调出一段好Prompt,明天找不到;这次踩过的坑,下次换个聊天窗口又踩一遍。
真正能形成复利的做法,是把有效经验沉淀下来:稳定的任务说明写成模板,反复执行的步骤变成Workflow,领域资料整理成可维护的知识源,容易出错的地方变成检查清单,成熟方法进一步封装成Skill。
当这些资产能够被复用、组合和更新时,你拥有的就不再是一堆聊天记录,而是一套不断增长的个人能力系统。

图6:定义、表达、拆解、迁移、验证和资产化,共同构成更耐用的个人能力系统。
九、别急着做“全才”,先成为一个会迁移的深度学习者
AI时代经常出现一种判断:未来不再需要专才,只需要全才。我不太认同这种说法。
这句话只说对了一半。
如果所谓全才,是每个领域都知道几个名词、每个工具都试用十分钟,那它很难形成真正价值。AI本身就比人更擅长快速提供表层知识。一个人如果没有任何专业锚点,也缺少判断质量的依据。
但如果专才意味着只会一种固定工具、只熟悉一套既有流程,也会越来越脆弱。因为AI最先改变的,恰恰是大量标准化、可描述、可重复的工作。
未来更需要的,可能不是“全才”和“专才”的二选一,而是两者重新组合:
在一个领域里足够深入,知道什么叫真正做好;同时能够把自己在这个领域形成的方法抽象出来,借助AI迁移到其他场景;还愿意理解技术、商业、社会和人,而不是把自己关在岗位说明书里。
这种人并非什么都会,而是遇到新问题时,知道该如何快速建立坐标系、找到高质量资料、做出最小实验,并在反馈中逼近专业。
他的优势不只是“拥有多少知识”,而是“形成有效能力的速度”。
十、一套不会被新名词打乱的学习方法
面对每天更新的AI资讯,最差的学习方式之一,就是把“知道”误当成“掌握”。收藏几十篇文章、关注上百个账号、记住一串产品名,很容易制造进步的幻觉。
对普通人来说,我更推荐一套不那么费力、但能留下东西的办法:扫描、理解、实验、沉淀、迁移。
第一步:扫描——建立少量可信的信息源
不需要全天追新闻。选择几类稳定来源即可:模型公司的官方发布、重要开源项目、研究机构或论文、少量真正做过产品实践的人。
扫描的目的不是把每条消息都看完,而是发现“能力边界是否发生变化”。一个模型跑分提高两分,未必影响你的工作;但如果AI第一次可以稳定处理某种输入、调用某类工具、完成更长任务,就值得认真研究。
第二步:理解——用“概念六问”拆掉新名词
每遇到一个新概念,不妨问六个问题:
它解决什么问题?过去怎么解决?它依赖哪些能力?与相邻概念有什么区别?它在哪些情况下会失败?它能进入我的哪个真实任务?
用这六问去看MCP,你会发现它解决的是连接标准问题,不会自动提高模型智力;用它去看Skill,你会发现它解决的是程序性知识复用问题,不是再训练一个新模型;用它去看Agent,你会发现关键不在名字,而在是否围绕目标形成“观察—行动—反馈”的循环。
第三步:实验——每个概念只找一个真实任务
不要为了学习Agent而凭空造一个Agent,也不要为了学RAG先看完所有向量数据库教程。
从自己反复遇到的问题开始:每周都要整理行业资讯,就尝试让AI完成一次有来源、有分类、有查重的周报;每次写文章都要重复核查资料,就做一个资料核验流程;经常制作同类方案,就把格式、步骤和验收要求写成可复用指令。
真实任务会迫使你遇见边界。只有看到它在哪里出错,你才算真正理解这项技术。
第四步:沉淀——每次至少留下一个可复用资产
一次实验结束后,不只保存最终答案。还应留下任务模板、输入要求、有效步骤、失败案例、检查清单和合格样例。
这些内容最初可以是一页笔记,稳定后变成Workflow,再成熟一些可以做成Skill。工具会更换,但只要任务逻辑还在,这些资产就可以迁移。
第五步:迁移——故意换一个领域再用一次
迁移是检验你有没有掌握底层方法的最好方式。
如果一套竞品研究流程只能分析一个行业,说明你记住的可能只是材料;如果换到另一类产品仍然能通过调整指标和来源继续使用,说明你已经掌握了研究方法。
可以把这套节奏压缩成一句话:每周理解一个概念,用它解决一个真实问题,留下一个可复用资产,再换一个场景验证一次。
坚持一段时间后,你追踪的就不再是一张不断过期的工具清单,而是一棵持续生长的能力树。

图7:每周理解一个概念,解决一个真实问题,留下一个资产,再换一个场景验证。
十一、2027—2029:我们可能还会遇见哪些新名词?
我不打算猜2029年最热门的产品叫什么。三年前,很少有人能准确预言今天的工具形态。更有意义的做法,是沿着已经发生的技术主线做几种情景推演。
下面不是确定会实现的时间表,只是根据现有方向做的推演。为了看得更清楚,我把它们大致放进2027、2028和2029三个阶段;真实变化很可能提前、推后,或者同时发生。

图8:个人上下文、身份权限与现实执行,可能成为下一阶段的关键问题。
2027:从聊天记录,走向个人上下文系统
今天,我们仍要频繁向AI重复自己的背景、偏好、项目进度和做事方式。未来的个人AI可能不再以一次聊天为单位,而是围绕长期目标持续维护上下文。
那时人们讨论的重点,可能从“记忆长度”转向“记忆治理”:什么应该记住,什么必须遗忘,谁能读取,错误记忆如何纠正,不同身份之间如何隔离。
2027—2028:从账号权限,走向Agent身份与责任链
当智能体能够发邮件、改数据库、下订单或操作资金,“它能不能做”只是第一问。更重要的是:它代表谁做,最多能做多少,哪些步骤必须批准,出了问题如何追溯。
Agent Identity、Permission Ledger、Action Provenance之类的词可能越来越常见。名字未必完全如此,但身份、权限、审计和责任一定会成为智能体进入真实组织的基础设施。
2028:从软件功能,走向结果导向的动态界面
今天的软件把功能做成固定菜单,让人一步步点击。未来,用户可能只表达目标,AI再临时组合数据、工具和界面。
软件不会消失,但人使用软件的方式会改变。固定页面与生成式界面可能并存,真正重要的不是“打开哪个功能”,而是“我想完成什么结果”。
2028—2029:从单个助手,走向人机混合的任务网络
多Agent不会简单等于让十个模型一起说话。它真正有价值的方向,是把研究、执行、复核、安全和协调分成不同角色,并保留清楚的交接与责任边界。
人的角色也会随之变化:从亲自处理全部细节,转向挑选任务、分配资源、处理例外、解决冲突和承担最终判断。
2029及以后:从数字世界,走向现实环境
多模态、Computer Use、空间理解和机器人技术继续结合后,智能体会逐渐接触更多现实任务。它可能先进入仓储、制造、实验和服务场景,再慢慢扩展到日常生活。
一旦AI能影响物理世界,安全、可逆性和责任就会比“回答得像不像人”重要得多。
贯穿三年:从学习使用工具,走向经营自己的能力组合
未来的个人竞争力,可能表现为“一个人+一组可调用的数字能力”。有人擅长研究,有人擅长内容,有人擅长产品和项目推进;这些经验被做成Skills、工作流、数据源和评估集,再由智能体按需调用。
到那时,我们也许会频繁听到能力市场、Skill供应链、Context Governance、Outcome Eval之类的新词。它们是否用这些名字并不重要,重要的是背后的问题不会消失:能力如何封装,如何连接,如何验证,如何安全地被别人使用。
十二、真正的不掉队,不是永远追在更新后面
回看2022到2026,AI的变化确实快得惊人。
2022年,它让普通人用语言生成文字和图像;2023年,它开始连接知识与工具;2024年,它获得更完整的多模态输入、更长上下文和新的连接协议;2025年,它开始围绕目标推理并执行任务;到了2026年,行业开始认真建设Skills、Harness、Sandbox和Evals,把智能体变成可控、可复用的工作系统。
新的模型、新的产品、新的术语一定会出现。今天被追捧的工具,有些会成为基础设施,有些会被合并,有些会悄无声息地消失。如果一个人的安全感建立在“我熟练掌握了当前最热门的软件”上,他注定会不断焦虑。
更稳固的竞争力,来自另一套东西:你能不能定义一个值得解决的问题,能不能把复杂意图表达清楚,能不能拆出可执行的路径,能不能跨领域借用方法,能不能验证结果,能不能把一次成功沉淀为下一次的起点。
AI不会让专业失去价值,但会迫使我们重新理解专业。专业不再只是记住更多知识、熟悉更多按钮,而是能在变化中持续产出可靠结果。
所以,保持不掉队,并不意味着每天追完所有新闻,也不意味着每出现一个新词就立刻报课。
真正有效的做法,是建立自己的更新机制:看见变化,理解底层,放进任务,接受反馈,沉淀方法,再把方法带到新的地方。
我们很难永远站在每一轮更新的最前面。但只要这套机制还在,新工具出现时,我们就不必从零开始。
资料来源
[1]Wooldridge & Jennings,Intelligent Agents: Theory and Practice
https://www.cs.ox.ac.uk/people/michael.wooldridge/pubs/ker95/ker95-html.html
[2]OpenAI,Introducing ChatGPT
https://openai.com/index/chatgpt/
[3]Stability AI,Stable Diffusion Public Release
https://stability.ai/news-updates/stable-diffusion-public-release
[4]OpenAI,GPT-4
https://openai.com/index/gpt-4-research/
[5]OpenAI,Function calling and other API updates
https://openai.com/index/function-calling-and-other-api-updates/
[6]Lewis et al.,Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
https://arxiv.org/abs/2005.11401
[7]OpenAI,Spring Update(GPT-4o)
https://openai.com/index/spring-update/
[8]Google,Introducing Gemini 1.5
https://blog.google/innovation-and-ai/products/google-gemini-next-generation-model-february-2024/
[9]OpenAI,Sora: Creating video from text
https://openai.com/index/sora/
[10]Anthropic,Introducing computer use
https://www.anthropic.com/news/3-5-models-and-computer-use
[11]Anthropic,Introducing the Model Context Protocol
https://www.anthropic.com/news/model-context-protocol
[12]DeepSeek-AI,DeepSeek-V3
https://github.com/deepseek-ai/DeepSeek-V3
[13]DeepSeek-AI,DeepSeek-R1
https://github.com/deepseek-ai/DeepSeek-R1
[14]OpenAI,New tools for building agents
https://openai.com/index/new-tools-for-building-agents/
[15]OpenAI,Introducing Codex
https://openai.com/index/introducing-codex/
[16]Anthropic,How we built our multi-agent research system
https://www.anthropic.com/engineering/multi-agent-research-system
[17]Anthropic,Equipping agents for the real world with Agent Skills
https://www.anthropic.com/engineering/equipping-agents-for-the-real-world-with-agent-skills
[18]OpenAI,Skills in ChatGPT
https://help.openai.com/en/articles/20001066
[19]Anthropic,Demystifying evals for AI agents
https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
本文由 @岚天 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自作者提供
- 目前还没评论,等你发挥!

起点课堂会员权益



