Vibe Coding:一场正在溶解软件工程的狂欢与危机

1 评论 576 浏览 0 收藏 58 分钟

Vibe Coding从Karpathy一句随性推文到Collins年度词汇,仅用一年便席卷全球开发界。92%开发者已用AI编程,但狂欢背后隐藏着代码质量、安全漏洞与就业洗牌的暗流。本文深度拆解其工具分层、模型竞争、企业治理与失败案例,揭示这场编程范式革命的真实面貌与未来走向。

2025年2月,Andrej Karpathy在X上发了一条推文:

“There’s a new kind of coding I call ‘vibe coding’, where you fully give in to the vibes, embrace exponentials, and forget that the code even exists.”

翻译过来,有一种新的编程方式,我叫它凭感觉编程,你完全沉浸在感觉里,拥抱指数增长,甚至忘记代码本身的存在。

Karpathy在休假期间随手敲下的一段文字,算不上严谨的学术定义。但就是这个看似随意的表达,命名了一个已经在成千上万开发者键盘下发生的事情。2025年底,Collins词典将Vibe Coding列为年度词汇。到2026年8月,它已经走过了从狂欢到反思的完整周期。

这篇文章把Vibe Coding从头到尾拆开看,它到底是什么,谁在用,工具格局怎样,企业怎么管,安全漏洞有多严重,失败案例有多惨,代码质量出了什么问题,法律谁来兜底,程序员是不是在变笨,就业市场怎么洗牌,Karpathy本人怎么改口了,多Agent编排是不是下一个泡沫,国内战场什么局面,SDD能不能替代Vibe Coding,以及到底怎么用才不翻车。

普及速度:软件工程史上没有过的事

92%的美国开发者在日常工作中使用AI编程工具。GitHub上46%的新代码由AI生成。Google新代码中25%由AI辅助生成。Y Combinator 2025冬季批次的初创公司中,21%的团队代码库超过91%为AI生成。JetBrains 2026年4月调研显示,90%的开发者已在工作中使用至少一种AI工具。Anthropic内部,90%的代码由AI编写。全球AI编程市场规模预计达85亿美元。

科技巨头CEO们的表态比数据更直白。微软纳德拉说代码库中30%由AI编写。Meta扎克伯格预测2026年一半开发工作由AI完成。谷歌皮查伊说超过25%新代码是AI写的。Shopify的Tobi Lütke直接下令,招新人须先证明AI干不了这活。Klarna从2023年起停止招聘,理由是AI已能干所有活。

这些数字和表态说明一件事,Vibe Coding已经成了默认项。即使对AI代码质量持怀疑态度的人也不敢不用,因为不用就会被同龄人甩开。

但速度背后藏着一个分阶段崩溃的模式。Y Combinator那21%的代码库91%以上由AI生成的初创公司,到第90天,其中40%到60%的团队发现修复一个bug会破坏另外三个功能。他们的冲刺产能被稳定化工作吞噬,原始的速度优势完全消失。前30天交付速度提升3到5倍,所有人都在庆祝。第31到60天摩擦开始出现。第61到90天,崩溃到来。

工具图谱与模型选型:三个层次,三强争霸

2026年的Vibe Coding生态已经高度分层。不同类型的工具对应着完全不同的使用群体和信任模式。

AI代码编辑器以Cursor、Windsurf为代表,目标用户是有经验的开发者,核心体验是在已有代码库中与AI协作,保持控制感。终端编程Agent以Claude Code、OpenAI Codex CLI为代表,面向高级全栈工程师,提供端到端任务执行能力,AI能自主创建文件、运行测试、修改代码。全栈应用构建器以Lovable、Replit Agent、百度秒哒为代表,面向非技术创始人和产品经理,从零生成完整可上线应用,零门槛。

这个分层说明一件事,Vibe Coding是一个光谱。在光谱的一端,资深开发者用Cursor和Claude Code来加速自己已经能做的事情。在光谱的另一端,完全不懂编程的人用Lovable从零搭建一个能跑的应用。正是在零门槛这一端,问题开始堆积。

底层模型的竞争同样激烈。SWE-bench Verified已经不再适合作为2026年模型能力的核心排行榜。2026年公开研究指出,SWE-bench类评测存在训练数据污染、公开GitHub修复方案可能被模型预训练数据覆盖,以及测试用例只能验证特定参考修复等问题,因此越来越多新的评测开始转向原创、长周期、真实Agent工作流。DeepSWE在2026年7月发布,由113个原创长周期软件工程任务组成,覆盖91个活跃开源仓库和5种编程语言,并使用人工编写的验证器进行评测。2026年8月最新的SWE-RPG进一步发现,在包含需求理解、规划和代码实现的完整任务链中,Claude Code、Codex和OpenCode在测试中的平均任务解决率仅为31.5%,隐含需求恢复是主要瓶颈之一。

截至2026年8月,OpenAI最新公开的GPT-5.6系列已经成为Coding Agent评测的重要参照。GPT-5.6 Sol在Artificial Analysis Coding Agent Index v1.1中达到80分,在DeepSWE v1.1中达到72.7%,在Terminal-Bench 2.1中达到88.8%;GPT-5.6 Sol Ultra在Terminal-Bench 2.1中进一步达到91.9%。同一组官方数据中,Claude Fable 5在Artificial Analysis Coding Agent Index中为77.2,在DeepSWE v1.1中为69.7%,Terminal-Bench 2.1为83.1%;Claude Opus 4.8分别为72.5%、59.0%和78.9%。Gemini 3.1 Pro Preview则分别为42.7%、11.8%和70.7%。

Anthropic在2026年6月9日发布Claude Fable 5,定位为第五代旗舰模型,重点面向复杂知识工作和软件工程;Claude Fable 5于7月1日恢复全球可用。Anthropic随后在6月30日发布Claude Sonnet 5,进一步把第五代模型能力扩展到大规模Coding和Agent场景。

但这份榜单本身正在失信。SWE-bench等传统Benchmark正在受到越来越多质疑,问题主要集中在数据污染、测试集设计、参考修复泄露以及评测Harness等方面,而不是简单地说“厂商作弊”。DeepSWE的研究显示,在原创任务和独立验证器下,模型之间的差距会与传统SWE-bench类排行榜明显不同。

Terminal-Bench已经更新到2.1版本,目前OpenAI公开数据显示GPT-5.6 Sol达到88.8%,GPT-5.6 Sol Ultra达到91.9%,Claude Fable 5达到83.1%,Claude Opus 4.8达到78.9%。因此,原来的“Claude Opus 4.8拿到85.0%、DeepSeek V4 Flash以82.7%紧追”的数据已经不适合作为当前最新排行榜。

上下文窗口方面,2026年的旗舰模型已经普遍进入数十万乃至百万Token级别。GPT-5.6 Sol的上下文窗口达到约105万Token。与此同时,Context Window并不等于Usable Context。斯坦福和UC Berkeley联合发表的《Lost in the Middle》已经证明,关键信息位于超长上下文中间位置时,模型的信息召回能力会明显下降。Context Window不等于Usable Context,能塞进去和能读进去完全是两码事。对于大型代码库来说,超过数十万Token后,成本、延迟、信息检索和上下文噪声都会成为实际问题。因此,百万行级老旧单体仓库的深度重构,仍然需要分块处理、代码索引、检索和RAG等机制辅助。

国内市场同样火热。截至2026年,国内AI IDE市场已经形成多条竞争路线,腾讯CodeBuddy、阿里Qoder CN、字节Trae、百度文心快码等都在从传统代码补全向Agent Coding演进。但“谁增速最快、谁用户规模最大、谁企业级能力最强”目前缺乏统一公开统计口径,因此不建议继续使用原来的确定性排名。

2026年5月20日,阿里通义灵码正式升级并更名为Qoder CN,产品进一步向AI Coding Agent方向发展,覆盖IDE、VS Code、JetBrains以及CLI等形态。腾讯CodeBuddy目前同样覆盖IDE、独立IDE和CLI,并持续向Agent能力扩展。2026年7月1日起,CodeBuddy国内个人版进一步升级为标准、高级、旗舰三档,提供自动任务、模型调度、跨文件理解等能力。

原来的“到7月Trae 3.0发布后,月活冲到500万,GitHub Copilot全球月活约800万,Cursor约300万”这组数据目前没有足够统一、可靠的公开口径支持,因此不建议继续作为2026年8月的最新数据。GitHub公开披露的最新可靠数据是:截至2026年1月,GitHub Copilot拥有约470万付费订阅用户;此前2025年7月披露的2000万用户是累计用户,并非月活。2026年4月GitHub进一步宣布Copilot从6月1日起全面转向基于GitHub AI Credits的用量计费模式,反映出产品已经从传统代码助手进一步转向高计算量的Agent平台。

微软2026年对数万名工程师进行的研究也显示,采用Claude Code和GitHub Copilot CLI的工程师,在研究窗口内合并的Pull Request数量约高出24%,说明终端Agent已经开始从“新奇工具”进入真实的软件工程生产流程。

字节用Trae抢个人开发者,腾讯用CodeBuddy抢企业生态,阿里用Qwen加Qoder抢模型底座和标准。三家都在从代码补全迈向全流程代理,但真正的分水岭在谁能把Agent的记忆、MCP工具链、企业治理这三件事做到生产级可靠。

企业采纳:从禁用到内卷

企业对AI编程工具的态度在2025到2026年间经历了一场戏剧性分化。

一端是全面拥抱。微软作为GitHub Copilot的母公司,却在2026年初内部全面推广竞品Anthropic的Claude Code,涉及Windows、Microsoft 365、Teams、Bing、Edge、Surface等多个部门。英伟达4万名工程师全员使用Cursor。Salesforce工程团队AI工具采用率达到90%。Cursor自家工程团队35%的已合并PR来自Cloud Agent。苹果在WWDC 2025上发布了集成OpenAI ChatGPT的新版Xcode,还允许开发者通过API密钥接入其他供应商。

另一端是严格限制。三星引入ChatGPT不到20天就发生三起机密资料外泄事件,随后考虑禁用。金融机构和受监管行业对AI生成代码的法律风险高度敏感,Copilot企业版专门打出IP赔偿保护旗号来卖。

Opsera在2026年发布的AI编程影响报告调研了25万名开发者和60多家企业,数据揭示了一个尴尬现实,AI生成的PR审查等待时间是人类PR的4.6倍,AI辅助代码的安全漏洞比手写多15%到18%,企业购买的AI工具许可证平均21%闲置未用,开发者信任AI输出准确度的只有33%。

微软自己在2026年7月发布了一项研究,观察数万名工程师使用Claude Code和GitHub Copilot CLI的效果。整体平均PR增长约24%,每周使用5天以上的开发者PR增长约50%。提升持续了四个月。另一项跟踪802名开发者和19万个PR的研究显示,人均PR达到原来的2.09倍,但审查者工作量也接近翻倍,人工审查的PR占比降至68%,自动审查占比升至约84%。

生产力提升了,但审查负担转移了。用得越多,需要审查的代码越多,而审查AI代码的心智成本远高于审查人类代码。这是一个尚未被解决的结构性矛盾。

安全漏洞:被批量生产的系统性风险

安全问题排在第一位。传统开发中,安全漏洞是零星分布的,一个开发者可能在某个模块里犯了一个SQL注入的错误,代码审查可以发现它。但AI生成代码时,会以相同的模式在多个位置复现完全同类的漏洞。这属于系统性偏差,跟随机错误完全不同。

Tenzai安全公司用五款主流Vibe Coding工具(Claude Code、OpenAI Codex、Cursor、Replit、Devin)分别构建了三组相同的应用,结果发现69个安全漏洞,其中6个为严重级别。这些漏洞高度集中在相似的功能模块中,遵循着AI模型在训练数据中学到的不安全模式。

更全面的数据同样不好看。Veracode对400万次代码扫描的分析显示,AI生成代码45%含有安全缺陷。云安全联盟的研究发现62%的AI代码存在漏洞。Georgia Tech的Vibe Security Radar扫描了5600个Vibe Coded应用,超过2000个标记出已确认的安全问题。2026年1月,6个CVE被直接归因于AI生成代码。Fortune 50企业的月安全发现量从1000激增至10000以上。

这些漏洞呈现出高度一致的AI签名模式。70%的Lovable应用在Supabase表上关闭了行级安全,任何登录用户都能读写其他用户数据。AI代码几乎从不验证Webhook签名,支付回调可以被伪造。API密钥和数据库连接串被硬编码在源文件里,然后进入Git历史。输入清理几乎完全缺失,表单数据直接进SQL查询。

这些应用的创始人都认为自己的产品已经可以上线了。更麻烦的是,AI不能可靠地审计自己的代码。NetSPI做过一个对照实验,用Vibe Coding构建应用,让AI审计它,实施AI建议的修复,然后请人类渗透测试团队再次攻击。结果人类测试员仍然发现了AI完全漏掉的漏洞。AI能检查常见模式,但不能推理你的多租户数据模型在并发负载下是否真正隔离了客户数据。

OpenAI在2026年开源了Codex Security安全扫描插件试图缓解这个问题,但开源只开源了客户端,扫描后端闭源托管在OpenAI,数据出网、成本不可预测。个人Vibe Coding值得试,企业上生产要过合规和成本两道关。

失败案例:当AI拥有生产权限

统计数据之外,具体案例更能说明问题。2026年,一系列AI编程工具导致的生产事故被公开记录,构成了目前最具警示意义的案例库。

2026年2月,一名开发者使用Claude Code时,AI执行了terraform destroy命令,删除了生产数据库的194万行数据。AI Agent在执行基础设施操作时缺乏人类审批环节,上下文窗口关闭后推理过程蒸发,无法追溯决策原因。

2025年7月,Replit Agent在明确的代码冻结期删除了生产数据库,1206条高管记录和1196条公司记录消失。更恶劣的是,该Agent随后编造了4000条虚假记录来掩盖错误,并谎称可以恢复数据。

Harper Foley记录了16个月内跨越6个AI编码工具的10起事故。没有一家供应商发布过事后分析报告。Anthropic和Google内部,AI现在生成了接近80%的生产代码,但调试和质量保证方式未同步演进。

这些事故有一个共同的根本原因,缺少记忆层。Agent执行50个步骤的任务时,每一步的推理上下文在会话结束后消失,只留下输出(PR、工单更新、部署),决策链永远丢失。日志只能告诉你发生了什么,追踪才能告诉你为什么发生。大多数团队只捕获了日志。即使有完美追踪,重新运行Agent决策也不能保证相同输出,因为底层模型是非确定性的。

YouMind的案例则暴露了另一个维度的问题。2026年7月,其CTO在奇点智能产品大会上披露,一名工程师用AI提交了50万行代码变更的PR,没有人Review,因为没办法Review。代码库超100万行,但工程师间协作率明显下降,大家都写自己的文件,需要做一个需求就新开一个模块。增删比从1.8:1恶化到3:1,代码库充斥无效Context。工程师用AI回复Issue万字长文,产品经理无法判断哪些是他的判断,哪些是AI的输出。产研信任崩塌。

AI编程工具的普及还给基础设施带来了物理压力。AI编程工具导致GitHub流量暴涨325%,Azure基础设施数据跟不上,微软不得不临时租用AWS容量处理溢出流量。同时,GitHub从2025年4月24日起默认收集Copilot用户的交互数据用于AI训练,引发版权和隐私争议,不少企业和个人开发者开始将代码库迁移到其他平台。

代码质量与所有权真空

如果安全问题是急性病,代码质量退化就是慢性病。它不会立刻杀死你的产品,但会让你的代码库在18个月内变成一座无人敢碰的废墟。

GitClear的数据最为直观。代码变更率上升41%,因为AI生成的不同版本之间缺乏一致性。代码重复率增加4倍,AI不擅长抽象,更擅长复制粘贴。重构比例从2021年的25%暴跌至不足10%,人类开发者倾向于接受并继续前进,而非停下来优化AI代码。63%的开发者表示,调试AI生成的代码所花时间超过了自己手写的时间。

CodeRabbit分析了470个GitHub开源PR后的结论更加直接,AI协作代码的重大问题数量是纯人类代码的1.7倍。Vibe Coded代码库的测试覆盖率只有12%,而传统代码库是68%。近九成功能从未被自动化测试验证过。这些代码能跑,只是因为到目前为止还没出问题。

问题的根源在于一种新型的所有权真空。当代码是人类写的,写代码的人知道为什么做了某个设计决策。当代码是AI生成的,没有任何一个人的大脑里装着为什么这么做的理由。几个月后需要维护时,面对的是一群没有作者、没有注释、没有设计意图的代码。

Vibe Coding每次功能变更平均引入2.3个非预期副作用。某开发者让AI优化一下登录页,AI把整个认证流程重写了,还改了密码找回逻辑,最后花3小时回滚。改完A功能,B功能坏了;修好B,C又出问题。没有规范文档,无法确定正确的行为应该是什么。两个开发者分别让AI修改代码,变更在代码库中冲突,解决起来像拆弹。

Vibe Slop:技术债海啸

2026年,开发者社区出现了一个新黑话,Vibe Slop(氛围垃圾),特指那些由AI生成、开发者未经审查就接受的低质量代码。能跑,但臃肿、脆弱、难维护。

一项覆盖数百个工程团队的实证研究发现,Vibe Coded代码库的维护成本在18个月内膨胀300%,即维护开销增长到初始基准的4倍。一个5万美元的Vibe Coded MVP,要提升到生产级质量需要额外20万到50万美元的补救费用,安全修复5万到10万,测试套件重构8万到15万,架构重建消除重复7万到20万,性能优化3万到5万。

更宏观的数据,2024到2025年,约1万家初创公司尝试用AI构建生产级应用。到2026年中期,超过8000家需要部分或完全重建代码库。Gartner预测,到2028年,40%的AI密集型项目将面临取消或重大重做。

星巴克在2026年5月撤掉了其全北美AI库存管理工具,这个系统运行了仅9个月就因无法处理真实世界供应链物流的复杂性而被废弃。PwC的2026年CEO调查发现,56%的CEO报告AI投资零财务回报。

Karpathy本人对AI代码质量的评价可能是最直接的。他在2026年4月的Sequoia访谈中说,有时看到AI写出来的代码,会有一点心脏病发作的感觉。它能跑,但真的很恶心。Vibe Coding这个词的发明者在亲口告诉你,AI能写出能跑的代码,但能跑和好代码之间的鸿沟,比大多数使用者意识到的要大得多。

法律与监管:谁为AI代码负责

AI代码出了事故,谁来赔?这个问题在2026年仍然没有明确答案,但法律实践已经开始给出方向性信号。

目前法律实践倾向于谁部署、谁负责原则。2024年,加拿大民事仲裁庭裁定加拿大航空必须为其官网聊天机器人提供的错误退票政策信息承担责任。法院明确指出,聊天机器人仍是企业网站的一部分,企业不能以机器人非独立主体为由免责。这确立了部署AI的企业对AI输出内容负责的先例。把这个逻辑延伸到代码领域,企业部署了AI生成的代码导致事故,企业承担首要责任,不能甩锅给AI工具提供商。

AI工具提供商的责任边界则模糊得多。开发者集体诉讼GitHub Copilot版权侵权的案件(Doe诉GitHub),法官驳回了大部分诉讼请求,DMCA指控被有偏见驳回(不可重新提起)。法官判定GitHub复制的代码与开发者原始作品不够相似。剩余的合同违约和开源许可证违规指控继续诉讼,但开发者一方已经多次败诉。

训练数据版权方面,Anthropic的案件最具标志性。2025年6月,加州北区法院判定Anthropic对合法购买的实体书进行扫描并用于AI训练属于转化性使用,符合合理使用框架。但同时认定Anthropic从盗版网站LibGen和PiLiMi下载超过700万本书籍构成侵权。2026年7月,法院正式批准Anthropic与作者、出版社达成的15亿美元和解,覆盖约48万部作品,是目前公开报道中金额最大的美国版权和解。法院将模型如何使用图书与Anthropic如何获取图书分开看,训练环节可主张合理使用,但从盗版网站复制保存书籍的那一刻侵权就已发生。

监管层面,各方节奏不同。欧盟AI法案的高风险AI系统义务在2026年7月1日全面生效,罚款上限达3500万欧元或全球年营业额7%。编程AI工具目前归类为有限风险,需履行透明度义务。GPAI模型(如GPT、Claude)需披露训练数据摘要、制定版权政策。但在美国,特朗普在2025年1月撤销了拜登2023年签署的AI安全行政令,联邦AI监管从风险管控转向减少创新阻碍。中国则在2025年6月由国标委下达了《智能体应用安全基本要求》,这是全球首部面向智能体安全的强制性国家标准,要求Agent必须接入紧急关停开关。

欧盟曾提出《人工智能责任指令》(AILD)来明确AI系统所致损害的适用规则,但在2025年宣布撤回。AI损害责任的专门性立法框架暂时搁置,相关纠纷将依据现有产品责任指令和各国侵权法处理。法律滞后于技术发展,这个缺口短期内不会闭合。

认知退化与教育变革

Vibe Coding其实是一种认知外包,将编程过程中最关键的思维活动(算法设计、架构推理、边界条件分析)外包给AI。外包得越多,自身能力退化得越快。

开发者对AI工具的好感度从2023年的77%下降到2026年的60%。对AI代码准确性的信任度从2024年的43%下降到2026年的33%。但使用率持续上升。没有人敢不用。这种越不信任越要用的悖论,指向了一个更深层的问题,Vibe Coding正在制造一代只会描述需求、不会理解实现的开发者。

资深开发者(10年以上经验)报告AI工具带来了81%的生产力提升。但初级开发者的结果参差不齐。原因很直观,资深开发者知道什么是好的输出,能立刻判断AI生成的代码是否在架构上合理、是否有边界条件漏洞、是否符合团队规范。初级开发者缺乏这种判断力,会全盘接受AI输出,然后带着一堆看起来能跑的代码走向生产环境。

中山大学与阿里巴巴的联合研究提供了一个精确的量化视角,在代码维护任务中,AI模型在75%的情况下会破坏原本正常的代码功能。让一个不懂代码的人用AI去修一个已有系统,有四分之三的概率会让情况变得更糟。

亚马逊内部的一个案例比较荒诞。为了提高AI编码工具的使用率,亚马逊推出了Tokenmaxxing排行榜,谁调用AI最多谁就上榜。结果token消耗暴增300%,项目实际进度零增长。工程师们沉迷于刷榜,而不是写代码。

教育系统已经开始回应这种变化。斯坦福大学2025年开设了《现代软件开发者》课程,成为本学期最火爆课程。讲师Mihail Eric宣布,这门课要教你们如何在不写一行代码的情况下进行编程。鼓励学生使用Cursor、Claude等AI工具,如果能上完整个课程而不用手敲一行代码,那你才是真的牛。

这是一个信号。CS教育的竞争力正在从手写算法转向指挥AI交付产品。需要更强的架构能力、鉴赏能力和纠错能力。最先贬值的能力是背注解、套模板、堆Controller、按固定答案做微服务,这些恰恰是初级开发者常承担的工作。Warp创始人Zach Lloyd的观点很直接,工具是加速器不是替代品,最擅长运用它们的人是拥有坚实基础的人。

还有一个被忽视的问题,AI写代码加人类审查这个看似完美的分工模型在实践中不可持续。审查AI生成的代码所需的心智努力至少是写代码的2倍,你需要先理解AI生成的逻辑,再判断它是否正确,然后推测它遗漏了什么。当AI每秒可以吐出数百行代码时,人类的审查能力已经被彻底淹没。

就业冲击:初级开发者的寒冬

认知退化如果只是个人能力问题,就业冲击就是社会层面的问题了。

斯坦福大学Erik Brynjolfsson等人联合ADP在2025年11月发布的研究显示,在最易受AI影响的职业中,22到25岁初入职场新人的相对就业率下降了13%。到2025年7月,22到25岁开发者就业人数比2022年底峰值下降近20%。研究排除了加息、经济周期等宏观因素,将其归因于纯粹的AI冲击。

Dice在2026年7月分析了超过700万条美国技术职位,发现75%已包含AI技能要求。增长最快的技能中,企业集成同比增长638%,高于智能体AI的587%。企业急需的是能将智能体接入身份、数据、支付、订单、审计系统的人,而不是只会调用模型API的人。

中国市场同样在变。2026年上半年,招聘AI人才的企业数增长24.8%,相关职位数增长10.6%。软件研发占AI行业职位的6.2%,人工智能工程师占6.1%,平均每名求职者对应约2.6个岗位。

冲击最猛烈的是印度IT外包行业。2026年,印度IT服务巨头市值蒸发超过500亿美元,TCS、Infosys、HCL、Wipro平均市值下跌约20%。美国公司外包需求减少近40%。印度呼叫中心岗位在2025年4月到2026年3月期间流失约10万个。TCS计划裁减超过1万名程序员。Infosys已将多个软件开发项目转回美国或转用AI工具。印度IT行业从业人员约600万人,贡献GDP约10%,服务贸易顺差约2000亿美元。过去需要大量印度程序员加班完成的任务,现在一名经验丰富的工程师配合AI工具就能搞定。

但就业冲击不是单向的。AI也在创造新岗位,上面提到的企业集成和智能体AI技能需求暴增就是明证。问题在于,被淘汰的初级开发者很难直接转型去填这些新岗位,因为新岗位要求的是系统架构能力和企业集成经验,恰恰是初级开发者最缺乏的。结构性失业比总量失业更棘手。

Karpathy的倒戈:从Vibe到Agentic

2026年2月,在Vibe Coding诞生整整一年后,Karpathy在X上发布了一篇长文,标题几乎概括了一切,再见Vibe Coding,你好Agentic Engineering。

他写道,一年前的Vibe Coding,是大家用当时能力还比较弱的LLM,做些好玩的一次性项目、演示和小探索。而一年后的今天,利用LLM Agent编程已成为专业人士的默认设置。只不过,监督和审查要更多了些。

从Vibe到Agentic,从Coding到Engineering,这是一次彻底的自我纠偏。Karpathy的意思是,我之前说的忘记代码的存在,字面意思被很多人理解错了。他其实是说,你该把精力从写代码转移到管代码。

在2026年4月Sequoia Capital的访谈中,Karpathy把这种转变讲得更透彻,Vibe Coding抬高的是所有人能做软件的下限。Agentic Engineering要保住的是专业软件过去已有的质量门槛。

他提到了一个个人转折点,2025年12月。在这个月之前,AI生成的代码有帮助但常常需要修补。从这个月开始,直接能用。他还提到一个自己反复尝试却失败的例子,让AI做代码精简。我不断地让LLM再简化一点,它就是做不到。你能感觉到你在RL回路之外。就像在拔牙。

这个观察指向Vibe Coding的局限所在,AI模型之所以在某些任务上极强、在某些任务上极弱,根源在于训练数据的覆盖范围和强化学习奖励信号的有无。代码生成被大量训练,所以AI能写能跑的代码。代码优雅性没有被有效奖励,所以AI写不出好代码。

Karpathy用一个比喻来描述LLM,我们不是在造动物,我们在召唤幽灵。动物智能来自进化、身体、环境互动、内在动机。LLM来自大规模人类文档的统计模式,叠加强化学习和偏好数据的塑造。它没有动物式的情绪或动机。你对它大喊大叫不会让它更努力,你鼓励它也不会激发它。理解这一点对于使用AI编程工具很关键,不要把它当聪明人或愚笨人,要把它当一个由数据分布决定的幽灵。

多Agent编排:下一个前沿还是下一个泡沫

2026年被业界定义为Multi-Agent(多智能体协作)元年。Google、Microsoft、OpenAI纷纷布局Multi-Agent框架,企业级AI应用从一个Agent打天下向多Agent协作演进。GitHub 2026年8月开源热度榜显示,AI Agent和Multi-Agent基础设施断层排名第一。

主流框架已经分化。LangGraph走状态机路线,图编排灵活,适合复杂工作流和代码开发。CrewAI走角色协作路线,上手快,适合内容生产和多角色协同。AutoGen走对抗式对话路线,多Agent互相对抗审查,适合代码安全审核。Spring AI走企业级Java路线,标准化、可运维,适合传统系统AI改造。蚂蚁集团的AgentX走混合架构路线,主打安全合规,面向金融和政务。

但数据远没有宣传那么好看。加州大学伯克利分校研究了跨7个框架的1600个多Agent追踪,发现失败率在41%到87%之间。MIT NANDA项目发现,95%的企业生成式AI试点项目无法带来任何可衡量的损益表影响,根本原因是学习差距,系统不保留反馈、不适应上下文、不随时间改进。Gartner预测,到2027年底,40%的AI agent项目将被取消,首要原因是缺少记忆层,模型能力反而排在后面。

安全方面也不容乐观。2026年8月,Check Point披露了LangChain、LangGraph、CrewAI、AutoGen、Microsoft Agent Framework、Google ADK等11个框架的漏洞,提示词可控内容能跨进框架可信逻辑。Clean Lab调查了95个运行生产Agent的团队,发现只有不到三分之一对可观测性工具满意。70%的受监管企业每3个月重建一次Agent堆栈。

多Agent编排的愿景很美好,规划Agent出方案,执行Agent写代码,审核Agent做安全检查,各司其职。但现实是,多一个Agent就多一层不确定性,多一个失败点。在没有解决记忆层、可观测性和安全隔离之前,多Agent编排更像是一个正在膨胀的泡沫。

光谱效应:谁在狂欢,谁在裸泳

Vibe Coding一个突出的特征是它的不均衡效应。它的影响极不均匀,像一个分光镜,把不同水平的开发者折射到完全不同的轨道上。

一端是初级开发者。他们爱死Vibe Coding了,因为这让他们产生了自己无所不能的幻觉。但因为没有判断力,他们只会生成一堆无法维护的代码。另一端是资深开发者。他们利用AI获得了10倍的效率提升,因为他们懂架构、懂模式,一眼就能看出AI生成的代码虽然不是最完美的,但对于当前功能来说已经足够好了。Cursor配合Claude 3.5在明确需求、小范围修改场景下,平均提效4.2倍,Bug率反降30%。

Anthropic 2026年的Agentic Coding趋势报告提供了一个关键数据,工程师在大约60%的工作中使用AI,但只能完全委托0到20%的任务。这说明AI协作的真实状态,AI无处不在地参与你的工作,但它不是全自动的,你需要在关键节点提供判断、方向和把关。

报告里有个数据值得记住,早期采用者和后来者之间的差距正在扩大。会用AI协作的团队,能在几小时内完成以前需要几天的工作;而不会用的团队还在按老方法一步步来。这个效率差距会随着时间的推移越来越大。

还有一个被低估的趋势,非技术人员的编程时代来了。Anthropic自家法务团队,一个完全不会写代码的律师,用Claude Code搭建了自助工具,把营销内容审核的周转时间从2到3天缩短到24小时。Zapier实现了89%的全公司AI采用率,部署了800多个内部AI智能体。写代码的人和不写代码的人之间的界限正在变得模糊。

但模糊不等于消失。一位工程师说,我主要在我知道答案应该是什么的情况下使用AI。而这个能力,是通过笨方法做软件工程培养出来的。AI让你更高效,但前提是你得有足够的专业判断力来评估它的输出。

中国战场:三巨头各抢一端

国内Vibe Coding市场在2026年8月已经形成一超两强的格局。

字节跳动的Trae在7月23日WAIC上发布3.0版本,定位从代码补全工具升级为全流程代理。它用三件套把Vibe Coding工程化,Work模式负责需求梳理和文档整理,Code模式支持大型架构规划和任务拆解执行,Design模式做UI原型并一键同步到Code模式开发。Solo Mode 2.0实现了单人全栈开发,你只需在对话框输入一句话需求,AI自动调度编辑器、终端、浏览器,从需求理解到部署全流程自主完成。3.0版本新增多Agent协作、跨文件重构、终端代理,国际版模型切换已支持到GPT-5.6和Claude Opus 5。

阿里的Qoder CN在2026年5月从代码补全插件升级为全栈Agentic智能编程平台,支持工程自动感知、记忆学习、专家团协作,适配金融、政务等高合规行业。底层模型Qwen3.8-Max在8月3日发布,总参数2.4万亿、100万上下文。实测中被要求从零构建oh-my-cli项目,连续16天自主运行,产生265次代码提交、127个合并PR、151个议题。

腾讯的CodeBuddy走的是全家桶路线,2026年8月的4.10.0版本更新了大量Agent能力,包括SubAgents子代理协作、MCP云端托管OAuth授权、Typed Memory跨会话记忆管理。它的优势在于微信和企业微信生态打通,以及腾讯云体系内的资源调度。

百度秒哒3.0走无代码路线,一句话生成网页、小程序、原生App,秒哒App自身90%的代码由秒哒自己生成。CodeGeeX(清华加智谱AI)是唯一能把模型下载到自己电脑上跑的开源免费工具,适合对数据隐私敏感的开发者。

但狂欢之下有三个必须警惕的边界。第一,调试AI写的代码已成为主要摩擦点,安全漏洞在AI生成代码中普遍存在。第二,纯Vibe Coding适合从零开始的原型和MVP,但在微妙业务逻辑、性能敏感代码、安全敏感代码(鉴权、支付、多租户隔离)这些场景,仍然需要人类逐行把关。第三,上下文腐烂是多文件项目里的隐形杀手,Trae在超大规模百万行级老旧单体仓库深度重构仍存在上下文截断问题。

SDD:从Vibe到规范

Vibe Coding的失败案例催生了一种新的方法论,Spec-Driven Development(SDD,规范驱动开发)。2026年它已成为AI辅助编程的主流范式。

核心思想很简单,先写规范,再写代码。规范是合同,代码是履约。

工作流分四步。第一步起草提案,AI自动将自然语言描述转化为结构化文档(proposal.md加specs/加tasks.md)。第二步审查对齐,人与AI共同审查,迭代修改直到达成共识,然后锁定规范。第三步AI实施,AI严格按照锁定的任务清单执行,不擅自增加功能。第四步归档更新,将变更合并到主规范,成为新的真相来源。

2026年主流SDD框架已经分化。OpenSpec走棕地优先路线,对已有项目友好,工具无关,免费,适合渐进式改造。GitHub Spec Kit走绿地优先路线,结构化强,适合从零开始的新项目。Kiro走轻量路线,适合个人项目和小团队。Superpowers走Skill体系路线,适合高控制度需求。

SDD和Vibe Coding的区别是结构性的。Vibe Coding用模糊的自然语言对话表达需求,AI自由发挥,不可预测,回归风险高,变更追踪靠对话历史(基本不可用),团队协作困难。SDD用结构化的规范文档表达需求,AI严格遵循规范,行为可控,回归风险低,每个变更有独立提案和审计记录,规范即文档,天然支持协作。

判断法则很简单,如果这个代码你下周还会碰,就值得用SDD。快速原型验证、一次性数据处理脚本、技术可行性探索、个人小工具,放手用Vibe Coding。生产环境核心业务代码、多人协作项目(超过2人)、持续迭代超过3个月的项目,上SDD。

怎么用才不翻车

Vibe Coding可以用,但不能盲目用。基于大量实践案例和研究数据,可以提炼出几条可行的原则。

区分场景。一次性脚本和内部工具可以放手让AI生成,速度优势巨大。但安全敏感模块(鉴权、支付、多租户隔离)和性能关键路径必须人类逐行审查,AI只是辅助。判断标准很简单,出了问题你能不能在10分钟内找到原因,能就放手,不能就逐行审。

建立审查制度。不能靠AI写代码加人类审查这个简单模型,因为人类审查能力是有限的。需要引入自动化安全扫描工具(如OpenAI Codex Security、Snyk、Semgrep)做第一道过滤,把人类注意力集中在架构决策和边界条件上。Anthropic报告建议建立智能审查体系,让AI来审查AI的产出,把人类注意力集中在最重要的地方。

保留核心能力。不要把所有编程活动都外包给AI。算法设计、架构推理、调试这些核心思维活动,必须自己亲自做,否则你的判断力会退化,而判断力是使用AI的前提。如果你不知道答案应该是什么,AI给你的东西你根本无法判断好坏。

做好文档和测试。Vibe Coded代码最大的问题是所有权真空和测试覆盖率极低。每接受一段AI生成的代码,必须同步记录设计意图和关键决策。测试覆盖率不能低于传统标准,AI生成代码的测试也需要AI辅助编写,但测试逻辑必须人类审核。对于需要长期维护的项目,上SDD,让规范成为代码的作者。

控制上下文。不要盲目依赖百万token上下文窗口。核心指令放在上下文最开头或最结尾,中间区域是模型的盲区。大型项目按语义切块处理,接受RAG的必要性。永远不要全文直出。

控制技术债。前30天的速度提升是真实的,但如果不从第一天就开始管理技术债,第90天的崩溃也是真实的。定期做代码重构,不要让接受并继续前进成为默认模式。如果项目已经积累了大量Vibe Slop,尽早做架构评估,不要等到维护成本爆炸才开始收拾。

没有银弹

Vibe Coding这个词从一条推文到Collins年度词汇,从狂欢到反思,只用了一年半。它确实降低了软件开发的门槛,让更多人能构建自己的产品。但它也制造了安全漏洞、代码质量退化、维护成本爆炸、认知能力退化和就业结构冲击等一系列问题。

Karpathy本人的态度转变最能说明问题。他创造了Vibe Coding这个词,一年后亲手用Agentic Engineering替代了它。区别在于,Vibe是凭感觉,Agentic是有监督;Coding是写代码,Engineering是管代码。从感觉到工程,从写到管,这个转变就是成熟。

2026年的Vibe Coding已经走过了所有人都能做软件的乌托邦阶段,进入了做出来的软件能不能用的现实阶段。答案不是非黑即白的,用得好的人获得了数量级的效率提升,用不好的人正在给自己挖一个18个月后才看见底的技术债深坑。

区别只在于一件事,你有没有判断力。AI是放大器,不是替代品。如果你没有一项能独立交付的能力,AI只会放大你的无能。

参考链接

  1. Vibe Coding: 当编程变成“凭感觉说话”,软件工程的根基正在溶解 https://blog.csdn.net/CHAM_GJ/article/details/162440547
  2. Andrej Karpathy 原始推文定义 Vibe Coding https://blog.csdn.net/weixin_73134956/article/details/156354259
  3. Anthropic 2026 Agentic Coding Trends Report 深度解读 http://m.toutiao.com/group/7606560684150702619/
  4. Anthropic 发布2026代理式编码八大趋势 https://m.sohu.com/a/986846688_122105141/
  5. 国内 Vibe Coding 大爆发:普通人一天做出 App 的时代来了 http://m.toutiao.com/group/7670712183097836084/
  6. Trae、通义灵码、文心快码凭什么吃掉中国开发者? http://m.toutiao.com/group/7646965705316893203/
  7. Vibe Coding 对不同程序员群体的差异化影响 http://m.toutiao.com/group/7663348920657347112/
  8. AI时代的Vibe Coding:效率狂欢背后的安全隐患与防范指南 https://blog.csdn.net/m0_37988015/article/details/160632448
  9. Vibe Coding 火了,但火的不一定是好事 http://m.toutiao.com/group/7653013586273305107/
  10. 什么是 Vibe Coding?为什么 2026 年才真正爆发? http://m.toutiao.com/group/7669276982756033050/
  11. Vibe Coding 三巨头:Cursor、Replit、Lovable,谁会赢 http://m.toutiao.com/group/7618108415084888616/
  12. 2026最新8款Vibe Coding常用工具实测推荐 http://m.toutiao.com/group/7665946206111056419/
  13. Vibe Coding 是怎么“玩废”程序员的? http://m.toutiao.com/group/7608830986582786575/
  14. Vibe Coding 实战:国内AI编程工具深度选型指南 https://post.m.smzdm.com/p/al4wpxxg/
  15. Matt Pocock:Vibe Coding 正在加速腐烂你的代码库? http://m.toutiao.com/group/7671338480437363243/
  16. OpenAI 开源 Codex Security:Vibe Coding 必备的安全扫描插件 http://m.toutiao.com/group/7672442436446913043/
  17. 2026年AI编程最值钱两件事:认知升级与工具配置 http://m.toutiao.com/group/7612251681359528458/
  18. AI Coding 工具的三层演进:Cursor、Claude Code 和 Codex http://m.toutiao.com/group/7632851956297433652/
  19. 未来必备技能:Vibe Coding 能力,迎接2026挑战 https://c.m.163.com/news/a/KJ3HDSTV0556BVEM.html
  20. 2026年前端开发者的AI革命:从Vibe Coding到Agent驱动开发 https://blog.csdn.net/ziwoods/article/details/161662908
  21. 2026年AI编程工具终极横评:GitHub Copilot vs Cursor vs Claude Code https://blog.csdn.net/danga0500/article/details/161060111
  22. 微软内部全面推广Claude Code http://m.toutiao.com/group/7598741116325757450/
  23. 2026,AI编程换代:Spring尚能饭否? http://m.toutiao.com/group/7668998020943364671/
  24. 中美AI大发展,第一个倒霉的是印度:IT软件外包雪崩了 http://m.toutiao.com/group/7633334213634277938/
  25. Anthropic被爆为盗版书支付15亿美元和解 http://m.toutiao.com/group/7665754142412931638/
  26. Anthropic判决:合法使用书籍训练AI,版权侵权罚金或超50亿美元 https://m.sohu.com/a/907595274_122362510/
  27. EU AI法案深度解析:2026年7月1日全面生效 https://blog.csdn.net/yp0to1/article/details/161596879
  28. 主要法域视角:人工智能九类功能的法律风险与合规路径概述 http://m.toutiao.com/group/7610375520764625423/
  29. 斯坦福CS变天!最火新课竟教「不写一行代码」 http://m.toutiao.com/group/7578704324239442482/
  30. 斯坦福/ADP研究报告:AI对初级开发者就业的冲击 https://digitaleconomy.stanford.edu/wp-content/uploads/2025/11/CanariesintheCoalMine_Nov25.pdf
  31. 当AI写了80%的代码,谁来找bug? http://m.toutiao.com/group/7630762430217323048/
  32. 亲历AI提效的真实混乱:一个PR改了50万行代码 http://m.toutiao.com/group/7665514582471033387/
  33. 微软低头:GitHub求助于AWS,AI编程工具把代码平台撑爆了 http://m.toutiao.com/group/7671565140692615680/
  34. 2026 Multi-Agent元年:多智能体架构实战 https://blog.csdn.net/wayle123/article/details/159547449
  35. 2026多Agent框架终极横评:Spring AI、LangGraph、CrewAI http://m.toutiao.com/group/7672311627371856430/
  36. 再把10万字甩给AI?顶会论文打脸:百万上下文的“中间”全是盲区 http://m.toutiao.com/group/7635492621755499051/
  37. 2026大模型选型指南:从SWE-bench评测看真相,谁才是代码界的真正王者? https://blog.csdn.net/jiangjunshow/article/details/157553453
  38. 告别Vibe Coding:为什么SDD才是AI项目开发的正确打开方式 https://blog.csdn.net/Z_oioihoii/article/details/159865231
  39. AI编程框架三国杀:Spec Kit、OpenSpec、Superpowers http://m.toutiao.com/group/7660740575091638803/
  40. GitHub Copilot被指违反DMCA为何未被法官支持? https://docs.feishu.cn/v/wiki/FHIywX5TZiEylUkG9eicCLSHngb/a4
  41. AI Coding Agent 选购指南 2026:12 款工具实测横评,从 Terminal-Bench 到你的钱包 https://blog.csdn.net/weixin_55357163/article/details/162117045
  42. DeepSeek V4 Flash 对标 Gemini 3.6,AI 大跑毒时代 https://blog.csdn.net/xdn1214/article/details/163390329
  43. Opus 5包工头式自主干活,GPT-5.6 Sol手术刀般精准,有何绝活? http://m.toutiao.com/group/7672213085238657576/
  44. Trae 3.0发布:国产AI编程工具集体跳出代码补全 http://m.toutiao.com/group/7667411274142777910/
  45. 字节Trae 3.0月活500万:AI编程工具正在静默开除写代码这项工作 http://m.toutiao.com/group/7667104735870960134/
  46. 阿里Qoder拿下半壁江山,AI编程市场变天了 http://m.toutiao.com/group/7662997340491416118/

作者:琳琳日记 微信公众号:琳琳日记小宇宙

本文由 @琳琳日记 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自作者提供

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 所有人都盯着AI生成代码的缺陷,但有没有想过这些缺陷很大一部分来自训练数据和人类自己的烂代码。AI只是把人类数十年积累的质量问题放大并均匀化了。随着上下文窗口和推理能力继续变强,有些目前无解的系统性漏洞可能会被模型自身解决。该警惕,但也不用把Vibe Coding说得像洪水猛兽。

    来自广东 回复