AI PPT:一部完整编年史

0 评论 474 浏览 0 收藏 21 分钟

从文心一言只吐大纲,到如今AI可生成可编辑的PPTX文件,三年间AI做PPT的技术路线经历了模板、代码、Agent等多轮迭代。本文梳理了AI PPT的进化史,探讨不同方案的优劣与可编辑性困局,并反思AI生成内容与用户真实需求之间的鸿沟。

三年前社长近距离接触了文心一言初代产品的发布会,见证了一开始没人相信百度是真的,直到它开放测试权限,股价从跌到涨的戏剧性过山车过程。

当时,文心一言及其企业级产品将做PPT视为核心生产力内容。只不过,第一版文心一言做PPT的时候,它只吐了个大纲,就蹲下了。

社长写这个AI PPT的评测稿子的时候,因为找到新工作,就存在草稿箱里没发出来,没想到这一存,就是三年。

这三年,社长是一点重新动它的心思也没有,因为后来的工作里很少用到PPT及对外汇报。就如同大家感受的一样,对大多数人,AI最大的用途是编程,写作文章/文档,以及生成图片或视频。

近几天,还是因为手搓了一个帮自己码字的Skill,社长才终于有勇气面对积压的选题,重新回顾AI PPT这个领域。

三年后,百度终究靠着文库及GenFlow把AI PPT这个品类做到了月活破亿。用大模型做PPT这事如今至少有5-6个流派,Kimi、ChatGPT、智谱等都可以直接给你生成.pptx格式的文件。

所以说,现在做PPT,真的不用自己动手了吗?

2023年4月:文心一言只吐了个大纲

2023年3月底,社长拿到文心一言的邀请测试资格。那会儿金山办公刚宣布海外版WPS要接GPT-4,国内版传闻可能跟百度合作,百度也在3月27日的智能云活动上,演示了文心千帆API生成PPT的能力,以及文心一言植入WPS和石墨文档。

社长好奇这种“中国版Copilot”到底行不行,就直接上手,让它模拟办公助手,在文档、表格、幻灯片三个场景跑了一遍。

文字部分还不错。让它起草合同模板、活动邀请函,甚至指定用“百度智能云”口吻写,结构完整、语气得体,连续几次生成结果自然流畅,查重后确认没直接抄。如果只是日常文案起草,它当时就够用了。

表格就完全露怯了。社长拿百度自己的2022年财报当材料,让它提取关键数字、整理成表。它一会儿混淆季度和全年数据,一会儿直接重复上一轮的错误,怎么调提示词都没用。同一任务扔给ChatGPT 3.5,对方干净利落吐出准确表格,差距大到让人有点尴尬。

PPT任务更说明问题。发布会里文心千帆API能根据“长安逸达”车型信息自动排版配图,看起来很炫,但那是API版,可以联网。社长手上的测试版不能联网,只能让它输出“手动操作步骤”来模拟。文心一言顶多给个大纲,每页放什么内容、怎么布局,统统没有。

换成GPT-4,它也是一样只能输出手动操作步骤,不过相对更细致,能描述每页的版式、内容分配、插入图片的位置,接近实际可执行了。

社长当时的判断是,文心一言确实是一个真的大语言模型,架构没问题,语料和训练量拖了后腿,属于“思而不学则殆”的状态。发布会里那些行业定制版的截图似乎效果好不少,社长当时想,如果这些能力尽快回流到通用版,文心完全有可能后来居上。

那时候最乐观的预测也没想到,三年后人们解决这个问题的方式跟当时预期的完全不同,包括超出了百度自己的预期。

模板、代码和Agent各有各的走法

当前AI制作演示文稿发展出了三条不同的技术路线。

一是基于PPT格式及模板,让大模型填充内容匹配预置模板的路线,采用旧式低代码结合盘活AI时代之前的海量模板库资源,可靠性高。AiPPT.cn、Slidesgo、WPS AI都属于此类。

此后也有厂家使用中间件,包括python转pptx的代码,Marp这个Markdown转PPTX库,或其它自定义转换方式,先做成Markdown格式的标记语言指定幻灯片元素及其摆放位置,然后二次转换为pptx格式。当前大语言模型的聊天机器人或Agent,各种Claw类工具的输出pptx功能多属于此类。此外也有AutoPresent、SlideCoder、FlashDocs API、LandPPT等。

例如在我试用归藏老师的PPT Skills并要求Agent输出可编辑的PPTX时,过程是这样的:

二是不生成传统PPTX,输出HTML在线演示页,交互性更强。此类业界翘楚是Gamma,还包含另一家现已关闭的Tome。

如果这样算的话,使用文字模型能力输出图配文的整页SVG格式矢量图,或者干脆用Nano Banana、GPT-image-2等直出不可编辑的位图图片,也都属于此类,核心区别是并非传统PowerPoint或Keynote可编辑的。

三是直接“黑”入编辑工具或自己做一个编辑器,最后仍可微调结果并输出pptx格式文件。最典型的比如微软Copilot、WPS灵犀、百度GenFlow等,大模型在权限允许情况下,可以直接操控原生PPT对象。这也包括Lovart这种可以模拟psd的图层机制,且将元素分开用生图模型指令微调,以保持画布其他部分不动,“指哪打哪”的。

以Kimi的PPT生成为例,其“香蕉模式”实质就是接入Nano Banana模型,为每一页出图以后,当需要调整时,会询问是否用重新生成的页面替换原页面还是新建一页,每次都会有轻微的变动。

此时我们就可以梳理一下转折点到底发生在过去三年中的哪一年了。

最先跑出来的是低代码模板。社长试用过2023年8月上线的AiPPT.cn,并且对话过爱设计&AiPPT.cn市场负责人蒋依林。它们主打“一句话一分钟一键生成PPT”,其实际操作过程是将模板类型,字体字号等做成内部可用的伪代码,大模型可以生成这种伪代码,一键导入后即可读取。

如果你也用过问卷星做问卷一定知道是什么意思,就是当你用语义描述问卷题型如单选、多选的时候,一键导入即可节省原本圈圈点点的过程。这个极其简单的实现保证了产出的高可靠性,同时盘活了存量PPT模板资源,3个月月活突破百万。

百度文库AI PPT于8月31日随文心一言公测同步上线,开放12小时内使用量超100万。WPS AI在同年11月4日开启公测。这条路可靠性高,模板经过设计师打磨,排版不会出格。但是天花板也很低,因为你只能在它提供的那些模板里选。

当然,如果不限制在PowerPoint以及Keynote生态中,只是达到一个演示的目的,假如你之前就是带着PDF而不是PPT上台的,那干脆放弃PPTX,直接输出HTML在线演示页就很适合此类用户。2020年创立的Gamma是这条路线的代表,2023年3月上线AI集成后,9个月拿下1000万用户,增速凶猛。到2025年4月,5000万用户、ARR 5000万美元,全公司仅约30名员工。同年11月估值21亿美元、ARR突破1亿美元、团队扩展至52人。跟它几乎同时走同样道路的Tome,则发展的不太顺利,现在已经关闭了。

Gamma的哲学是,演示文稿最终是给人看的,PowerPoint只是载体,HTML天然比PPTX更灵活,动画、交互、嵌入都更自由。当然,代价在国内尤为明显:可以不用Office的PPT做演示的人一般本来就没有做演示的需求,你当公司统一模板里的logo设计、页眉页脚是不存在的吗?

到2025年,上述不同技术路线终于开始殊途同归地解决那个听上去最理所当然,实现起来却最曲折的诉求——让大模型直接生成可用的PPTX文件,乃至修改它。

微软Copilot这边,2023年11月1日正式开放商用,30美元/用户/月。但是在漫长的岁月里(大模型界是“天上一日,地下一年”,两年多可不长吗?)它只是Office的一个侧边栏面板,号称深度嵌入PowerPoint客户端,直接操控原生PPT对象,却从未真正成功过。在此期间其他模型如智谱和Claude也在做侧边栏插件,但除了Excel之外,PowerPoint的更改始终是一大难题。微软有Office的完整控制权,进展却比预期更慢。直到今年4月22日,借助Claude模型的支持,Copilot Agent能力才在PowerPoint中正式落地。

Claude 3.5 Sonnet在2024年6月推出Artifacts功能,可以生成HTML/SVG交互式演示,开了个口子,但离真正的PPTX还差一步。2025年1月,UC Berkeley等机构的AutoPresent论文提出工具增强代码生成方法,构建SLIDESLIB库(基于python-pptx),让LLM生成Python代码再执行输出PPTX,该论文被CVPR 2025收录。

到2025年8月,ChatGPT通过Agent功能原生生成.pptx文件。当时仅限标题加项目符号的内容型幻灯片,还不能加入富文本内容。两个月后,谷歌Gemini可直接生成完整的Google Slides演示文稿,在主流的商用大模型中最早实现自然语言的端到端演示文稿生成。此时也出现了python-pptx之外的另一种中间格式Marp,用Markdown写演示文稿再转PPTX/PDF/HTML,成为大模型和PPTX之间的桥梁。

同年,多亏了Manus,智能体风潮席卷几乎所有玩家。智能体做PPT的核心要点是一个大任务拆成多个子任务并行操作。百度推出GenFlow,昆仑万维发布天工超级智能体,WPS推出灵犀3.0,谷歌NotebookLM上线Slide Deck功能,都支持从上传文档自动生成幻灯片,并支持逐页编辑。大纲、排版、配图、数据图表各交给专门的子Agent,再汇合交付。但生成到什么样,还是比较看运气,而且因为中间步骤多,“一步错,步步错”的问题也让用户头痛不已。

今年上半年,这个领域的竞争焦点,主要也集中于解决生成完了不能直接用、直接改的困局。商汤办公小浣熊的宣传口号就是“页页可改”。也有玩家把其它领域的可编辑经验搬回到演示上,比如Claude Design既然可以做交互式网页或App设计,迁移到演示文稿制作也不在话下。

总体来说,大模型改PPT跟改图乃至改视频一样,并不是有意识的知道哪里错了要改哪里,而是或多或少地全部重绘一个区域。这个区域画的圈越小,修改就越精细化,仅此而已。

目前看,最稳妥的方式应该就是用Marp类中间件或模型厂商自研的途径,从做好的H5网页转化到PPT格式。很可能也正是因为想通了这个问题,AI PPT的可编辑性问题在过去半年得到了很好的解决。

Skill就是结构化的系统提示词,得益于模型能力的进步,每个人vibe开发一个自己的skill来固化工作流都比较简单。以某个Hermes skill为例,核心思路是用SVG作为中间层,先完成画布、页数、受众、风格、配色、图标、字体、图片等8项确认,再按每页的SlideIntent规划叙事和布局,由AI逐页生成SVG,经过图标嵌入、图片裁剪、文字修复、质量检查后,转成可编辑的原生PPTX。这里,SVG就是到PPTX之前的中间格式。

另一个作者使用Dokie生成SVG格式幻灯片单页效果如下:

可以看出在配图方面都是用小图标,在嵌入位图方面仍然需要其他调整。

还有人主打用优秀的编码模型如gpt-5.5或GLM-5.1先生成HTML作为中间格式,再用各家skill比如Minimax的那个,像素级复制成PPT。核心就是让AI先在它最擅长的格式里做到最好,再转换到你需要交付的格式。

这种方法每次修改其实只修改SVG或网页这种版本,而PPT是每次都重新导出一遍。怎么说呢,管你这那的,能用不就得了。

改AI的PPT比自己做还累?

随着AI PPT从炫技到落地,带来了一个意外的连锁反应:这个过程筛选出来了那些真的需要PPT的人。正如在讲到Gamma时社长提到的那样,PPTX这个格式包含的意味远大于给人做演示本身,还得用公司模板,还得说明内容逻辑,等等。

就在前几天,V2EX论坛有帖子讨论:“真的有人用AI做PPT吗?”发帖人说,虽然这种应用已经很多了,但考虑到公司有模板,AI的可用性不太强,还是老老实实一页一页做。

核心问题就是80%的成品的修改工作量,和自己直接手搓的(工作量)哪个更大。

真用的人认为,改AI的东西,有时候比从零开始更痛苦,因为你要先理解AI为什么这么做,再推翻它的逻辑,再重新排。而如果你不指定每页的逻辑,让AI根据原始材料自己跑,那大概率会得到“把内容均匀分配到每一页”。

我也没碰到好用的,都是一股AI味,看起来就是AI生成内容然后选择一个合适的模板往里填,压根没考虑这段内容要怎么展示更合适。

当然,里面也有“你觉得做的不好是因为提示词不到位”这种反思派。社长也基本是这一路人,觉得现阶段只要AI做的东西修改量到达一个大致的临界点,哪怕慢于人力也应该追求炼化AI,因为磨刀不误砍柴工,炼好了利在千秋。

正是这样的反驳,凸显出我们这种人可能不是PPT的核心使用者。

很多时候Human-in-the-loop的人没法跑出循环,不是说你不盯着AI它就给你删库跑路。只不过是你作为一个监工的身份下,越是旁观别人工作,“视奸”它的终端和屏幕,你想打断它插入自己意见的冲动,就越强烈。

放心不下,还不是因为在乎?这个PPT要想播放到某个场合,恐怕还得在PC和Mac上多做测试,必要时候把附带的文件都拷到同一个文件夹,还得做PDF,PPT双格式保险……那这必然是课程作业、工作汇报、融资方案、学术演讲等等,如此不容有失的场合。

我们老板对一个人的汇报,从入职开始基本上就3次机会,3次以上没满意就会雪藏或者开掉,拿AI真糊弄不了老板。重要的你的口述和思想。写一大堆卵用没有!

结构、排版、配图、动画,这些体力活AI干得又快又好。剩下那20%是认知负荷最高的,真正费脑子的事情。

不论我们对AI PPT原本的期望如何,现在它总算走到了这一步。今年开始,你也确实可以把带你公司logo的模板喂入工具来做你的草稿了,输出也可以是PPTX格式了,里面的内容也可以编辑了。

但在里面写点什么,还得是咱们自己来拿主意。

本文由人人都是产品经理作者【航通社】,微信公众号:【航通社】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!