三道锁:AI 给叙事产品解开了什么
互动叙事品类提了近十年,为何始终未能爆发?本文从供给、交互、状态三道锁出发,结合AI生成技术的最新进展,剖析内容成本、用户自由度与持久性难题的解锁路径,为产品经理揭示这一赛道从人力堆量转向计算驱动的拐点信号。

Long time no see~这段时间处于各种原因一直没有更新,恰巧期间一直在做AI互动叙事类型的产品,有了一些思考,简单整理了一下,趁这个契机想和大家聊聊,那么话不多说,直接进入正题~
一个提了快十年都没做大的品类
互动叙事不是新概念
先把范围划一下。这篇文章说的互动叙事,不是 RPG、视觉小说、Galgame 这些早就跑通的传统游戏品类,而是夹在影视、短剧、文字内容和游戏中间的那一层:以看故事为核心,同时允许用户用选择、输入和行动去影响剧情走向的内容
我是从玩家那头入的坑。2019 年,中文市场有了自己的互动影游,我用一个周末通关了三遍,还在本子上画了张分支图,就想搞清楚哪些选择是真的有用、哪些只是摆设。画完有点扫兴,真正会改变结局的节点其实没几个,大部分分支绕一圈还是回到同一条路上。那阵子所有人都在说,这是下一个内容形态
后来呢?后来就安静了
这个品类有个很奇怪的规律,每隔一两年就会被重新提起一次,开一轮会,立一批项,再往后就没什么声音了。我这些年做 AI 产品,被问得最多的一个问题就是:互动叙事这东西看着挺好,提了快十年,为什么还没做大
我以前的答案很含糊,说市场没起来,说用户没习惯。现在我觉得,这个答案至少没有碰到最核心的问题
用户不是不想互动。你去看直播间里有多少人在刷”选左边”,去看短剧评论区有多少人在写”如果我是女主我就”。至少从这些场景看,用户并不排斥参与故事,表达”如果是我会怎么做”的欲望一直存在。真正卡住这个品类的,是三样很具体的东西
我把它们叫做三道锁
一道是供给锁,内容量上不去。过去的互动内容高度依赖人力堆量,多一个真正有效的分支,就意味着额外的剧本、拍摄、动画、配音和后期制作。创作者不是不想做,是做不起
一道是交互锁,意图说不出来。用户脑子里想的是一整句话,落到屏幕上只剩两三个预设选项
还有一道是状态锁,发生过的变化留不下来。你拿到了什么、改变了什么、和谁建立了怎样的关系,很难稳定成为世界后续运行的一部分
三道锁松动的时间并不一样。供给锁最早,这两年一直在松;真正让我坐直的是 2026 年,另外两道也开始动了。智象未来的 HiDream-O1-World 让角色、环境和剧情可以在运行当中继续生成;爱诗科技的 PixVerse R2 则把生成式互动影游进一步往”正在运行的系统”推进,用户的输入不只改变当下画面,也开始进入后续状态
这几件事看着很散,我盯了一个多月,越看越觉得它们其实是同一件事的三个层次
这篇文章就想把这三个层次讲清楚,写给同行看,尤其是那些手上正好有一个互动叙事的想法、又不知道现在到底能不能干的产品经理
先把三道锁摆到桌面上
我习惯做产品前先画一张最简单的地图,把复杂的事情压到一张表里

这张表就是全文的地图,后面每一部分讲一道锁
供给锁:内容量上不去
叙事产品最硬的一条约束是内容量
互动内容最麻烦的地方在于,有效分支一多,需要生产的素材就会迅速膨胀。理论上的完整剧情树甚至会随分支深度指数增长,实际制作虽然会通过分支汇流和资产复用控制规模,可交互越多,生产成本仍然越难压住
更麻烦的是,它很难像软件那样低成本迭代。实拍内容一经定型,后续修改往往意味着重新协调演员、场景和拍摄计划,相比游戏和软件可以持续更新的生产方式,传统影视内容的迭代灵活性要差得多
所以这道锁的核心不是”做不出好内容”,而是内容规模长期受制于生产成本。解锁逻辑只有一个字:生成。这也是三道锁里最早松动、最先看到产业结果的一道
交互锁:意图说不出来
再往下一条约束是自由度。不是产品不想给自由,是过去的内容生产方式承接不了这种自由
这里最硬的技术约束之一是延迟。用户发出的指令,时间尺度差得太远,短的要快速反馈,长的本身就是一段完整演出。这个问题后面单独讲
状态锁:发生过的变化留不下来
最隐蔽的一条约束是持久性,它其实分两层
上面一层是显式状态:你拿到了什么、完成了什么、跟某个角色是什么关系。这一层理论上可以通过数据库、状态机或者关系系统存下来
下面一层难得多,是世界本身的连续性。生成系统天然带误差,记忆里写着门已经打开了,画面里那扇门却可能又合上了
所以状态锁真正卡住的不只是记不记得住,而是已经发生过的变化,能不能既被系统记住,又在后面的世界演化里继续成立
这三道锁虽然对应不同的问题,放在生成式互动叙事里,更像一条能力递进:内容能不能做出来,用户能不能自由影响它,这些影响最后能不能留下来。下面从最早松动的那道开始讲
供给锁:内容量不再只由人力决定
这曾经是一个人力堆量的行业
线性影视拍 100 分钟,就是 100 分钟的素材。互动内容不是这个逻辑,多一个真正有效的分支,往往意味着额外的一套内容制作
过去两年,这个品类整体仍然面临明显的盈利压力。支线多会直接抬高素材量,在真人实拍前提下制作成本高企,变现方式却相对有限,往往只有跑到头部才更容易覆盖成本。有行业测算认为,2024 到 2025 年期间,互动影视项目的亏损比例可能接近九成
结果就是一个特别反讽的局面:这个品类产能不足,不是因为没人想做,而是创作太难、制作太贵、发行门槛太高,很难形成持续的人才和内容供给循环
我认识几个做过互动剧的编剧,最后都转去写短剧了。不是不喜欢,是养不活自己
AI 砍掉的是哪一段成本
变化最先发生在生产端,而且已经开始可以量化
先看成本。原本千万级的真人实拍项目,AI 介入之后能压到六七百万这个量级,甚至更低。制作周期也有明显缩短,从大半年压到几个月,在后期修脸、特效置景这些环节尤其明显。放到漫剧这种更轻的形态上,AI 漫剧的制作成本已经开始进入每分钟千元级,而传统动画和真人制作往往高得多
再看周期。字节有一款修仙题材的 AI 游戏,大部分内容由 Seedance 2.0 生成,团队早期十来个人,半年就跑完了三成左右的进度。更极端的是 Yoroll 做过的一次公开实测,GPT Image 2 负责画面、Seedance 2.0 负责视频,从剧本到成片只用了三个小时。产出的不是几张截图拼成的片段,而是一个有分支剧情、有选择、有不同结局的完整互动游戏
三个小时。我当时看完这条消息,去买了杯咖啡,回来又看了一遍
产出效率也在跳。Seedance 2.0 发布之后,角色一致性、动作执行和镜头控制继续改善,小团队在真实内容生产里的效率也开始往上走,十来个人的团队、一个月的制作周期,已经有作品跑到十亿量级播放,投资回报率达到三位数
这里得留个心眼。爆款同时受题材、IP、分发和平台算法影响,它能证明的是小团队跑得快,不能反过来证明模型能力已经成熟。我自己看这类数据,只把它当成生产曲线发生变化的旁证
行业里流传很广的一句成本判断,来自一位从业者,他说:”过去 CDN 是传统内容分发的成本,现在 Token 是 AI 实时生成内容的成本,当 Token 价格低于 CDN 价格的时候,AI 互动影游才真的能够成立”
这句话很形象,我更愿意把它当成一个比喻,而不是一条严格公式。CDN 和 Token 计价的东西根本不是一回事,硬拿来对齐很容易算歪
真正该盯的是另一条线:一个用户每玩一分钟,要烧掉多少生成成本,这一分钟又能换回多少钱
这两条线什么时候开始接近,生成式互动内容才算真正进入可以规模化算账的阶段。从模型推理成本和生成效率的变化看,这条线至少正在往可计算、可验证的方向移动
天花板掀掉之后,什么被释放了
有一层释放是题材
过去真人实拍的互动影游高度集中在现代都市和恋爱类型。为什么?因为古装题材动辄千万,末世科幻、盗墓探险的特效和置景成本更高,市场规模又有限,投资风险自然更大。现在已经有团队在做美漫风格的全 AI 互动叙事产品,也有团队重新启动过去因为成本限制难以推进的科幻项目
另一层释放是形态
2025 年 DeepSeek 这类通用大模型快速普及之后,一个被开发者叫做”AI 文游”的新品类开始冒出来。大致分三类:AI 带团的跑团游戏,网页形态的各种模拟器小游戏,还有一种更轻的,以提示词为本体,复制到任意大模型里就能开玩。今年 5 月上线的一款历史题材模拟器更进一步,玩家买断本体之后还要继续消耗 Token,剧情不再靠提前写好的文本推进,而是跟着玩家输入的施政意图实时变化
你买的不是内容,是一段可以持续燃烧的计算。这个商业模型跟过去完全不是一回事
还有一层释放是创作者
工具端也在同步发力。腾讯光子工作室群推出了 AI 互动游戏创作平台,用户用自然语言说出创意就能生成剧本、角色、场景、剧情树和可交互作品,内测期社区已经积累几十款内容,目前平台上已经有近三百款互动影游。老牌文字互动平台橙光也推出了自己的创作助手,输入故事设定和人物关系,可以自动辅助生成场景、配音以及剧情分支。互影科技同样开放了创作类 Agent 产品
数据也在说明供给曲线确实变了。去年 AIGC 漫剧的月度占比从几乎为零涨到年底的一成上下,播放量到了二十亿量级,全年翻了百倍不止。抖音每月排名前五千的短剧里,全 AI 生成的微短剧从年初个位数涨到了年末两百多部

我觉得最要紧的不是便宜
供给锁开始松动之后,最值得产品经理记住的,不是成本降了多少,而是这个品类第一次真正获得了更强的迭代能力
一位在这行做了十年的创始人说得很准,AI 可以让过去近乎一次性的拍摄制作,变成更接近游戏开发的可迭代模式
另一位从业者的判断更接近本质,他说 AI 的核心不是低成本量产内容,而是实现个性化的内容定制。这恰好匹配互动叙事千人千面、用户驱动剧情的核心特质
不过制作门槛下降之后,一个新的问题马上出现了:差异化竞争力从哪来。这个问题先放在这里,文章末尾再回来
我还想补一句自己的观察。内容量不再稀缺之后,稀缺的东西会往后挪一格
过去内容是瓶颈,谁能产出,谁就有议价权。现在产出变便宜了,瓶颈会逐渐往注意力和分发迁移。你一天能生成一百段互动剧情,可用户一天只有几十分钟,平台推荐位也只有那么几个坑
我见过好几个团队栽在这里。工具用得飞起,一周做十个原型,最后发现没有一个能说清楚,用户为什么要在今天晚上打开我这个东西。这不是技术问题,是老老实实的产品问题,AI 一点忙都帮不上
交互锁:意图不必再被压缩
用户想说的话,被压成了几个选项
互动叙事产品里的”选择”,长期是一种妥协
用户脑子里想的是一整句话,落到界面上却变成二选一、三选一。前面算过那笔账,在实时生成能力出现之前,多一种真正不同的结果,就意味着多准备一套对应内容
所以过去这类产品的交互逻辑,本质上是”我要选什么”,产品提前把可能性枚举好,用户从里面挑一个
AI 把这个逻辑翻过来了
有一段乙女向的演示很能说明问题。用户在对话框里输入”给我生成一个温泉福利剧情”,画面里就开始生成对应的角色和互动场景。不需要提前把这条分支拍完,也不需要先做成一个按钮,用户先说出想要什么,世界再尝试给出结果
输入形态也在同步变宽。今年 1 月的 PixVerse R1 主要通过提示词改变世界,到了 R2,选项、文字、语音、快速反应事件都开始加入,镜头控制、方向移动、跳跃这些更有游戏感的操作也逐步出现。目前公开玩法大致可以归成三类:世界构建与探索、剧情互动与推进、角色实时互动

拦在中间的那堵墙叫延迟
“听懂用户说什么”和”立刻给出画面”,是两件完全不同的事
完整的世界模型能力很重,实时交互对延迟又极其敏感。难点在于用户的指令长短差得太远。按一下 W 键,用户期待的是快速响应;说一句完整的话,角色可能需要几秒做完动作、演出和台词,这本身就是一个完整事件。如果每段都切得很短,动作和语义容易被拦腰截断;如果每段都留得很长,用户按完键又要等半天
R2 的一个解法叫 Dynamic Chunk,翻成人话就是动态分块。道理其实很朴素:短操作匹配短块,完整事件允许更长的生成时间,模型按照控制信号的语义和时间尺度去组织音视频生成
说白了就是把指令分级。上下左右移动这类操作优先保证反馈速度,复杂提示词则需要留出完整的演出时间,模型不用再拿同一种生成节奏同时兼顾反应和演出
配套的变化是,多种输入也开始能够同时发生。语音、文字、音频参考、图片参考、方向与镜头控制可以一起进入系统,官方那段”送信”演示里,你能一边跑,一边继续打字下达新的指令
我看到这里的时候有个很直接的感受:这不是把视频做得更像游戏,而是把一部分交互设计的自由度还给了创作者
创作者已经跑在前面了
技术松动的同一个月,爱诗科技旗下的 PixLab 影像内容实验室邀请了三位签约 AI 创作者,共创了三款 AI 互动影游,先给行业打了个样
三支作品用的都是同一种模式:预置视频分支加实时 AI 生成的混合交互。创作者设定大背景和故事主线,同时给玩家留出自由探索的空间
这个混合模式值得每个产品经理记下来,它至少是现阶段非常现实的一种落地形态
其中一款把”意图不必被压缩”讲得最直观。故事设定在中世纪风格的魔法学院,红发少年连续两年测出零魔力,成了被人嘲笑的零印法师。战斗中面对第一只魔兽,玩家可以通过念咒语的方式实时生成魔法
创作者的原话我很喜欢,她说:”最开始我们做 AI 视频,大家开玩笑说提示词就像咒语,现在我们真的把提示词做成了咒语。打怪的时候你想放火、放水还是召唤雷电?想用什么魔法,都可以实时打字生成”
据她介绍,第一章为了打开世界观,互动占比相对低一些,大约在 35% 左右,后续还会增加不同选择导向不同魔法师成长路线这样的玩法
另一款走的是心理恐怖。男主是一位深空研究员,玩家通过他的视角探索被怪物席卷后的封闭空间,并不断判断到底相信谁。核心概念被概括成”信任即现实”,你信任谁,谁就成为现实;不信任谁,谁就可能变成怪物。团队还设计了一个类似系统助手的数字人角色陪玩家探索,最终导向四个主要结局
还有一款世界观最硬,中式武侠、硬核科幻加末日废土。月球白天 14 天、夜晚 14 天,温差发电站建在阴阳交接线上,月壤粗糙带电,飞行器只能贴着表面滑行
爱诗把这三部作品称作三个样板间。它们未必证明完全开放的 AI 世界已经成熟,可至少说明创作者已经开始把实时生成能力放进真正的叙事设计里,而不是只做一段技术演示
这道锁松开的到底是什么
交互锁卡住的是自由度,过去用户能表达的,最后往往都会被压缩成屏幕上的预设选项
现在输入形态开始扩展到语音、文字、快速反应事件和镜头控制,延迟也在通过新的生成机制被进一步压低。一句话收束:过去只能选,现在开始可以说
这里必须留一句冷静的话。目前大量公开展示依然属于限定场景下的能力预览,不能由几个效果很好的演示推导出一个完全开放的世界,也不能把它当成已经成熟的商用互动娱乐引擎。我们做产品的人,最容易在这个地方兴奋过头
从”我要选什么”到”我想要什么”
这是我认为整篇文章最重要的一句话
刚才那段温泉演示,跟传统乙游从固定选项里挑一个的逻辑完全不同。AI 带来的体验,有机会从”我要选什么”转向”我想要什么”
这句话对产品经理的含义是:过去我们设计的是选项,未来更重要的是设计意图的承接方式。选项是有穷的、可枚举的、可以做测试用例的;意图是开放的,很难穷举
这是交互锁松动之后,我们接手的第一个新问题。用户说出一句你完全没预料到的话时,你的世界怎么接住它?接不住的时候怎么兜底?兜不住的时候,会不会把整个世界观撞碎
关于兜底,我最近想了三种思路,还比较粗糙
一种是收敛到主线。用户的输入可以开放,可世界仍然有自己的因果关系和关键节点。武侠世界里你非要掏出一把手枪,系统不一定要直接否定,也可以让这把明显不属于世界的东西成为一个异常线索,把冲突重新拉回剧情
一种是让角色替系统说不。世界不一定要拒绝用户,角色可以。一个古板的守门人本来就不该让你随便进密室,这个”不”是人设的一部分,用户感受到的是这个角色有脾气,而不是系统能力不足
还有一种是把越界本身变成剧情。用户想干的荒唐事,恰恰可能是最好的支线素材。你越想把用户框住,用户越想跳出来,有时候不如把跳出来这件事本身设计成一种玩法
三种方式背后其实是同一件事:开放交互不是取消边界,而是尽量把边界设计在世界内部。在一个号称能听懂你说话的世界里,一句突然出现的”暂不支持”,对沉浸感的破坏有时候比画面糊掉还严重
状态锁:让世界记得住你
前面两道锁,一道解的是内容够不够,一道解的是表达自不自由。这一道最隐蔽:这个世界会不会记得刚刚发生过什么
过去的世界是死的
判断一段 AI 生成内容究竟更像一段视频,还是开始像一个世界,有个最简单的动作:转身
沿着街道往前走,拐过一个路口,再回到原地,刚才那栋建筑还在吗?推开桌上的杯子,它会按照合理的方向倒下吗?镜头从第一人称切到第三人称,人物、空间和光影还能对得上吗
这些听起来理所当然的事情,对今天的 AI 视频模型来说都很难
过去两年 AI 视频一直在卷画质、卷时长、卷运镜,可只要用户无法进入、无法持续控制,场景也无法延续刚刚发生的变化,它本质上仍然更接近一次性生成、播放完就结束的内容
现在,世界开始记住你
一个值得注意的节点出现在 2026 年,智象未来和爱诗科技先后把这道锁撬开了一条缝
HiDream-O1-World 给出了很直接的产品画面:角色、环境和剧情可以在运行中继续生成,用户可以停下来探索原本只是背景的街道,也可以走进创作者没有逐帧制作过的空间
更早一点的信号来自阿里。ATH 创新事业部的 HappyOyster 在 4 月就展示了两种模式,Wander 让用户以第一人称进入实时生成的空间,每一步都继续触发新的世界生成;Direct 则允许用户在生成过程中继续插话,修改镜头、角色动作和剧情走向,而不是全部推倒重来
这类产品通常会被放在”世界模拟器”或者交互式世界模型的讨论里,它和 Genie 3 属于相近的产品想象:不是生成一段视频,而是让用户持续进入并改变一个正在生成的空间
PixVerse R2 则把这件事进一步推向了叙事层。它更关键的变化不只是响应更快,而是开始关心改变带来的后果
假如你在一个场景里从桌上拿走了一把钥匙,那后面的世界就应该承认这件事发生过。你在对话里惹恼了一个角色,下一次见面时,系统也应该能体现关系发生过变化。你完成了一个任务,世界要继续呈现这个结果,而不是镜头一切就全部刷新
落到产品语言上就是,玩家的选择与指令不只改变当下镜头,还要继续影响后面的剧情、关系和世界状态
这里要把两层状态分开看。上面一层是角色记忆、人物关系、任务和剧情变量,这些内容可以被结构化存储,本质上还是软件工程问题,已经有相对成熟的解决方法。下面一层才更难,生成模型要让这些变化在后续画面、空间和行为里继续成立
所以真正困难的,不是给模型挂一个记忆模块,而是让记忆里的事实和生成出来的世界对得上。记忆里写着你已经带走了钥匙,画面里那把钥匙就不应该还躺在桌上
我想了很久怎么把这个分野说明白,最后想到一句话:视频关心下一帧像不像,世界模型还要关心下一步对不对

而用户的位置也变了,不只是从观众变成参与者,更开始直接修改系统状态
三个入口:世界、故事、角色
状态能力开始增强以后,产品形态并没有收敛成一个,反而分化出三个很清晰的入口

这三者不是三个功能,更像是三种产品
世界卖的是”我的世界”,价值来自长期运行的场景连续性、可探索空间,以及用户一路做出的改变能够留下来
故事卖的是”一个会回应我的故事”,模型需要允许选择产生真实差异,同时又保住人物设定、叙事节奏和故事边界
角色卖的是”一个记得我的人”,它的核心不是地图有多大,而是一个月以后,它还是不是我认识的那个角色
如果你手上有一个互动叙事的想法,我建议先把它归到这三个入口里的某一个,别想着上来一次做全。这三种产品的留存曲线、成本结构和内容供给方式完全不一样

为什么偏偏是现在开始做得到
技术部分我只留这一节,作为”过去做不到、现在开始勉强能做到”的注脚
世界跑久了容易崩,其中一个核心问题就是误差累积。模型长时间读取自己生成的历史,前面一点小偏差可能不断往后传播,人物的手前面歪了一点,后面可能越来越歪
PixVerse R2 采用的一套方案,是把记忆拆成多个时间尺度。它的 Multi-Timescale Memory 分成三个通道,用剧组来打比方最好懂
一个通道保存角色、场景和世界规则,像编剧或者设定集,决定这个世界长期应该长什么样
一个通道负责最近的动作和镜头变化,像分镜师,持续滚动更新
还有一个通道保存那些已经发生、又会继续影响后续演化的重要对象状态,更像场记
训练端同时让模型接触两类历史,相对干净的正确历史,以及人为加入噪声的历史,这样它能提前适应实际运行过程中一定会遇到的小错误。再配一个 Error Bank,把有代表性的错误历史重新放回训练过程,练习从已经偏掉的状态里继续生成合理的下一步
智象未来走的是另一条路,用 Memory 负责保存长期世界状态,再用 TTT 在运行过程中持续校准新的变化,共同解决人走了以后世界被刷新、镜头转回来场景又被重新发明一次这类问题
还有一条很不一样的路线来自 World Labs。9 月初发布的 Atlas 更偏空间世界建模,它解决记忆问题的思路不是把看过的所有画面按时间不断塞进上下文,而是把记忆和空间位置绑定,生成一个新视角时,只检索附近真正相关的信息。简单说,前面的路线更关心这个世界刚才发生了什么,Atlas 更关心这个地方刚才长什么样
Atlas 的重点明显更偏空间重建和机器人仿真,离叙事产品还隔着一层。可有一个能力对叙事产品很值得关注,相机位姿可以成为原生输入,这意味着运镜开始从写提示词碰运气,往更明确的空间控制移动
行业也开始有尺子了。美团 LongCat 团队和复旦联合推出了交互式世界模型评测基准 WBench,用近三百个测试案例、上千轮交互和二十多项细分指标,从视频质量、设定遵循、交互能力、一致性和物理合理性几个维度做评估,HiDream-O1-World 在发布时,在其中多个维度都排在前列
当然,名次每来一个新模型就可能变化。比谁是第一更值得关注的是另一件事:行业开始用可重复的测试,去回答一个世界究竟能不能持续跑下去
边界也要说清楚。在严格的实时预算下,R2 这类模型的单次生成质量依然难以全面超过前沿离线视频模型,复杂细节、运动自然度和长时间稳定性都还有提升空间。现在就谈一个成熟的无限世界,太早了
可对叙事产品来说,重要的不是它现在有多完美,而是生成系统开始具备一种过去很难提供的产品能力:影响能够持续存在
视频不再只能被生成、播放、看完,它开始有机会成为一个应用本身的画面、角色和现场。状态锁开始松动以后,用户关系能不能累积这件事,也开始出现新的产品化答案
不过这里有个陷阱,我提醒一下自己,也提醒你:能记住,不代表什么都要记住
我们做产品的很容易一上头,就想把所有东西都存进状态里,用户说过的每句话、点过的每个位置、走过的每条路。真这么干,一是成本压不住,二是体验很容易变得可怕。你玩个游戏,角色突然提起你三个月前随口说的一句气话,这不叫沉浸,这叫恐怖片
所以记忆的产品设计,重点根本不在”能记多少”,而在什么应该被记住多久。哪些东西必须永久留存,哪些东西只在本次会话有效,哪些东西应该随时间衰减,这三条线怎么画,直接决定这个世界让人觉得温暖,还是觉得渗人
这个判断没有模型能替你做
三道锁解开之后,产品形态变了
三道锁分别松动以后,落到产品上,也开始发生几种明显的迁移
从选一部剧,到进入一个世界
传统影视拍摄完成之后,世界基本就固定了。互动影游虽然加入了选择和分支,制作逻辑依然高度依赖提前设计好的剧情树和资产
生成式世界模型提供了另一种可能:角色、环境和剧情可以在运行中继续生成,观众可以停下来探索原本只是背景的街道,也可以进入创作者没有逐帧制作过的空间
R2 的 World 模式把这个变化讲得很具体。用键盘控制行进,方向键调整镜头,也可以用语音和文字改变场景、角色、视觉风格与互动方式,它开始尝试在更长的运行时序里保留用户一路造成的变化
世界从”被播放的空间”,开始变成”可被进入的场所”
从叙事,到体验
叙事不再是唯一的产品目标,交互密度本身也成了设计对象
一位创作者说得很直接:游戏和影视最大的不同之一就是交互,要让玩家通过输入和输出获得参与感、体验感,通过主动探索去推进剧情,而不是一直被动接受
有人在前期策划阶段就设计了六种核心交互系统,专门去探引擎能力的上限。也有人把呈现重点前移到剧本和资产库,希望用 AI 做有根源的硬科幻,先把世界观打牢,再激发用户的探索欲和二次创作
可交互并不是越多越好。没有意义的操作只会把叙事切碎,用户点了半天发现什么也没改变,比不让他点还伤。真正要设计的是,哪些地方值得让用户动手,哪些地方应该把控制权交回给剧情
过去我们问的是”这个故事讲得好不好”,现在还要同时问一句”在这个世界里,我能做什么”
从用户生产内容,到实时共创
创作的边界,也开始从”开发者做、用户选”,往”用户的行为本身在改写世界”推进
互影科技联合 B 站做过一场依托弹幕机制的实时共创,大量用户一起推动剧情,峰值弹幕量甚至突破了平台承载上限。它代表的是从单人选择到多人共创、从预录剧情到实时推演的一种变化
共创还有另一种更慢的形态。有人举过一个例子,假设《西游记》被做成 AI 互动影游,一个玩家特别喜欢高老庄这一段,他花大量时间把这一小段继续延展成猪八戒与高小姐的世界,这个小世界又可能吸引其他用户继续进去扩展。如果每个可发散的点都能继续滚动,一个大 IP 就有可能持续孵化出大量由用户共同扩展的小世界和衍生 IP
HappyOyster 也已经把类似思路写进产品设计,用户跑出来的数字世界可以被保存,也可以继续开放给其他人修改。世界本身开始变成一种可以继续编辑和传递的内容资产
再往前一步,生成世界甚至可能演化成一种新的社交空间。几个人共同生活在一个持续生成的世界里,一个人做出的决定,会成为其他人下一次进入时必须面对的现实
用户生产内容是让用户生产内容,实时共创更进一步,是让用户生产”世界的后续状态”。这两件事的产品设计难度,完全不在一个量级
从流量,到留存
这是最产品经理的一段,账本变了
变现仍然是几条老路:应用内购买、会员、广告,以及未来可能越来越重要的持续计算消费。真正值得看的,是用户为什么回来
几年前,一部分用户会明确抗拒看剧的时候还要一直操作,现在互动形式对普通用户已经没有早期那么陌生。在一些男性向 AI 互动剧案例里,用户消费行为甚至表现出明显的小游戏特征
不过说到留存,这里得把话收一收。一些末日题材互动剧的热度到了五千万量级,部分轻互动产品几天就有千万播放,单日独立访客也能达到几十万。这些数字很好看,可它们证明的是播放量、热度和访问规模,不是留存。真正能验证留存的次日、七日和复访频次,公开口径依然很少
所以现在还不能说 AI 互动剧已经证明了留存。更准确的说法是,持续状态为这类产品增加了一种传统内容产品相对缺乏的回访理由
而且三种产品的回访理由完全不同。世界类靠用户自己攒下的资产和建设,故事类靠”我想知道接下来会发生什么”,角色类靠一段已经建立起来的关系
一次性买断的流量生意当然还会存在。可持续状态这件事,让叙事内容开始有机会往长期运营和留存生意靠近
产品经理的新工具箱
前面讲清楚了发生什么,下面讲所以我该怎么办
创作正在从团队能力变成平台能力
平台层正在快速成型
用自然语言说出一个创意,已经可以辅助生成剧本、角色、场景、剧情树和可交互作品,大幅降低编程和美术资产的前置门槛。目前一些主流创作平台大致提供两类模式:一种是互动影游,生成多分支剧本、剧情树、分镜和交互视频;另一种是游戏创作,用自然语言描述需求,再由 AI 辅助生成代码和运行逻辑
这里有个关键细节,我建议标红:一键生成不意味着什么都不用管,角色、场景、分支逻辑、互动规则都需要人工继续调整
很多人看到演示视频以后,会觉得创作者马上就被替代了。实际上被自动化最多的,是重复性的执行环节,人的工作重心会逐渐向规则设计、结果判断、调试和验收移动。对产品经理来说,真正重要的是把规则定义清楚、把边界判断清楚、把验收标准定清楚
工具还在继续往下沉。橙光推出了自己的创作助手,输入故事设定、人物关系和题材方向,系统可以辅助生成场景、立绘、配音以及剧情分支,并完成基础交互逻辑的搭建。腾讯也在做面向普通用户的视频与互动内容创作社区,把剧本理解、视频生成、AI 角色和实时可玩内容放到更完整的创作链路里
生态层的信号也比较明显,平台开始用现金激励、保底和更高分成比例争夺优质创作者
行业真正稀缺的,从来不是某一个孤立的爆款,而是可持续、可复制、可落地的创作体系和生态
交互要从界面设计变成体验设计
以后做 AI 互动叙事的人,可能真的要多学一门手艺,这门手艺不完全属于传统影视,也不完全属于传统游戏
R2 的 Story 模式已经给出了某种新交互的样貌:可以做选择,可以直接对角色说话,也可以在关键时刻触发快速反应事件。系统根据选择改变后续世界,同时还要保住人物设定和故事原有边界
一位从业者的判断,我觉得是这一段很好的落点:以后 AI 创作者想做互动影游,除了安排镜头和台词,还要开始设计世界规则。角色想要什么?用户做一件事以后,会留下什么后果?这个后果需要持续多久?系统什么时候允许用户自由发挥,什么时候应该把故事重新收回来
过去影视把大部分故事走向交给导演和编剧。互动世界把一部分选择权交给用户之后,创作者就必须开始设计,不同的行为会导致怎样的世界状态
再补一句”活人感”。一张真人质感的脸远远不够,记忆、人设、关系和回应速度,会一起决定一个 AI 角色到底有没有活人感
顺着这个逻辑往下,团队配置也会变化。过去做一部互动剧,编剧写本、导演拍摄、剪辑成片,链条很清楚。现在开始出现两类越来越重要的职责,一个负责世界规则,另一个负责模型输出稳定性
我暂时把前一种职责叫做规则编剧。他不只是写台词,更重要的是写,在这个世界里,什么事情会导致什么后果。另一类职责更偏技术和生成管线:同一套设定反复生成以后,人物是不是同一个人?场景有没有漂?动作和叙事有没有跑偏
这些职责并不是完全新生,游戏里的世界观策划、系统策划、技术美术,都有相近部分。可生成式互动内容正在把它们重新组合成新的岗位边界。谁能更早把这两类职责补齐,谁就更有机会在内容稳定性和生产效率上建立差异
影视和游戏的边界在消融
它既不是简单的影视化,也不是简单的游戏化,更像是两种生产逻辑夹在中间,长出了另一种东西
传统影视内容总体是线性的,创作者决定主要过程和结局。传统游戏可以交互,却需要提前制作大量场景、角色、动作和规则。如果世界开始能够实时生成,这两种内容形态之间的边界就会逐渐变得模糊
未来一部电影也许会拥有持续生长的剧情。观众可以走进场景,跟角色交谈,改变一个关键事件,最后看到一个没有被编剧逐句提前写下的结果
产业侧也已经开始沿着这个方向尝试:内容形态从线性叙事走向树状叙事,用户从观看者变成参与者,AI 剧与游戏之间的界限正在消融。一些内容公司正在给 AI 漫剧增加更多互动要素,也开始同时布局互动影游、小游戏甚至 VR
可我不想把这件事写得太乐观,真正难的是,两套内容逻辑本身并不完全一致。游戏团队更强调玩法、系统和数值反馈,漫剧更强调剧情推进、情绪节奏和爽点密度,这两套逻辑怎么结合,目前没有标准答案
所谓终极形态也没必要说得太早。电影出现以后没有让小说消失,看文字有看文字的乐趣,看固定内容也有固定内容的价值
最关键的一点是:好剧本的门槛,并没有跟着制作成本一起下降
甚至在开放互动里,它可能更难。因为创作者既要有叙事审美,又要有系统逻辑,既要知道什么故事好看,也要知道用户把故事推向一个没预料到的方向以后,怎么让它继续成立
AI 降低了执行门槛,没有降低判断门槛。技术永远要服务于创意,会用工具当然重要,可工具最终解决不了什么东西值得做
验收标准变了
评测体系这里我不展开,只留一个变化
过去视频生成的评测,更多关注画面质量、动作和提示词遵循。交互式世界模型出现以后,评测开始进一步延伸到操作响应、空间维持、长时序一致性,以及后续变化是不是合理
一次评测当然不能证明模型已经真正理解完整的物理世界,可它至少说明,交互式生成正在从看演示感觉不错,逐渐走向可以重复测试、量化比较的阶段
给同行一句话:过去验收一个叙事产品,标准可能是”做完了没有”,以后还要问一句”它连续跑 200 轮以后,还像不像同一个世界”
这个标准会很快暴露那些只能完成一次性演示、却无法长期运行的方案
如果现在就要立项,我会先干什么
写到这里,我猜已经有人在心里盘算:那我到底该不该现在动手
我的看法是可以动,可别从技术选型开始动
我会先花一周时间,把自己想做的东西压到一句话:用户为什么要回来。是因为这个世界里存着他攒了三十天的东西,是因为有个角色记得他,还是因为每天回来剧情都会发生新的变化。这三个理由指向三种完全不同的产品,成本结构也差得很远
接着我会做一个极小的验证,小到丑都无所谓。挑一个五分钟能玩完的场景,把混合模式先跑通,预置分支保证体验下限,实时生成负责制造惊喜,之后只看一个很简单的动作:用户愿不愿意主动输入一句话,而不是始终只点选项
主动输入是整件事非常重要的分水岭。用户肯打字、肯说话,至少说明他开始相信这个世界可能接得住他。如果绝大多数用户始终只愿意点选项,不愿意主动输入,那至少说明开放意图还没有真正成为这个产品的核心价值
最后才是算账。别只问一次视频生成多少钱,真正应该问的是,一个用户玩三十分钟要烧掉多少钱,再把这个数跟分成、广告收入或者付费收入放在一起看。前面那条账,值得每个立项的人自己算一遍,别听别人说
这三步都不需要一开始就拥有多强的技术能力,需要的是先把问题想清楚。而想清楚这件事,从来都比工具跑得慢
三道锁解开,不等于故事变好了
供给锁开始松动,内容量不再完全由人力决定。交互锁开始松动,用户的意图不必永远被压缩成几个选项。状态锁开始松动,用户做过的事情开始有机会继续成为世界的一部分
三者叠加以后,叙事产品第一次有可能从交付一个成品,变成交付一个持续运行的系统
可它不会自动带来一个结果:故事变好看
三道锁解决的是能不能做出来、能不能玩得更自由、能不能让影响持续存在,它们不等于解决好不好看
我看到一位十九岁的独立开发者讲自己做 AI 社交游戏时,说了一句话,我一直记着:”AI 省掉的是体力活,不是判断力,这就是我变忙的原因”
同一个观察在这个行业里反复出现。制作门槛不再是最大的壁垒以后,差异化竞争力从哪来,就会重新成为核心问题
所以我的结论只有一句:能力解锁之后,竞争会重新回到产品判断力本身。当所有人都能做的时候,做什么和为谁做,重新变成最稀缺的能力。AI 能越来越多地接管生产执行,可它替代不了审美和判断
写到这里,我又想起当年本子上那张分支图。画了满满一页,真正管用的节点数得过来。那时候能琢磨的只有那几个岔口,现在能琢磨的是一整个世界
AI 没有让故事变好,它只是让故事不再必须在写完的地方结束
本文由 @特意安 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自作者提供
- 目前还没评论,等你发挥!

起点课堂会员权益



