体验 PixVerse R2:世界模型的产品流程已经变了
PixVerse R2 将 AI 视频生成从“提交任务”推向“实时交互”,但十几秒的响应延迟让用户陷入等待与操作的模糊地带。本文从产品体验视角出发,探讨世界模型下反馈机制、状态记忆与用户控制感的设计挑战,为生成式产品的交互设计提供新思路。

PixVerse R2:实时世界模型生成的世界,你可以实时走入、操控、并通过自然语言实时改变画面和剧情。我体验了一下,点开 PixVerse R2 的一个世界,等了大概7-8秒,画面出现。然后按下方向键,角色没有立刻跟上,画面也没有按照我的点击改变。我一时不知道是网络卡了还是我的操作有误,还是模型仍在生成。后来我又输入一句话,想让眼前的世界发生变化,又等了大约十几秒。
因为我没有计时,所以这组时间只代表普通用户的体感,不能作为性能测试数据。可是我觉得产品体验往往就从这种不够严谨的感觉开始。普通用户是不会打开监控工具的,他只会按下一次之后再按一次,然后怀疑刚才那次到底算不算。

其实十几秒是个很微妙的长度吧。用 AI 生成视频,十几秒已经挺快,提示词提交以后,我可以切去看消息,过一会儿再回来收结果。可是当我进入一个号称可以实时交互的世界,这段时间体感被拉长了。手还放在键盘上,眼睛盯着画面,系统没有告诉我下一步该等,还是该继续操作。世界模型把用户放进生成过程以后,我们熟悉的产品流程还够用吗?


十几秒体感变长了
在过去几年,AI 视频工具已经教会用户一套固定动作。写提示词,选比例和时长,点击生成。模型在后台工作,视频完成以后,用户回来检查,结果不满意就改几个词,重新跑一遍。这套流程很好理解,因为交付物是一段视频,它有明确的开头和结尾,生成过程中也没有多少事情留给用户。等待虽然烦,至少不妨碍操作。就像小学摊煎饼的问题一样可以进行时间管理。
PixVerse 对 R2 的描述换了一个前提。模型持续生成视听内容,这样用户可以在运行过程中继续加入文字与参考素材,也可以通过声音和动作影响接下来发生的事。早先的输入会留在当前状态里,继续影响角色和环境。交付物由此从一段固定视频变成一次仍在继续的会话。变化落到产品里,就没有技术介绍中那么轻巧了。视频工具只要告诉用户作品是否完成,世界模型还得随时交代用户身处何处,上一项操作有没有生效,世界因此改了什么。模型每往前生成一点,产品都要把这一点接回用户正在经历的事情里。
等待的含义也跟着变了。等待一段视频时,我和系统暂时各忙各的;进入世界后,我已经开始行动,系统如果迟迟不回应,就像按下电梯按钮却看不到指示灯。电梯或许正在下来,可人还是会再按两下。技术报告里的实时,通常指模型持续运行,并且能在输出途中接收输入。用户感受到的实时更朴素,按下一个键,很快知道系统收到了;交给它一件复杂的事,也能看见事情正在往前走。
R2 当前的公开产品很能说明这种差别。首页先摆出世界、故事和角色,画廊里可以看预览和评论,也能分享或下载。用户看到感兴趣的内容,再点击 Explore 进入体验。前半段仍像一个内容平台,进去以后,用户的身份开始变化。他刚才还在看别人做的东西,转眼就要控制角色、下达指令。某句话改变了剧情,他也参与了创作。等这段经历被保存或分享,其他人可能又从这里接着走。
创作和消费由此挨得很近。创建者搭起初始环境,参与者用行动补出后面的内容。对产品经理来说,中间多出来的这段体验会直接影响留存。用户进入以后会不会动,第一次尝试能不能成功,他能否看懂世界的反馈,都比“点进来了”更要紧。首个动作如果要等十几秒,产品就得解释这十几秒。解释缺席时,用户很容易把等待当成卡顿,把生成中的不确定当成失败。

用户进来了,产品要接住他
很多生成式产品,像即梦等,喜欢把输入框摆在页面中央。用户负责描述,模型负责把描述变成结果。做图片和视频时,这个设计很顺手,因为用户提交的是一项任务。实时世界里的操作却有不同节奏。移动、转向和镜头变化需要迅速回应,它们决定用户有没有控制感。完整画面暂时跟不上,产品也可以先给一个轻量反馈,比如镜头开始偏转,角色先迈出动作,或者界面明确显示按键已经收到。反馈不用漂亮,先让人知道这一下没有白按。
改变天气、加入角色或调整故事方向,可以多花一些时间,用户通常也能理解这类指令更复杂。麻烦出在等待期间。系统听懂了吗?变化从哪里开始?我继续移动会不会打断它?这些问题如果都没有答案,输入框就像一张递进去后再无回音的纸条。我体验 R2 时,文字输入后的十几秒正是这种感觉。加载图标只能说明“还没好”,没法解释世界正在怎样变化。
或许可以把反馈放进世界里。天气正在改变,天空先出现一段过渡;一个角色正在靠近,远处先传来脚步或声音。界面也可以给出简短状态,告诉用户指令已经进入队列,眼下仍能继续探索。这些做法未必都适合 R2,我更想说明的是,模型速度只占一部分。模型赶不上用户时,产品需要安排这段空当。让人干等也是一种安排,只是通常不太好用。传统生成工具还能用进度条把过程盖过去,实时世界很难这么做,用户已经在里面了。每次弹出进度条把操作截断,所谓的连续体验很快就会碎成一小段一小段的生成任务。
响应解决眼前的问题,记忆决定用户会不会继续投入。PixVerse 的公开材料称,R2 会维护持续的世界状态,技术报告还提到多时间尺度记忆,让较早的输入继续影响后面的生成。这个方向很关键。用户愿意认真做选择,是因为他相信选择会留下后果。我召唤了一辆车,转身离开再回来,车还在吗?刚才和角色说过的话,下次见面还算数吗?故事已经被一次选择改变,走远以后会不会又悄悄绕回原处?
我这次没有继续测这些部分。变化能保持多久,返回旧地点后空间是否一致,退出以后能不能从原状态继续,目前都还是未知,文章写到这里也只能把它们留作问题。独立评测项目 WorldMark 的测试思路很实在。它会检查控制响应,也会让用户离开一个地点再返回,看看旧场景还能保留多少。人判断一个世界是否可信,大概也就是这样,转身走一圈,回来看看那栋房子还在不在。

模型记住状态以后,产品还要让用户看见这份记忆。发生过的重要事件放在哪里,角色关系有没有变化,本次体验退出后是否保存,都需要清楚说明。否则模型在内部记得再多,用户仍会把每次进入当成一段临时视频。R2 的公开页面目前也保留着这种过渡状态。它已经有可浏览的内容画廊,详情页保留预览、评论和探索入口,用户不用先学会创建世界,可以从别人做好的内容开始。到了创建页,页面又明确提示,当前创建功能仍由 PixVerse R1 提供,R2 即将上线。R2 的展示和探索已经走到台前,普通用户直接创建 R2 世界的完整流程还在补。
同行也在给出不同答案。Google 的 Genie 3 更强调描述环境和角色,随后进入生成空间探索。World Labs 的 Marble 把世界做成可以编辑、拼接和导出的三维资产。一个更靠近体验,一个更靠近创作工具。PixVerse 目前保留了内容社区的样子,让用户先看,再决定是否进去。
我挺认同这种降低门槛的办法,多数用户第一次面对“世界模型”,并不知道该写什么,先给他一个能进去的地方,比先给他一个空白输入框友好。不过用户一旦进去了,问题就会变得具体。这个世界允许做什么,操作有没有收到,离开以后还能不能回来,每一项都要给出答案。
我对 R2 的体验很不长,许多能力也没有完成验证。那十几秒仍然让我感受到了一个变化。以前做生成工具,产品经理常盯着输入和结果,用户写了什么,模型生成了什么,成品值不值得保存。实时世界把中间过程摊在用户面前,等待、误解和犹豫都发生在这里。
其实按下 W 键,我未必要求画面立刻变得完美。但是我至少希望先看到一点回应,知道系统收到了这个方向,也知道自己仍然在控制眼前的世界。这样对我来说,才是实时交互吧。
本文由 @海蛞蝓 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益




