ZPedia|视频正在从文件变成界面,Vidu S2 把 AI 视频推向实时交互

0 评论 303 浏览 0 收藏 21 分钟

视频长期是一段确定的时间线,即使生成式 AI 也只改变了生产方式。生数科技的 Vidu S2 把编辑带进实时生成:一边是 S2-Avatar 持续接收新指令,一边是 S2-Editing 直接改写正在输入的视频流,视频第一次能在运行中被改写。

过去很长一段时间,视频都是一种单向媒介。

电影、短视频、广告、直播回放,无论内容以什么方式生产,用户最终面对的都是一条已经确定的时间线:点开、播放、观看。你可以暂停、快进或者退出,却很难真正改变接下来会发生什么。

即使是生成式 AI,也只不过改变了视频的生产方式,这种静态的观看关系依然没有发生根本变化。当视频被生成出来,它依然是一段已经确定的内容——模型负责生产,用户负责观看

实时视频想改变的,正是这层关系。

视频会随着用户的输入持续“发生”:一句话、一个动作、一张新图片,都可能实时改变接下来的画面。用户面对的不再是一段已经生成好的内容,而是一个仍在运行、仍然可以被影响的视觉界面。

它开始更接近游戏、直播或视频通话:用户直接和视频发生互动。

围绕这种变化,行业已经出现了不同方向的探索。

Google DeepMind 于 2025 年发布的 Genie 3 可以每秒 20 至 24 帧生成可实时探索的世界——用户改变行动,后续环境也随之变化。Runway 推出的 Aleph 则把人物、物体、背景、视角和光照纳入语义编辑范围,试图用自然语言取代部分传统后期流程。一条让生成结果持续运行,一条让既有视频更容易被改变。

Genie 3 官方演示:可实时探索的生成世界(来源:Google DeepMind 官网)

数字人公司则更早在企业市场中验证了另一件事:视频不仅可以是一段内容,也可以成为一种软件服务。

HeyGen 的实时数字人开始支持低延迟音视频互动,公司于 2026 年披露 ARR 超过 2 亿美元。Synthesia 从企业培训、内部沟通和多语种视频切入,2025 年 ARR 超过 1 亿美元,又继续开发能够实时问答和角色扮演的 Video Agents。企业购买的已不只是几段数字人口播,而是一套可以持续生产和交互的视频工具。

这些方向背后是同一种变化:视频正在从一次性生成的内容,变成能够读取状态、接受新指令并持续变化的系统。模型竞争的边界,也开始从“生成得像不像”,转向“生成之后还能做什么”。

生数科技的 Vidu S 可以被看作这条路线的一次具体落地。它不只是生成质量或模型性能上的一次升级,而是在尝试改变视频的生产和使用方式:从制作一段视频,走向运行一个可以持续交互、持续变化的视频系统。作为该系列的最新迭代,Vidu S2 让这一视频系统有了更完整的产品形态。

01 双模齐发:从 “ 实时回应 ” 走向 “ 实时可改 ”

Vidu S1 已经完成了第一步:让数字人从“播放内容”走向“实时回应”。

用户可以持续输入语音或文字指令,模型根据新的信息生成后续画面。比心、眨眼、打招呼、扎头发等动作,都可以在互动过程中被实时触发。数字人不再只是播放一段提前制作好的视频,而开始具备持续响应用户的能力。

但“能够回应”,还不等于“能够被改变”。

如果数字人的形象、服装、商品和场景都必须在开播前确定,那么即使它可以持续说话和做动作,本质上仍然更接近一套具备交互能力的预设内容。

因此,S1 解决的更多是视频如何持续生成、持续响应的问题。接下来的问题则是:当生成已经开始,用户还能不能继续修改正在发生的画面?

Vidu 给出的答案来得很快。

S1 发布仅 69 天后,Vidu S2 完成新一轮迭代。这一次,它不只是继续提升实时交互能力,而是进一步把“编辑”带进了持续生成过程。

一边是S2-Avatar,让数字角色在互动过程中继续接收新的指令和视觉参考,改变动作、服装和所使用的物品;另一边是S2-Editing,直接对正在输入的视频流进行角色替换、虚拟换衣、风格渲染和背景替换。

从实时生成,到实时编辑,视频第一次可以在“运行中”被持续改写。与此同时,Vidu S2 还开始向实时空间视频等更前沿的形态延伸:

S2-Avatar :从 “ 会说话 ” 到 “ 会表演 ”

S2-Avatar 将实时输出从 S1 的 540P 提升至 720P,同时强化了动作指令的执行能力。更关键的一点,是它开始支持在生成过程中继续加入新的参考图

直播已经开始之后,用户仍然可以临时给数字人一张新的商品图、一套衣服,或者其他视觉参考,让角色在后续画面中拿起商品、完成换装,再继续互动。

过去很多生成条件必须在 Session 开始之前锁定,现在则可以在运行过程中持续加入。它改变的不只是数字人的画质,而是数字人的工作方式。

过去的数字人更像一个“会说话的虚拟主播”,S2-Avatar 想要做的,则是一个能够根据现场信息继续行动的角色。从“回答问题”,进一步走向“完成表演”。

S2-Editing :把后期编辑带进视频流

S2-Editing 面向实时视频编辑,支持在视频持续播放或直播过程中,对画面进行角色替换、虚拟换衣、风格渲染和背景替换等操作。

用户可以直接打开摄像头进行实时编辑,也可以上传已有视频,让修改发生在视频流运行的过程中,而不是等视频生成完成后再进入后期处理。

这和传统视频编辑有明显不同。

传统后期面对的是已经完成的素材,可以读取前后帧并反复计算修改结果;实时编辑则要求模型一边接收新画面,一边完成语义修改,同时还要保证人物动作自然衔接、角色身份保持稳定,并尽量不影响未被修改的区域。

因此,S2-Editing 解决的不只是“能不能改视频”,而是能不能在视频正在发生的时候改视频

两条产品线由此形成清晰分工:S2-Avatar 负责实时互动与表演,S2-Editing 负责实时改写画面。

它们最终指向的是同一个方向:让视频不再只是生成完成后交付的一段内容,而是在生产和运行过程中,始终保持可交互、可修改、可控制。

从平面视频,再往空间里走一步

除了 Avatar 和 Editing,Vidu S2 还做了一项更前沿的尝试:空间视频。

通过生成同步的左右眼视图并流式传输至 VR 头显,让人物、背景等元素的实时变化从二维画面进入具有景深和空间关系的视觉环境。

这还远不是成熟商业产品,却值得关注。因为视频一旦能够实时生成、实时编辑,下一步自然会遇到一个问题:这些能力是否只能发生在一块二维屏幕里?

这条路线的前瞻性正在变得更加明显。近期字节跳动也被曝正在布局实时空间视频生成,空间视频正逐渐成为视频模型新的技术分支,并开始与 VR、空间计算和交互式虚拟世界发生交集。

这也让 Vidu S2 的意义不再局限于数字人。它所触碰的边界,已经开始与实时世界模型、沉浸式交互和下一代内容渲染系统发生重叠。

02 实时视频最难的不是生成,而是在变化中保持连续

相比离线视频,实时视频真正困难的地方,是没有“重来一次”的空间。离线模型可以在一个完整时间区间内推演结果,实时模型却只能根据已经发生的内容,不断决定下一帧应该是什么。

与此同时,新指令还可能随时进入。用户上一秒让角色打招呼,下一秒可能要求它转身,再过几秒又上传一件新商品,让角色拿起来展示。

模型既要足够快,又必须知道上一条动作有没有结束、新条件应该从什么时候开始生效,以及哪些画面可以改变、哪些不能改变。

这也是 Vidu S2 技术设计主要解决的问题。

Vidu S2 由朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责全链路研发。他是 Vidu S 系列的负责人,从 S1 到 S2,团队持续围绕流式生成、推理加速与实时交互推进迭代。

首先是主干网络(Backbone)与精炼网络(Refiner)的双阶段架构。前者在低分辨率下负责结构、语义和动作走势,后者异步生成纹理与面容细节,两条流水线并发,在提升画质的同时避免细节生成拖慢实时推理。

其次,S2 重新设计了模型中的位置编码,让新加入的参考图与当前推流时刻对齐。商品、服装等条件可以在生成过程中持续加入,并从当前时刻开始影响后续画面,而不会干扰此前已经生成的内容。

为了协调连续动作,系统还引入轻量化 VLM Agent,持续判断画面中的人物状态和动作进度,在上一轮动作结束后再执行下一条指令,减少动作抢跑和肢体穿模。

最后,S2 还将强化学习直接应用于最终部署的少步因果模型,进一步提升生成的画面质量以及指令遵循的能力。

从双阶段架构、动态条件注入,到 VLM Agent 和强化学习,这套设计解决的其实是同一个问题:当视频不断接受外部指令时,如何同时维持实时性、可控性和连续性。

03 S2 不只是一门视频生成生意

评估实时视频的商业价值,更务实的尺度,是看它正在进入哪些已有明确预算的成熟工作流。

数字人已经先在企业培训、出海营销等场景完成了一轮商业验证。过去几年,HeyGen、Synthesia 等公司已经证明,企业愿意长期为营销视频、企业培训、本地化和视频自动化付费。

实时能力打开的是另一种需求。

例如直播电商。传统数字人直播往往依赖预设好的 SKU、动作和脚本。一旦商品临时调整、促销机制改变,可能就需要换模板,甚至重新制作内容。

如果新的商品素材可以在 Session 中直接加入,服装、背景甚至视觉风格也可以随时修改,数字人才开始真正具备部分“临场反应”。

再延伸到智能客服、销售线索转化与虚拟陪伴,衡量系统价值的指标也会发生变化。当数字人不仅能口播回复,还能理解视觉上下文、调度动作并展示对应商品,客户关注的就不再只是“像不像真人”,而会进一步转向响应时延、任务完成率和最终转化。

更长期的想象力落在互动娱乐与原生虚拟世界。如果角色、光影与场景都能在运行过程中被连续改写,实时编辑最终处理的就不只是一个数字人,而可能是一个随用户操作持续变化的视觉环境。当然,这仍然受制于推理成本、并发能力和系统稳定性。

商业模式将随之发生质变。过去生成一条视频,价值主要还是卖“成片”,按分钟数或条数计费;实时视频则更接近云服务,按会话时长、并发路数与 API 调用结算。模型公司将不再只交付一个静态文件,而需要出租一段可持续运转、吞吐新指令的时间。这拓宽了营收天花板,但也把利润空间扣在了每小时的推流算力成本与系统稳定性上。

04 资本开始为视频的下一阶段下注

技术路线发生变化时,资本往往会提前寻找下一阶段的增长空间。

2026 年开年,海外视频模型与虚拟人赛道接连开出巨额支票。1 月,Synthesia 敲定 2 亿美元 E 轮融资,估值攀升至 40 亿美元,并进一步向企业级视频 Agent 平台延伸;2 月,Runway 完成 3.15 亿美元融资,投后估值推高至 53 亿美元,资金明确投向世界模型与实时流式视频;更早前,专注双工实时交互界面的 Tavus 也完成了 4000 万美元 B 轮融资。

密集的筹码背后,是两层不同的判断。

第一层已经被财务数据验证。

HeyGen 与 Synthesia 踩通了高毛利的 SaaS 闭环:用相对确定的软件成本,替代昂贵的外模、场地和逐帧非编剪辑。当 HeyGen 的 ARR 在 2026 年突破 2 亿美元,至少说明企业客户已经愿意持续为跨语种营销、企业培训和视频自动化买单。

而资本正在下注的第二层,是视频还能不能从一种“内容生产工具”,继续变成一种“实时交互系统”。

过去两年,视频模型已经跨过清晰度与运动连贯性的门槛,但商业形态仍然没有真正跳出“输入提示词、等待交付”的单向流程。用户提交一次需求,模型生成一段视频,这次服务基本也随之结束。

这套模式适合内容生产,却很难直接咬合进直播、客服、游戏等实时业务。一段一旦开始渲染就无法干预的视频,本质上仍然是一份静态结果,而不是生产系统中的一环。

真正的变化发生在控制权被重新放回推流进程之后。

当视频能够维持内部状态,在持续生成过程中接收新的文字、语音、图片甚至视频输入,并根据用户指令实时改变后续内容,它的属性才开始发生变化:从一次性交付的内容结果,变成一个可以被持续调用、持续干预的动态系统。

这也是视频模型真正告别“抽卡”的关键一步。

Vidu S2 正是这种转向下的一个切片。它未必代表实时视频的最终形态,但至少标出了一个明确方向:实时交互不再只是视频模型里的一项能力,而开始被封装成可以实际使用的产品。

一旦这条路线成立,商业模式也会随之变化。

离线视频生成出售的是一次“交付”,通常按照条数、时长或生成量计费;实时视频出售的则更像一段持续在线的“连接”,收费单位可能逐渐转向 Session 时长、并发路数和 API 调用量。

前者的价值在视频生成完成时基本结束,后者则可能随着用户停留时间和交互深度不断增加。模型在线得越久,也就越容易嵌入客户真实的业务流程。

这也是为什么实时视频的想象空间会延伸到直播推流、实时客服、动态 NPC,甚至云游戏底层渲染——这些场景需要的都不是提前生成好的一段视频,而是一个能够持续接收输入、理解状态并给出视觉反馈的系统。

但这门生意也明显更难。

离线生成慢十几秒,影响的主要是等待时间;实时交互多出几百毫秒,体验就可能明显下降。与此同时,视频流需要持续占用 GPU 资源,画质、延迟、并发与成本之间始终存在工程上的取舍。

因此,当行业真正从 Demo 走向规模化部署,最终被核验的指标也会越来越具体:单小时推理成本能不能持续下降,并发规模能不能做上去,系统能不能长时间稳定运行,以及模型能否在持续交互中维持角色、场景和状态的一致性。

资本正在把更多筹码放到这里。

它所押注的已经不只是下一款画质更高、时长更长的视频生成模型,而是一个更大的命题:

当视频从“内容产物”变成“交互软件”,AI 视频的市场边界还能向外延伸多远。

体验地址:https://vidu.cn/vidu-stream

API 平台: http://platform.vidu.cn/vidu-stream/doc

技术报告:https://arxiv.org/pdf/2609.11638

作者:Z Finance 公众号:Z Finance

本文由 @Z Finance 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自 Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!