从 Sora 退场到实时交互,AI视频产品如何走向真实场景

2 评论 338 浏览 0 收藏 23 分钟

AI视频产品的竞争,已经从“能不能生成”转向“能不能持续创造价值”。本文以 Sora 的商业化困境为切口,讨论质量与成本、能力与需求、通用与行业三组矛盾,并结合广告、电商、短剧、实时交互和世界模型等实践,梳理 AI视频产品走向可控、可用、可落地的路径。

在 2026 AI产品大会现场,Vidu企业服务副总裁王川围绕“能生成视频到能创造价值”分享了对 AI视频产品的观察与实践。他从 Sora 的退场谈起,分析技术质量、推理成本、用户需求和商业模式之间的关系,并结合 Vidu 在广告、电商、短剧、直播和实时交互等场景中的探索,讨论 AI视频如何从一次性的炫技能力,走向可持续的产品价值。

以下内容根据现场音频和演示材料整理,Enjoy:

 

一、技术领先,不等于商业成功

大家好,我来自生数科技,主要负责基础模型的产品化,包括商业化。今天我想分享一些对行业的观察,也分享我们在商业化上的实践。

我们已经看到很多模型展示出非常强的能力,但模型最后能不能带来商业化收入,正在成为越来越重要的判断标准。现在资本和市场看一个模型,不只看它能做什么,也看它能不能落地、能不能形成规模化收入。

我想先从 Sora 讲起。

Sora 预告时曾经给行业带来很强的冲击,正式上线后也获得了大量关注,但它后续的产品表现提醒我们,技术标杆并不自动等于商业成功。视频模型的推理成本远高于文字模型,产品如果不能把成本、用户留存和付费意愿放在同一个模型里考虑,技术能力越强,商业压力可能越大。

视频和文本还有一个根本差异:用户得到一个文本答案,通常很快就能判断有没有用;生成一段视频需要更多算力和等待时间,结果却可能因为人物、动作或镜头不符合预期而直接作废。用户为失败结果付出的不只是费用,还有时间和创作机会。因此,视频产品的“成功一次”不能只按技术上生成完成来计算,还要看它是不是进入了用户真正要交付的内容。

我把 Sora 的案例归纳为一个产品命题:算力成本是产品约束的一等公民,不是工程团队最后才处理的细节。

二、AI视频产品的三重矛盾

今天的 AI视频行业至少有三组核心矛盾。

第一组是质量和成本。高画质不等于低成本。视频生成一次需要消耗大量推理资源,用户愿意支付的价格却不会因为模型更复杂就自动提高。模型公司需要找到生成成本和用户付费意愿之间的平衡点。我们在实际做产品时,也一直把生成速度和推理成本作为重要指标,因为它们会直接影响用户是否愿意把产品放进真实工作流。

第二组是能力和需求。模型能生成,不代表用户有持续需求。用户通常不需要更长的视频,而是需要可用的视频:结果可控、可以调整、能够复用,并且能进入后续的剪辑、投放或交付流程。Sora 的用户曲线就是一个提醒,新奇感可以带来一轮获客,但新奇感不是留存引擎。真正能让用户留下来的,是可控性、一致性和场景闭环。

第三组是通用和行业。通用模型覆盖面广,但未必在某个行业里足够深;行业模型更贴近场景,却需要更高的开发和服务成本。模型最终要从“有功能”走到“能商用”,就必须理解行业的真实流程和 ROI,而不是只展示模型本身的能力。

这三组矛盾并不是三个独立的产品问题。

  1. 为了提高画质,团队可能增加模型规模和推理步数,成本随之上升;
  2. 为了降低成本,产品又可能牺牲分辨率、时长或生成稳定性;
  3. 为了做深一个场景,还要补上行业数据、编辑工具和交付服务。

产品经理不能只拿其中一个指标做局部优化,而要找到一组用户愿意持续买单的平衡。

这三组矛盾最后会汇聚到同一个问题:没有商业模式的炫技,最终会退场。

无论是创业公司寻求融资,还是成熟公司开发新产品,都需要更早地回答收入从哪里来、用户为什么持续使用,以及产品怎样在成本约束下扩大规模。对产品经理来说,从 Day 1 就要考虑商业模式,尽早验证 PMF,同时持续降本增效。这个判断不是说技术不重要,而是说技术必须进入价值和成本的共同约束中。

三、能活下来的产品,需要四种能力

从产品经理视角看,我认为 AI视频产品要活下来,至少要同时具备四种能力。

第一是可控性。特别是在 B 端,用户愿意购买的不是随机盲盒,而是可预期、可调整、可复用的生成能力。我们过去在参考生视频等方向上做过探索,就是希望让人物、动作和场景更容易被控制。可控性还意味着减少幻觉、减少触发失败,让用户知道怎样输入才能得到稳定结果。

第二是成本效率。每次生成的成本必须低于用户愿意支付的价格,这是一条商业可行性的底线。成本效率并不只是把某个模型的单次推理做得更快,也包括计费方式、调用方式和整个交付链路的效率。只有当模型成本真正进入产品设计,商业化才不是上线之后再补的模块。

第三是场景闭环。一个深耕场景的解决方案,往往比十个泛泛的通用功能更有价值。我们在娱乐、广告、电商和短剧等方向做的事情,都是把生成能力放到具体流程里:从输入素材,到生成内容,再到修改、剪辑、投放或交付。用户购买的不是一个孤立按钮,而是一条能完成任务的工作流。

第四是一致性。角色、场景、镜头和风格跨画面保持稳定,是内容生产的基本要求,不是额外的美学加分项。如果人物的服化道每一帧都变化,场景空间关系不连贯,光影和运镜无法保持,生成结果就很难进入商业内容生产。

围绕这些能力,模型公司和行业工具也会形成新的分工。模型早期刚出现时,模型公司往往要亲自教育市场、寻找用法,甚至深入客户的生产流程,才能知道能力究竟卡在哪里。随着场景逐渐成熟,短剧、漫剧、广告等行业工具会承担更深的产品化工作,把模型包装成导演视角、剧本拆解、镜头组织和后期编辑等具体能力。模型、工具和内容生产者不是谁替代谁,而是在成熟度不同的阶段重新分工。

所以,AI产品的生死线不在于能做什么,而在于能创造什么价值。可控性、成本效率、场景闭环和一致性,正是把模型能力翻译成用户价值的四个接口。

四、从模型能力走向真实场景

模型能力要产生价值,必须和用户消费的场景结合起来。我们在直播中尝试过实时生成的特效礼物,通过延时和系统介入,把视频生成放进直播互动中。用户不是为了看模型生成本身,而是为了让直播内容更有互动性。

在广告和电商场景里,用户可以上传产品图片、产品链接或几张参考图,再用简单的提示生成广告内容。比如把产品的外观、颜色和功能特点交给模型,快速生成不同风格的广告素材。这样做的价值在于,广告团队可以更快测试不同用户标签、不同创意方向和不同投放素材,而不是每一次都从传统制作流程开始。

这个流程的关键,是把用户手上的资产真正用起来。电商客户通常已经有商品图、详情页、卖点说明和历史投放素材,问题不是从零生成一段“看起来像广告”的视频,而是让新视频仍然像自己的产品。模型需要识别商品主体、保留外观和颜色,再围绕卖点组织动作、背景和镜头。只有产品一致性足够好,生成速度的优势才会变成可以投放的素材供给。

我们也在做广告复刻。用户可以把一个热门广告作为参考,再把自己的产品素材放进去,通过视觉分析、提示优化、视频生成和后续剪辑,把原有内容的风格、动作或镜头逻辑迁移到新产品上。它不是简单地复制一条视频,而是把内容理解、生成、剪辑和投放前测试串成一条工作流。

现场演示里,系统先把参考视频的风格和动作拆出来,再替换成新的产品或人物,最后补上需要的文字贴片。对广告团队来说,这种能力不是为了抄一条片子,而是减少拆解热门创意、重新组织拍摄和制作版本的成本。当然,参考内容涉及版权和创意边界,产品仍然要建立合规的使用规则;效率提高并不等于原有权利关系消失。

短剧也是类似的场景。现在模型可以从剧本理解出发,生成较长的内容,完成运镜、切镜和多镜头组织。对于批量生产、海外投流和不同版本测试,这种能力能够降低内容试错成本。但精品短剧仍然需要专业人员逐镜头修改,AI 生成并不意味着制作环节完全消失。

我们做过面向短剧的模型和 Agent。用户给出两个人物的图片和剧本,模型可以组织正反打、动作增强、不同运镜和切镜,一次生成十几秒的段落。按一分钟左右的一集计算,多个片段可以继续组合成一集;更长的剧本也可以先由脚本理解能力拆解,再通过接口完成多段生成和合成。这里的价值,是让批量内容、解说剧或跑量素材更快完成第一版,而不是宣称一键替代所有创作者。

真人、动漫和仙侠等不同短剧,对人物一致性、动作和镜头语言的要求也不同。专业团队仍然会逐个镜头修改,研究每个模型的边界,再把不同模型接进自己的流程。出海也不是给国内成片换一种语言那么简单,剧本节奏、文化语境和投放方式都需要重新组织。模型能降低重构成本,但不能替代对海外受众的理解。

这些实践说明,行业落地不是把模型接到一个页面上就结束了。模型公司需要理解客户的流程,和第三方产品、工具、工作流一起完成交付。模型越早期,模型公司越需要承担行业教育和场景落地;当行业逐渐成熟,工具和生态才会接过更多具体工作。

五、从离线生成到实时交互

视频生成产品正在经历一个明显的阶段变化。早期的工作方式是输入提示词、等待生成、播放结果,生成内容是单向且固定的。Sora、早期 Vidu、可灵和 Runway 等产品,都属于这一阶段的代表。用户通常得到 5 到 15 秒的片段,并且要等待一段时间才能看到结果。

下一阶段是实时交互。用户持续输入语音或动作,模型逐帧生成内容并持续播放,视频从观看对象变成互动媒介。我们在实时生成模型上的探索,就是希望让模型能够实时响应、控制角色行为,并支持更长时间的连续交互。

离线生成时,用户先输入提示词、图片或参考内容,然后等待五秒、十秒或十五秒的片段生成;实时模型则要在互动发生的同时不断续写画面。角色不只接收一句指令,还要看到用户的表情和动作,结合语言和人设做出回应。内容也不再预先全部准备好,而是在交互中持续产生。这对延迟、分辨率和连续稳定性提出了完全不同的要求,现阶段的能力和成熟离线视频仍有差距,不能混为一谈。

这会带来新的产品形态。AI 陪伴、互动影游、智能客服、课程培训、电商直播数字人和文化知识讲解,都可以把实时生成放进原有产品中。用户可以和角色交流,角色可以根据语音、表情和动作做出反应,服务也不再只是单向播报。

我们把这类模型看作从生成内容走向生成关系。以前产品的基本单位是一段视频,现在产品的基本单位可能是一段持续发生的互动。它对模型的实时性、可控性和一致性提出了更高要求,也会推动更多新的产品形态出现。

比如:

  • 陪伴产品里,角色可以记住用户偏好,根据当下对话生成动作;
  • 互动影游里,用户看完剧情后可以继续和角色交流,甚至共同演绎新的段落;
  • 智能客服也可能从文字、实时数字人到真人客服形成不同服务层级。
  • 课程培训、电商直播和博物馆讲解同样可以接入知识库,让角色在特定领域里即时回应。

再往后,视频模型还可能从生成视觉内容走向生成行动。现实中的大量视频既能训练模型理解画面,也包含人如何操作物体、完成任务的信息;具身智能则需要把这种理解转化成对不同机器人本体的控制。未来机器人不一定都是人形,工业设备、履带式设备和其他形态都可能需要一套能够理解任务、生成行动的模型。我们把这个方向称为世界动作模型,它仍处在探索阶段,但它把视频产品的边界从数字世界延伸到了物理世界。

六、产品经理要从提需求的人变成解决问题的人

当模型能力越来越强,产品经理的工作方式也会变化。过去的流程是提需求、追需求、等待开发、验收上线;现在更接近描述需求、让 AI 生成、快速验证和持续迭代。产品经理不一定要亲自完成所有工程实现,但必须更懂用户、更会表达,也更能把想法落到可验证的结果上。

我把这种能力概括为全栈产品经理:懂用户、会表达、能落地。你有想法,AI 可以帮助你在几分钟内验证创意;你了解研发场景,AI 可以帮助你搭建原型;你知道用户痛点,AI 可以帮助你用更低成本解决问题。

“全栈”不等于一个人把所有专业岗位都做掉,而是产品经理不能停在写需求和追排期。模型变化很快,最有价值的工作是敏锐发现用户问题,理解能力边界,快速做出可以验证的解决方案。尤其在短剧等快速变化的行业,成熟团队已经会安排专人持续研究模型:哪个模型擅长人物一致性,哪个适合运镜,哪一步必须人工修改。只有把这些边界研究清楚,产品设计才不会建立在一次偶然的演示上。

模型厂商也要承担产品落地的责任。单一模型很难端到端服务用户,实际项目往往需要视觉语言模型、语言模型、视频模型、剪辑工具以及 MCP 等能力配合。团队需要知道什么时候使用 Agent,什么时候使用 API,什么时候把 Workflow 和 AI 结合起来。真正成熟的落地团队,通常会专门研究模型边界,而不是只研究某个按钮怎么用。

这也是为什么我强调解决问题,而不是追逐某一种技术名词。稳定、明确、重复发生的环节,可能更适合 API 和工作流;需要理解开放任务、动态调用工具的部分,才适合交给 Agent;镜头生成之后,剪辑和审核仍可能需要专业工具和人工。把不同能力放在它们最合适的位置,端到端结果才会稳定,用户也不必为不必要的模型调用承担成本。

从生态角度看,模型公司早期要深入行业,帮助客户找到适合的场景;工具公司和行业团队成熟后,再把模型能力包装成更具体的产品。模型、产品、工作流和行业知识结合起来,才可能形成持续的商业价值。

结语:比谁更逼真,更重要的是比谁创造价值

世界模型还要继续理解物理世界,视频模型也会从内容生成走向行动生成。我们正在看到视频数据、交互数据和机器人数据之间产生更多连接,模型未来不只要生成画面,还要帮助不同主体完成行动。

对产品和商业来说,最重要的判断仍然要从第一天开始:收入在哪里,用户定位在哪里,自己是在做工程、基础设施、产品还是社区,以及在 AI 生态里究竟能解决什么问题。

中国的 AI视频模型正在持续迭代,行业竞争也不会只停留在谁生成得更逼真。更重要的是,谁能把模型和用户需求、行业流程、产品生态连接起来,谁能创造出真实而持续的价值。

生数科技为“人人都是产品经理”读者提供1000积分算力(AI视频/数字人体验)。链接:https://platform.vidu.cn/retention?utm_source=rr

相关阅读:

影智科技唐沐:从人形概念到咖啡机器人,具身智能如何跨过商业化鸿沟

https://www.woshipm.com/it/6453574.html

小度AI智能孙浩:从能力涌现到产品成立,大模型硬件的四道门槛

https://www.woshipm.com/ai/6453494.html

京东物流李亚曼:当AI进入物流全链路,产品经理要重新定义自己的价值

https://www.woshipm.com/ai/6455237.html

声网姚光华:企业级Agent的关键,不是自治,而是可控的结果生意

https://www.woshipm.com/ai/6453622.html

千问办公余航:AI 真正有用,不是会得多,而是能把事情办成

https://www.woshipm.com/ai/6452306.html

分享嘉宾:王川,Vidu企业服务副总裁

本文基于@王川 在2026AI产品大会上的演讲进行整理,未经许可,禁止转载。

题图来自大会现场照片

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 放到电商场景里,商品图、详情页、卖点说明都是现成资产,模型要做的不是从零生成视频,而是把已有信息转成可投放素材。颜色不能偏、包装不能歪、产品特征得一眼认得出来,才敢拿去过审投放。这比生成酷炫大片重要得多。

    来自广东 回复
  2. 场景闭环这个点说得尤其准确。AI视频要真正进入广告公司或电商团队的工作流,光是一个生成按钮是不够的,得把素材输入、内容生成、修改剪辑、投放测试全串起来。用户不是买模型,是买一条能完成任务的流水线。所以模型公司早期深入客户生产流程,几乎是必经之路,后面才能交给工具和生态。

    来自广东 回复