Vidu S2实测,实时720p交互,边播边改,数字人赛道卷起来了。

0 评论 175 浏览 1 收藏 10 分钟

Vidu S2 上线当天网页版就全量开放,分实时交互与实时编辑两个模型。作者用虚拟偶像直播和带货感场景做了实测,边播边改、动作幅度很大时画面也没有崩,还特意试了网速不理想时的表现。

00 📋 待办事项/附件/Vidu S2实测,实时720p交互,边播边改,数字人赛道卷起来了。/img-01.png

Vidu 发了新的大招,Vidu S2 来了。论文是 9 月 10 号发的,产品是 9 月 15 号发布的。

上线当天网页版也全量开放,APP 和小程序也都上了,API 接口也放了,简单来说现在大家都可以直接体验。

00 📋 待办事项/附件/Vidu S2实测,实时720p交互,边播边改,数字人赛道卷起来了。/img-03.png

这次 Vidu S2 有两个模型,分为实时交互和实时编辑模型,P 视频那个感觉是真的有了,而且速度快效果好。

背景没崩,人物的边界也很清晰,融合程度很好,光影效果也有照顾到。哪怕换完装、动作很大,画面帧也没有乱跳,服装的细节也维持得很不错。

好接下来分开讲 Vidu S2 这两个模型。

S2-Avatar,实时交互

00 📋 待办事项/附件/Vidu S2实测,实时720p交互,边播边改,数字人赛道卷起来了。/img-04.png

用户可以通过语音与数字角色互动,并且它可以实时的语音交互以及实时的动作响应。 同时,在这个过程中也可以实时输入参考图,并让它根据指令与参考图里的人物或物品进行互动。

还可以保存这段角色交互的视频,以 720p 的分辨率高清输出。

平台有角色模板,也可以自己创建新角色。这里我创建了一个新角色。

00 📋 待办事项/附件/Vidu S2实测,实时720p交互,边播边改,数字人赛道卷起来了。/img-05.png
00 📋 待办事项/附件/Vidu S2实测,实时720p交互,边播边改,数字人赛道卷起来了。/img-06.png

这个测试一下虚拟偶像直播效果。

叠甲,我测试的时候人在酒店,网速有点慢,网速正常的情况下效果估计会更好。

大家前面也看到了,开局就只有一张正面图。

我这边开口,她就能很快给到反应,并且口型和节奏也是比较舒适的,除了前面的角色,背景也不是摆设,仔细看会发现背景也会随着人物的一些动作发生一些变化。

00 📋 待办事项/附件/Vidu S2实测,实时720p交互,边播边改,数字人赛道卷起来了。/img-07.gif

再试试有点带货感的,我手头也没个知识库什么的,简单设定这个角色,让他和我聊聊(带货)粤式早茶试试。

这里我还捣了一点小乱,他没说完我就直接打断。

角色定位:

阿浩,24 岁,广州西关传统早茶楼少东家兼早茶直播间主理人;

从小在茶楼帮忙,熟悉点心出品、当日招牌、点单搭配与待客礼仪,擅长用生活感把早茶卖给屏幕前的人。

核心性格:

-热情爽朗、会聊天不会硬推;

-先分享自己为什么爱这笼点心,再自然带到下单。

-照顾街坊面子,不贬低竞品,不制造焦虑,也不端“本地人优越感”。

说话习惯:

-口语化普通话;

-每轮按“场景共鸣—招牌卖点—怎么吃/怎么点—行动号召”推进,一次主推 1-2 款,语气像熟客介绍,不像念广告词。

爱好与知识偏好:

-泡茶、研究点心掌故、听粤语老歌、逛西关老街、收集茶杯与招牌字体;

-尤其喜欢讲一笼点心为什么值得现在点、配什么茶更合适。

回答原则:

-卖点具体可感(皮薄、馅大、现蒸、茶底),区分“自家茶楼体验”和“通用早茶知识”;

-价格、库存、配送不确定时明确说以门店/页面为准,不虚构“全城第一”或神秘配方。

回答边界:

-不虚假功效、不绝对化承诺、不诱导未成年人过度消费;

-过敏原、价格、营业规则以现场信息为准;

-热茶与餐具动作以安全为先,不拿地域刻板印象开涮。

带货、客服、管家型数字人,反馈这么快还能即时做修改的话就更好玩了。听懂了并且给出个性化回复,这种反馈会让人更有亲切感。

再换个英文场景试试。忽略我拙劣的口语,他的回答从语音语法上来说都是很不错的。英语对话也是实时跑的,接话速度没怎么掉档。这个气泡音哈哈哈。🤣

AI 教育方向和口语陪练、出海相关内容,都可以探索探索。

面对疾风吧!我想着再试试全身场景的角色细节和动作会不会崩,实际操作下来竟然还不错。不过外国人设+中文可能会有点奇怪哈哈哈。

还挺有陪伴感的,像游戏里的角色在陪我们聊天,而且是实时的。长时间陪伴、剧情向互动,知识库做扎实了会带来很多可能啊。

能实时接话、能中途改造型、听得懂指令、扛得住打断、中英文都行,还能做沉浸陪伴。 数字人赛道常见的需求也是给 S2-Avatar 拿捏住了。

S2-Editing,实时编辑

用户直接录制视频或者上传视频,接着就可以支持视频在生成过程中直接改变画面的内容和视觉表现。

它的核心能力包括:实时改变角色或 IP、实时换装、实时换视频风格、基于参考图进行实时编辑,而且编辑结果以实时视频流的形式去呈现。

正在直播的画面就能同时换衣服、换风格、换背景、换角色,还能稳住场面,稳住不变的元素。

00 📋 待办事项/附件/Vidu S2实测,实时720p交互,边播边改,数字人赛道卷起来了。/img-08.png

除了那个抽象视频,我也尝试了一些正经的。

它这里所有的改变都不是只能套模版,我们给个参考图也能直接变。而且非常灵活,可以看这个替换角色的效果,角色关节手指灵活且符合人体结构,动作比较快的时候五指也没有大崩,甚至后来我发现我的眼球左右转动它也是能精准跟随的。背景也维持得比较好,没有那种一眼假的穿帮感。👇

上传一张图就能把角色塞进实时视频,自由度很高。视频直播的情况下还能持续改画面,并且同步改,改得稳,确实很有实力了。

做直播包装或者短视频等等也都可以探索起来。

然后是一条更完整的实时换装,服装都是来自购物平台的衣服,直接动态试装了。

00 📋 待办事项/附件/Vidu S2实测,实时720p交互,边播边改,数字人赛道卷起来了。/img-09.gif
00 📋 待办事项/附件/Vidu S2实测,实时720p交互,边播边改,数字人赛道卷起来了。/img-10.gif

实时编辑的换装、换风格、换背景、换角色,全都能在播放过程中进行。

小结

Vidu S2 现在在 Vidu 的网页版、APP 和小程序都可以直接体验了。在这里:

vidu.cn/vidu-stream

技术报告:

00 📋 待办事项/附件/Vidu S2实测,实时720p交互,边播边改,数字人赛道卷起来了。/img-11.png

https://arxiv.org/pdf/2609.11638

API 平台:

http://platform.vidu.cn/vidu-stream/doc

我不想简简单单定位 Vidu S2 就是什么“会说话的数字人”,这样对它来说太片面了。

它是视频开始之后,角色能持续回复,画面也还能继续改的实时模型。

无论是从它的长时间连续生成的这种一致性的维持,对于指令的反馈的准确性,还是响应速度上,都是很不错的。

在前面很多案例中大家也可以看到,在虚拟直播、智能服务、教育陪伴和实时内容创作等场景中,它都展现出了明确的应用价值。

不论是从单纯地想要整活、做一些好玩有趣的尝试,还是作为生产力方向去探索更多企业工作场景,它都有非常多的可能。大家感兴趣的话可以直接去体验。

本文由人人都是产品经理作者【阿真Irene】,微信公众号:【阿真Irene】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自作者提供

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!