万相 Wan3.0 评测:文档直转 30 秒视频,阿里这次把”稳定”做成了卖点

0 评论 2390 浏览 0 收藏 17 分钟

做个产品演示视频还得搭摄影棚、排拍摄?万相的最新视频模型直接把文档和参考图变成 30 秒成片,主打”稳定、真实、有质感”。今天上线的它把单次生成拉到 30 秒,还首次吃进了 PPT 和 PDF。我把它和几个主流模型摆在一起,看它能不能真的进生产流程。

产品概述

万相 Wan3.0 是阿里巴巴的视频生成大模型,2026 年 8 月 24 日正式上线。此前的公测从 8 月 6 日启动,十余天里以”天”为单位持续迭代,核心升级集中在生成时长、万能创作、全能参考、真实世界还原四个维度,最刺眼的数字是单次可生成 30 秒原生视频,同时首次支持 doc、xls、ppt、pdf、md 等文档格式直接作为输入。

官网:https://wan.video | 体验入口:阿里云百炼 / 万相官网 / 千问 AI 平台 / 千问 App / 万镜一刻 / 堆友 / IF STUDIO

核心功能

前面聊了它是什么,接下来仔细看看 Wan3.0 到底把哪些能力塞进了这一次更新里。

30 秒原生视频是这次最硬的指标。以往多数模型单次只能出 5 到 10 秒,叙事刚起头就断了,长一点的镜头只能靠后期硬拼。Wan3.0 把上限拉到 30 秒,且强调人物、车辆、环境在整段里高度一致。

文档直转是另一个差异化卖点。它首次支持把 PPT、PDF、Word 这类文件直接喂进去,模型会解析文档结构和内容,再据此生成对应画面。这对做培训材料、产品介绍的人很实用。

“Omni-Creation”万能创作最多能吃进 20 个参考素材,包括复杂文档和网页解析。多图融合可以无缝拼合最多 9 张图,顺序叙事则能生成最多 12 张连贯图像,且保持风格和主体一致。

文字渲染支持 12 种语言的长文本,图表、公式、信息图都能比较好地生成。精确色彩控制让你可以指定色彩分布,肖像定制则从骨相到眼神细节做出差异化真人面孔。

交互式编辑是容易被忽略的亮点。它支持框选局部做像素级对齐修改,也支持指令式和参考式编辑。沉浸音效则补齐了 AI 视频长期缺失的真实听感一环。

上手体验

聊完功能,最想知道的肯定是实际用起来什么感觉,尤其它主打的”不抽卡”到底成不成立。

入口很顺。打开万相官网或阿里云百炼,选文生视频或图生视频,上传文档、参考图或直接写提示词,点生成即可。网页端基本零配置,不需要本地显卡,对普通创作者非常友好。

第一感受是”稳”。参与测试的企业用户反复提到三个词:“稳定、真实、有质感”。在一段高速追车戏的样例里,模型能读懂参考素材、处理长时序叙事,30 秒内人物车辆环境一致,不用反复抽卡调参。

走 API 路线的开发者,流程是典型的异步任务模型:提交任务和参考素材,拿到任务 ID 后轮询或等回调,生成完再到对象存储取片。这条链路对批量生产很关键。

真人质感是它想啃下的硬骨头。官方强调”千人千面”,刻画五官和皮肤细节,微表情和肢体动作彼此联动。样例里女孩的眼球反射、毛发、白纱和水面光泽同框出现,冷灰蓝调全程守住,皮肤没有塑料化。

当然也不是没门槛。要让成片达标,提示词功力仍然重要,参考图给得越准,一致性越好。长片 30 秒对完整短剧仍偏短,更长的叙事还得靠顺序叙事或后期拼接。

使用技巧

很多人不知道,Wan3.0 真正提高效率的关键不在生成按钮,而在输入阶段的准备。下面这几条从实测里摸出来的门道,能帮你明显少走弯路。

用 PPT 或文档当底稿。既然它支持解析 doc、ppt、pdf,就别只丢一句提示词,把结构化的内容喂进去,模型对画面逻辑的理解会准很多。

多给参考图堆一致性。人物脸、产品外观、Logo 这类要稳定的元素,尽量用多参考图明确锁定,比纯文本描述靠谱得多。

善用框选交互式编辑。局部不满意别整段重生成,框选那一小块下指令改,省时也更可控。

长叙事拆成 12 图顺序生成。要讲完整故事,先规划分镜,用顺序叙事保证风格和主体连贯,再合成。

色彩和文字用指令显式控。需要特定色调或画面里带文字,直接在提示词里写清色彩分布和文案,别指望它自己猜。

竞品对比

光看自家宣传不够,把它和市面上几个主流模型摆到一起,才知道 30 秒和文档直转到底值不值钱。以下价格截至 2026 年 8 月,具体以各厂商官网实时显示为准。

模型 核心定位 文生/图生 参考能力 原生音频 单次最长 价格定位
万相 Wan3.0 文档直转长片 文+图 20 素材 / 9 图融合 有(沉浸音效) 30 秒 0.3/0.6/1.2 元/秒
可灵 Kling 2.1 物理真实感标杆 文+图 参考图驱动 无(2.1 版) 10 秒 订阅 $6.99 起
Google Veo 3 原生音效标杆 文+图 最多 3 图(3.1) 8 秒 AI Ultra $249.9/月
OpenAI Sora 2 叙事连贯最佳 文(为主) 参考帧 20 秒 ChatGPT Pro $200/月
Runway Gen-4 角色参考最稳 图+文 强参考系统 10 秒 $12/月起

数据截至 2026 年 8 月,价格随厂商调整,以各官网实时显示为准。

横向看,Wan3.0 在单次时长上断崖领先,30 秒是其他闭源模型的两到四倍。文档直转更是独一份,目前没有对手把 PPT、PDF 直接当输入做成核心能力。

音频这条线有意思:Veo 3 和 Sora 2 都有原生音效,可灵 2.1、Runway 仍靠后期补。Wan3.0 的沉浸音效算是补上了这环,但具体音质仍需实测。

可灵 2.1 的物理真实感和运动稳定性仍是写实场景的强项,水、火、布料的运动很自然。Sora 2 的叙事连贯和多角度一致性被公认更好。Runway 的参考系统和相机控制最适合品牌一致性创作。

用户反馈

模型的成色,最终要听真用的人怎么说,我整理了企业用户和创作者两边的声音。

正面反馈高度集中在”稳”。大量参与测试的企业用户把”稳定、真实、有质感”挂在嘴边,尤其是角色、道具、声音、空间关系这些细粒度维度能稳定保持,对追求产能的团队很关键。

短剧团队给近景特写打出好评,说人脸细节还原精准、成片稳定可用率高。广告团队则认可商品外观、Logo、材质的高度统一,口播也自然流畅,成品接近真实广告拍摄水准。

负面声音主要在成本和上限。按秒计费在 1080P 档达到 1.2 元/秒,长片积少成多不算便宜,对高频量产团队是一笔要算清的账。

30 秒上限也被反复提及。它比过去长很多,但对完整剧情、课程、纪录片仍不够,更长的片子还得靠顺序叙事或后期拼接,没真正做到”一次到底”。

部分刚接入的第三方平台在初期出现排队。这是扩张期的常见阵痛,但随着算力铺开通常会缓解,是否影响你的节奏要看上线时点。

多维评分

把前面这些拆成八个固定维度,挨个打分,看看综合到底落在什么水位。

维度 权重 星级 一句话解读
功能完整性 20% ★★★★★ 文档直转、多参考、音效、编辑全覆盖
易用性 15% ★★★★☆ 网页零配置,提示词仍要功力
性能表现 15% ★★★★☆ 30 秒长片与一致性是硬实力
AI 能力 15% ★★★★★ 多模态与真实还原领先同代
价格合理性 10% ★★★☆☆ 按秒计费长片成本偏高
生态集成 10% ★★★★☆ 百炼/千问/多平台已铺开
文档与支持 10% ★★★☆☆ 新上线,文档体系待补全
更新频率 5% ★★★★★ 公测期以天为单位迭代

加权后综合约 4.2 / 5(84 分)。扣分的重灾区是价格门槛和 nascent 的文档体系,强项则是功能广度和迭代速度。

优缺点

优点很清晰:30 秒原生长片断崖领先;文档直转是独门能力;跨镜头一致性和真人质感突出;沉浸音效补齐听感;多参考和框选编辑把可控性拉满。

缺点也得摆明白:按秒计费在高位档偏贵;30 秒对长内容仍不够;成片质量依赖提示词和参考图功力;更长的叙事暂时还得靠拼接或顺序生成。

适用人群

不是所有人都该冲,我把适配度最高的人群排了个序,对号入座更省心。

短视频和广告团队最该试。商品外观、口播、Logo 要稳定,又要快速出片,Wan3.0 的一致性和文档直转正好对口。

短剧和影视预演团队也高度匹配。近景特写和长时序叙事的稳定性,能直接压低分镜和预演的成本。

企业和文旅宣传部门值得关注。把汇报 PPT、讲解文档直接转成视频,降低了非专业团队的视频生产门槛。

普通创作者和开发者也能用。前者靠网页零门槛上手,后者走百炼 API 把生成塞进自己的生产管线。

定价方案

价格这部分得算细,按秒计费的水面下藏着真实的成本结构,别被”限时折扣”带节奏。

档位 标准价(元/秒) 限时 7 折(8/24 至 9/23,元/秒)
480P 0.30 0.21
720P 0.60 0.42
1080P 1.2 0.84

数据截至 2026 年 8 月 24 日阿里云百炼与千问 AI 平台显示,优惠窗口到 9 月 23 日截止。

换算一下感知更直观:一段 30 秒 720P 成片,标准价 18 元,折后 12.6 元。对偶尔产出的团队能接受,但对日更、量产的账号,按月流水摊下来不是小数。

截至 2026 年 8 月,横向比,它比可灵按条订阅贵、比 Veo 3 的 $249.9/月订阅便宜,定位在”按量付费、用多少算多少”的中段。预算敏感型可以先用 480P 试产,定稿再上 1080P。

常见问题

最后集中回答几个高频疑问,帮你快速判断这款模型适不适合放进自己的工作流。

Q1:Wan3.0 和普通视频模型最大的区别是什么?

A1:最大区别是 30 秒原生长片加文档直转。 它单次能出 30 秒且跨镜头一致,还能直接吃 PPT、PDF 生成视频,目前没有对手把这两点同时做成核心能力。

Q2:没有本地显卡能用吗?

A2:完全可以,网页端零配置。 打开万相官网或阿里云百炼即可生成,不用本地算力,普通创作者也能直接上手。

Q3:支持和哪些平台对接?

A3:官方与第三方都已铺开。 万相官网、阿里云百炼、千问全端、万镜一刻、堆友、IF STUDIO 可直接用,Flova、Libtv、美图等也已完成接入。

Q4:文档直转支持哪些格式?

A4:支持 doc、xls、ppt、pdf、md 五类。 模型会解析文档结构与内容再生成画面,适合培训材料、产品介绍这类结构化内容。

Q5:生成一段视频要多少钱?

A5:按秒计费,标准价 0.3/0.6/1.2 元每秒。 截至 2026 年 8 月,8 月 24 日至 9 月 23 日有限时 7 折,折后 0.21/0.42/0.84 元每秒,长片建议先算清成本。

Q6:30 秒够拍完一个完整故事吗?

A6:对多数短片够,长内容仍需拼接。 30 秒已是闭源模型里的上限,但完整短剧、课程、纪录片还得靠顺序叙事或后期衔接。

Q7:和 Sora 2、Veo 3 比谁更强?

A7:各有侧重,不在同一维度。 Wan3.0 强在时长与文档直转,Sora 2 叙事连贯更好,Veo 3 原生音效更成熟,按场景选比硬比高低更实际。

Q8:有原生音频吗?

A8:有,叫沉浸音效。 它补齐了 AI 视频长期缺失的真实听感,但具体音质和可控性仍需真人实测来判断。

Q9:企业怎么批量接入?

A9:走阿里云百炼 API 异步任务。 提交任务和参考素材后拿任务 ID,轮询或等回调取片,适合把生成嵌进自有生产管线。

Q10:不支持哪些场景?

A10:超长叙事和极致低成本暂不适用。 30 秒上限、按秒计费、以及对提示词功力的依赖,决定了它暂时不是长剧集和极限预算场景的最优解。

结尾

Wan3.0 不是又一个”参数更猛”的模型,它把”稳定、真实、有质感”当成了产品目标,这恰恰是过去 AI 视频最被人诟病的地方。30 秒长片和文档直转两个能力,确实戳中了企业生产的真实痛点。

它当然不完美。按秒计费在中高位档不便宜,30 秒对长内容还是短,提示词和参考图功力依旧决定下限。但作为今天刚上线的版本,迭代速度和生态铺开速度都很快。

如果你做的是广告、短剧预演、企业宣传这类”要稳定出片”的活,现在就去万相官网或阿里云百炼试一段,趁着 7 折窗口把成本结构摸清楚,比看十篇评测都实在。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!