分享一个AI做视频提效10倍的方式

0 评论 318 浏览 0 收藏 11 分钟

用 AI 做视频,模型本身够强,真正折腾人的是模型之外那一堆事:画面要找可灵、即梦、Seedance,配音找豆包或 ElevenLabs,音乐找 Suno,每家一套账号、充值和参数;素材有了还得自己剪。作者因此做了一个会自己做视频的助手。

这段时间我一直在用 AI 做视频,越做越觉得:模型本身已经够强了,真正折腾人的,是模型之外的那一堆事。

随便列几个我踩过的坑。

  • 平台太多。 画面要找可灵、即梦、Seedance、Veo,配音要找豆包或 ElevenLabs,音乐要找 Suno,图片要找 FLUX 或 Seedream。每家一个账号、一套充值、一套参数,光是把这些配齐,一下午就没了。
  • 不知道该做哪种视频。 我脑子里想的是「给产品做个宣传」「把这期播客剪成短视频」,但这类视频该走什么流程、分几步做,得自己一点点摸索。
  • 不知道该用哪个工具。 同样是生成视频,有的便宜但不稳,有的效果好但贵,有的擅长人物,有的擅长风景。每次都要试一轮,钱就这么花出去了。
  • 素材有了,还得自己剪。 打开剪映,一段段拖进时间线,对字幕、对节奏。忙活半天,做出来的经常是「几张图配上念稿」,不太像一条视频。
  • 想批量就更难了。 比如做投放,要同时测十几条不同卖点、不同开头的素材,一条条手工做,根本做不过来。

我也找过能把这些串起来的开源项目,确实有做得不错的,但都要自己装环境、会用 AI 编程工具。这个对于很多人来说,还是太复杂了。所以我想着能不能做一个真的很低门槛,大部分人都可以无痛使用的呢?

所以我做了个「宝葫芦」

我基于开源项目 OpenMontage 重新开发了一个会自己做视频的 AI 助手,起名叫「宝葫芦」。

名字的意思很直白:想要什么视频,跟它说一声,它就给你倒出来。

它整合了几十家 AI 服务,可以配置到飞书群,或者企微群里,也可以配置到微信的ClawBot中。你在群里跟宝葫芦说一句话,它自己写脚本、出分镜、生成素材、配音配乐、剪辑合成,最后把成片发回群里。

先看看它能做什么:

一共 13 种。从零生成的有动画讲解、动画短片、角色动画、电影感短片、纪录片蒙太奇、数字人口播;用你自己素材的有口播剪辑、录屏演示、长视频切片、播客转视频、混剪、翻译配音。再加上我自己用得最多的:批量做投放素材。

光看列表可能没什么感觉,下面我就拿投放素材举个例子,完整走一遍。

举个例子:在群里批量做投放素材

假设我要给一个周报工具做一批抖音投放素材。

第一步,发素材。 把一条觉得不错的同行视频、产品截图和录屏丢进群。发视频的时候,宝葫芦会问一句:这是「参考视频(学它的结构)」,还是「产品素材(要剪进成片)」。

第二步,填需求。 @宝葫芦 说「投放」,它回一张表,填产品名、卖点、目标人群、用户痛点、行动引导、投放平台、时长、要几条。

第三步,挑脚本。 它出一张「脚本矩阵」卡片。我给了 2 个卖点,它配上不同的开头方式(戳痛点、制造好奇、抛问题……),每条写清楚开头钩子、口播全文、画面安排、预计花多少钱。我勾选想做的,点「生成」;不满意就写意见让它重写。到这一步,还一分钱没花。

第四步,看样片。 素材生成好后,它发来每条的开头画面和已经花了多少,我点「通过」它才开始合成。

第五步,收成片。 带配音、字幕、配乐的竖屏成片,直接发回群里。

整个过程我只做了三件事:发素材、填表、点按钮。

但真正让我放心的,是它做投放素材时守的那些规矩:

  • 一条只测一个卖点:卖点和开头方式排列组合,一次出 6 到 12 条,跑完数据就知道哪个卖点、哪种开头好使
  • 前 3 秒必须抓人:第一帧就要有钩子文案,不放 logo 开场,也不慢慢淡入
  • 固定节奏:15 秒一条,钩子 3 秒、痛点和证明 7 秒、效果 2 秒、行动引导 3 秒
  • 广告法自查:每句口播都过一遍禁用词,「最」「第一」这类词自动改写
  • 优先用真实产品画面:截图和录屏最有说服力,优先用;拍不到的场景(深夜加班、用完很爽)再用 AI 生成
  • 直接出竖屏:9:16,按抖音、快手、视频号、小红书的界面留好安全区,字幕不会被按钮挡住

其他类型的视频也是一样的路子:在群里说需求,它按那类视频的做法一步步做,关键节点停下来让你确认。

回头看那几个坑

例子走完,再回头看开头那几个坑,宝葫芦分别是这么解决的。

平台太多?我都接好了。 20 多个视频生成模型、15 个左右生图模型、10 个配音服务、7 个音乐来源,都整合在里面。可灵、即梦、Seedance、Veo、FLUX、Seedream、豆包、ElevenLabs、Suno 这些常用的都在,用的人不用再注册任何一个平台。另外也留了免费的路子:本地配音、免费素材库、免费曲库,能用免费的就不花钱。

不知道做哪种视频?说大白话就行。 13 种视频,每种都写好了分几步做、每步注意什么。你只要描述想要什么,它会自己对上号;说不清楚,它会反过来问你。实在不知道怎么描述,直接丢一个喜欢的视频给它,它会拆解这个视频的节奏、结构和风格,再给你 2 到 3 个改编方案。

不知道用哪个工具?让它自己挑。 每一类工具都有一个「挑选器」,从 7 个角度打分:对不对口、质量、可控程度、稳定性、价格、速度、前后画面能不能保持一致。选完会把理由记下来,某家服务挂了也会自动换备选。

钱也管得住。它会先估算要花多少,我点头了才开始生成,过程中一直记账。它也不会无脑全用最贵的视频模型,能用图片加镜头运动、特效解决的画面,就不花视频生成的钱。参考开源社区公开的案例,一条 60 秒的动画短片成本在 1 美元出头,用图片做的风格化短片能压到 1 块钱人民币左右。

素材还得自己剪?不用了。 剪辑、配音、配乐、字幕、合成,都是它在后台做完的,你收到的就是成片。

要装环境、会写代码?不用。 在群里 @它 就行(微信也在接)。

它背后是怎么运转的

简单讲讲原理,感兴趣的可以看看。

宝葫芦本身就是一个会做视频的 AI 助手(现在流行的叫法是 Agent),它跑在服务器上。你不需要在自己电脑上装任何 AI 软件,在群里 @它,它就在后台开工。

它肚子里装了三样东西:

  1. 会思考的大脑:一个大模型,负责听懂你的需求、做决定、推进进度,像一个导演
  2. 制作手册:每种视频该怎么做、分几步、每步的标准是什么,我都提前写好了,大脑照着做,不会乱来
  3. 工具箱:一百多个现成的小工具,生图、生视频、配音、配乐、剪辑、合成都有,大脑按需调用

每条视频都按固定的 7 步走:

想法 → 脚本 → 分镜 → 素材 → 剪辑 → 合成 → 发布

每一步做完,它会先自己检查一遍:画面有没有问题、音量对不对、字幕齐不齐、是不是做成了「PPT 翻页」。关键节点再停下来给我看,我说行才往下走,说不行它就按意见改。

步骤和标准写死在手册里,保证它不会乱来;用什么风格、选什么工具、怎么剪,交给大脑根据需求判断。这是我觉得宝葫芦最靠谱的地方。

本文由人人都是产品经理作者【南村小付】,微信公众号:【南村小付】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载

题图来自 Unsplash,基于 CC0 协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!