13K Star开源项目,一键复刻千万网红爆款视频

0 评论 136 浏览 0 收藏 13 分钟

开源框架 Hypit 的思路是先拉片再生成:把参考视频丢给 Agent,拆出逐句时间轴与镜头切点,先出一份灰色草稿确认结构,再渲染成片。台词挂载字幕与动画,改一句词整条自动重排,本机重渲即可,不必重新生成素材。

现在网上做 AI 视频,路子基本就两条

要么用 Remotion 那种代码动画,要么就是套个 PPT 模板;再往上一层,可能就是 AI 剪辑。

可这些说到底,都得自己备干粮、备素材,脚本、画面、字幕一样一样自己攒。

那有没有办法,直接拿一条现成的视频,复刻过来、直接出片?

巧了,最近开源了一个框架,叫 Hypit


我拿它试的第一刀,就是把小 Lin 说一条讲 AI 资本圈的视频,直接复刻了两个版本

原片讲的是谷歌拿 400 亿美元投 Anthropic,前两个月两家还打得你死我活,突然要钻一个被窝。台词照搬、节奏照搬,画风随便换

这次玩法就一句:给 Agent 一套做视频的语言和系统,让它把参考片拆开读,复刻成 Clone,一套能换人的模板。别人的爆款,拆下来就能当你的底子。

下面就是流程教程。我尽量压着说,重点放在它到底替我把哪一步接走了。最后再换两次人,你看到底灵不灵。

01 从拉片到成片,就四步

Hypit 的使用方法非常简单,并且只要发给 Agent 都能用。

第一步,装工具

把 Hypit 的链接发给 Agent,它自己装。我就说了一句:

你帮我把 Hypit 这个工具装上 + Github 链接


装完 Agent 多两个本事:拉片(把一条视频从头到尾拆开读)和生成(照着读出来的做一条新的)。我用 Cursor 里的 Agent,Claude CodeCodex 一样能接,你手上有什么用什么。

第二步,拉片,先读不生成

你帮我去给这个片做个参考:每句话几点说、画面几点切,都给我标出来

原片丢进去,它给我两份东西。

一份是这个视频的完整拉片,细节到人在中间说话、字幕一句一换贴嘴边、48 秒后上下两排品牌卡把人围起来。另一份是时间账,细到帧:0.07 秒「朋友们」出口,8.33 秒切进钱和名录,39.3 秒一个大「乱」字铺在人后面,48.2 秒底排淡入、48.4 秒顶排跟上,55.7 秒硬切海报。



后来换别的形象,效果都很好,框架都在,靠的就是它。

第三步,打草稿,先看灰样。

PROMPT/hypit clone this video: 原片.mp4画面改成疯狂动物城,主播换成一只原创红狐,构图、道具、镜头照原片来

它先给我一份草稿,里面就三样东西,各管一段:

  1. Brief:这活儿要什么。多长、给谁看、什么调性,先说明白,省得后面跑偏。
  2. Treatment:这条片子怎么拍。开场怎么进、主播怎么摆、字幕放哪、牌子什么时候上,等于一份拍摄大纲。
  3. main.svml:台词和画面怎么对上。谁在第几句开口、说到哪个词该弹出什么,全写在这儿。

关键是这时候画面全是灰的,一分钱没花。 结构不对就当场改,改到满意它才报预算,我点头才真生成。平时买工具都是先掏钱再验货,这回反过来了。

第四步,出画面、回工作台、瞄一眼代码

CMDbuild it

图片用平台自带那档,会动的镜头接我自己账号的视频接口。定妆和分镜静帧长这样:



书房 A-roll 也直接出:

生成完回工作台看一眼。

下面这张是官方的演示素材,左边是代码,右边是画面:

你把右边画面拨到哪一帧,左边代码就跳到那一段;反过来在左边改一句话,右边画面立刻跟着变。榜、字幕、卡、切镜全在这套对应关系里,哪一秒的画面是由哪句台词带出来的,一眼就能对上,不用来回猜。

它凭什么能做到这样?因为这里的东西全都挂在台词上,没钉死在时间轴的某一秒。

传统剪辑里,素材是钉在时间线上的。你删掉一段音频,字幕和动画还杵在原地,得一个个手动掰。这里你删掉一句台词,挂在它下面的语音、字幕、动画跟着一起走;你改一句词,整条自己重排

也是因为这个,改完本机重渲就行,不用重新生成素材,也不再花钱

代码这层不用看懂。它用的是一种叫 SVML 的描述语言,当一份「视频的源文件」看就行:台词、画面、字幕、特效,全写在一处。

比如后面柴犬那条视频,写在代码里就是这样(示例):

<ranking> <HOST>哎给你排个。@fifth 第五 @/fifth,袜子后跟破个洞,你不换,直接穿去上班了。 @first 第一 @/first,门一推,眼直接闭上了,呼吸都调匀了。 </ranking>

嘴里说到「第五」,第五行才从旁边落下来;说到「第一」,第一行才坐实。词一改,画面跟着走。这套文件能存、能改、能版本管理,也能拿去批量出变体

说句实话,它做不到一键出片。主播手势循环还是同一段 6 秒,对不上原片里的竖指、摊掌;有个镜头视频生成超时,我拿静帧转圈兜的底。这些要人再过一遍。

02 换个人:柴犬版

第一条跑完我就明白了一件事:框架能一直用,换的只是人。

像是这里,TikTok有个特别火的排行榜视频:

同一套榜单模板,人直接换成穿蓝冲锋衣的柴犬,口播、画面、字幕全部重做,只有榜和节奏没动

这条我更省事,榜和字幕的组件一个字没改,只让口播和画面重来。

PROMPT你把这版的主持人换成一只穿蓝冲锋衣的柴犬,词和画面重新来,榜单和节奏别动

从「上班这些破事」一路排上去:袜子破洞、外卖到了装没在看、半夜一个人站厨房开灯、开会满脑子晚饭,第一名是门一推,眼闭上,呼吸调匀,装睡装到位。

上一句还在讲「钻一个被窝」,这一句换成了「外卖到了那一秒,手机啪往桌上一扣,装没在看」。说话那股劲儿还是同一股,人已经换了个物种

WARN人和口播得一起换。只换个身子还念原词,那就是套壳。真正让人记住的是那句台词落在哪儿喘气。

03 换个框架:松鼠版

同一套路子,换一条参考片,又是另一套

你换一条参考片,做个 AI 博主 Top5 榜,主播换成戴蓝圆框眼镜的松鼠

顶栏钉死「办公松鼠 / 最离谱的翻车」,人在右边说话,左边整列留给榜,从第五名往上爬:忘字幕、当新脸、先抱抱、窗已满,第一名是把幻觉当真直接拿去开会,落地之后画面还停着不走。

跟柴犬那条比,这一回连榜的排布、顶栏、镜位都换了,只借走「倒序填榜、说到哪儿填到哪儿」那个机制。框架拆下来就能接着用,不用对着空白重搭一遍。

写在最后

成本账。动物城那条,Hypit 这头只打了定妆和分镜静帧,$0.17;柴犬那条口播 TTS 免费、转写几分钱,整条不到两美元。官方自己跑的三条英文样片,一条成片成本也就在一块一上下。

局限也很明显

  • 它很吃 Agent 的脑子。 台词是 Agent 写的,碰上不太会聊的,写出来一股 AI 味:句子碎、逻辑跳,成片看下来一头雾水。
  • 笑点还是得你自己定。 生成的细节得人过一遍,指望一口气全自动交付,会失望。

上手有没什么门槛,你只需要发个 Agent、会下指令、找对参考。说到底,它把重复的执行接走了,审美和判断还留在你自己手里。

框架开源、免费Clone 是最好上手的入口,也可以从官方模板开始,或者把想要的东西描述清楚,让 Agent 从零写一套

作者:摸鱼小李 公众号:摸鱼小李

本文由 @摸鱼小李 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自 Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!