一个令人惊艳的开源项目,Agent 开始自己复刻爆款视频了!
Hypit 是个开源视频生成项目,把一条参考视频丢给它,Agent 会自己拆出结构,再换内容、换主播、换语言出片。同一篇文章套上 MG 动画体、网页排版体、杂志体三种风格,42 秒 6 个片段一次跑完。

最近刷到一个开源项目叫Hypit,试了一下,跟之前用过的模板工具思路完全不同。

GitHub :github.com/hypit-ai/hypit
模板工具是选个模板填文字换图片,出来的东西千篇一律。Hypit是你给它一条爆款视频,Agent 自己把结构拆出来,你换内容、换主播、换语言,出来的每条都不同。

01 先看效果
直接看东西。
我拿之前写的那篇Tutti·VM 多 Agent 协作的文章当素材,同一份内容,用Hypit套了三种风格,出来三条完全不同的视频。42 秒,6 个片段,一个字没改。
CASE 01 风格 A:MG 动画体
米黄底,大字标题配动画字幕。
讲到 Tutti 界面那段,直接把产品截图贴进画面了,关键词高亮。看起来像刷小红书时碰到的那种科普短视频。
CASE 02 风格 B:网页排版体
左边结构化排版,右下角真人小窗。讲到 Claude Code 接需求那段,左边自动画了一张流程图出来。每个片段有编号(01/06、03/06),讲到哪一目了然。
CASE 03 风格 C:杂志体
Ps. 好奇是怎么做的吗?简单说下思路:用Hypit的CLI,用的是Kimi K3 配置,利用多模态能力,把对应的参考视频给到 K3,让他负责调度,然后直接渲染剪辑进去。
蓝色、荧光绿、珊瑚红色块拼版,像翻杂志。三种风格里这个调性最强,我自己最喜欢这版。

同一篇文章,连带着中间的主持人,三种画面,全都是 AI 生成的。
02 视频写成代码
和别的 AI 软件相比,Hypit用下来最明显的感受:这东西是给 Agent 设计的。
传统工具你写一份分镜脚本,AI 能照着念台词,但画面上的动画、字幕、B-roll 切换,它不一定跟得上。你改一句台词,可能得手动调半天画面。
Hypit的做法是把视频写成一份.svml 文件,你可以理解成视频版的 HTML,一份文件把台词、画面、字幕、动画全写在一起,而且互相绑定。看一下它的工作台,左边是源码,右边是实时预览:

代码跳到哪,画面就跟到哪。每一小段台词就是一个segment(片段),台词里用@ 标签触发对应的画面和动画,类似 Word 里的批注,标到哪里就在哪里生效。
整体结构拆开看是这样的:

一份 .svml 里有五层:Script管台词和角色、Media Track管画面素材、Caption 管字幕、Speech Track 管语音合成,最后 Film 把这些合到一起渲染成视频。说白了,写剧本、配画面、加字幕、生成语音、导出成片,全在一个文件里搞定。
这里有个最关键的设计:

传统剪辑工具里,素材绑的是时间轴。你删一段音频,字幕和动画还杵在原位,音画不同步,得手动一个个挪。
Hypit里所有东西绑的是台词:一段台词下面挂着语音、字幕、动画,删掉这段台词,三样全部自动移除。改一句话,整条视频自动跟着调。

回头看前面图解笔记体那条视频,每个片段左上角都标着“01/06”“03/06”,就是 .svml 里的segment 编号。
一个 segment 对应一段台词,下面挂着这段台词的画面、字幕、动画。你在三种风格里看到的“别再当传话筒”“Claude Code → 工具”,都是同一个 segment,只是渲染模板换了。
Agent 处理起来也更顺手。.svml 是结构化的文本,读写文本本来就是 Agent 最擅长的事。不用先抽帧、转字幕、跑视觉识别绕一大圈,直接改文本就是改视频。

实际的源码长这样:

一份.svml 描述整条视频。import 引入组件(类似 PPT 里插入模板),script 写台词和角色,media 管人物和画面生成,caption 管字幕,film 合成竖屏输出。整个流程跟写文档差不多,只是最后输出的是视频。
03 开放框架,模型随便换
框架本身是开放的:

语音合成、视频生成、图片生成、语音转文字、视觉理解,都是可替换的模块。这里我用的 MiniMax H3 生成的视频,你换 Seedance、可灵都行。不绑定任何一家。
用起来也简单。它提供了一个 Skill,一行命令装好,在任意 Agent 对话框里就能用。

安装好了之后,能直接在 Codex、CC、WorkBuddy、豆包工作等等 Agent 中直接调用即可~

一条爆款出来,换人换内容再跑一遍就是新的。一条参考视频进去,拆出结构,换人换风格,批量出片。

同一条视频换个主播就是新的一条,真人版、猫咪版,一条变一百条。
04 结语
做视频的门槛一直在降。
模板工具降的是操作门槛,不会剪辑也能出片,但出来的东西都一个样。
Hypit降的是另一层:你看到一条好视频,怎么把它的结构拿过来,换成自己的内容,快速出片。
还有一点,最近的视频模型更新太快了。。
框架搭好了就搭好了,但上面跑的模型还在进步。今年的语音合成、视频生成比去年好一大截,明年只会更好。框架不用动,模型升一代,出片质量自动涨一截。
换句话说,今天用Hypit做出来的视频已经能用了,半年后同一套流程再跑一遍,效果只会更好。
工具不用换,东西不用重新学。
最重要的是开源!开源!开源!
直接就能本地部署一套,
以后每篇文章发完,就能顺手就出一条视频。
9 月 7 号开源。GitHub 搜Hypit。
作者:甲木 公众号:甲木未来派
本文由 @甲木未来派 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自 unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益



