16000字超详细 Seedance 2.5 官方提示词指南及提示词模板

1 评论 650 浏览 4 收藏 63 分钟

字节跳动 发布了新一代视频创作模型 Seedance 2.5。对做视频的人来说,这次变的不只是画质:一条视频能装下一整场戏,一次能同时指挥几十份参考素材,改片子的时候还能定位到第几秒。

支持纯文本生成,也支持同时参考图片、视频和音频进行创作,并可对已有视频进行编辑。]

相比 2.0,Seedance 2.5有主要突破:

字节跳动给发布了一份官方提示词指南:从一句话生成,到 50 份参考素材怎么调度、30 秒长片怎么分段、改片子怎么只动一处,每类任务都配了能直接抄用的模板。对用即梦或 API 做视频的人,这是第一份成体系的官方写法手册…

 

TEXTIMAGEVIDEOAUDIOEDIT
SECTION01

基础撰写技法

 
1.1

文本指令的基础公式

提示词可以按照下面的公式灵活组合:

FORMULA

主体 + 动作或事件 + 场景与环境(可选)+ 视觉风格(可选)+ 运镜或切镜(可选)+ 声音(可选)
FIVE PARTS

五个成分各自负责什么

主体 + 动作或事件
说明“谁或什么”正在“做什么”,这是视频内容的基础。动作优先概括主要过程,只为关键动作写具体细节,避免重复描述同一动作。
场景与环境
说明地点、时间、天气、空间关系和背景状态。
视觉风格
说明光线、色彩、材质、画面质感或整体氛围。
运镜或切镜
说明景别、机位、镜头运动、对焦对象和镜头衔接。
声音
说明对白、音色、环境声、音效和音乐。
TEMPLATE / 基础模板

<主体>在<场景与环境>中<主要动作或事件>。
画面呈现<视觉风格>。
镜头采用<景别、机位、运镜或切镜>。
声音包括<对白、环境声、音效或音乐>。
EXAMPLE / 示例

一名陶艺师在清晨的工作室里完成一只浅蓝色陶杯,将它从转盘上取下并放到木架中央。
窗外柔和晨光照入室内,湿润陶土呈现细腻光泽,工作台保持整洁。
镜头先以中景记录拉坯动作,再缓慢推近陶杯表面的纹理,最后切到木架正面。
保留转盘低沉转动声、陶土摩擦声和轻微室内环境声。

不需要的部分可以省略。生成参数不需要写进提示词;可调参数由生成页面或接口设置

1.2

有参考素材时,先准备素材并明确职责

素材数量与选择

可以组合使用最多 50 份参考素材。不同类型素材分别遵循下面的输入范围,推荐范围用于提高生成稳定性,不代表能力上限。

LIMITS

四类素材的输入范围与推荐范围

图片

输入范围

最多 30 张,单张不超过 4K

推荐范围

主体图片以 1 至 8 个主体为宜
视频

输入范围

最多 10 段,全部视频总时长不超过 30 秒

推荐范围

主体音视频以 1 至 5 个主体、单段 5 至 10 秒为宜
音频

输入范围

最多 10 段,全部音频总时长不超过 30 秒

推荐范围

保留与任务直接相关的台词、音色、环境声或音乐
视频编辑

输入范围

可使用视频与参考图共同完成编辑

推荐范围

原视频以 20 秒以内、参考图以 1 至 5 张为宜
超过推荐范围仍可尝试

主体图可扩展至 9 至 12 个主体,主体音视频可扩展至 6 至 10 个主体,视频编辑参考图可扩展至 6 至 8 张;素材越多,稳定性越容易下降。

主体图超过 5 个主体且仍需要多视角时,建议把不同视角拆成多张图片;多张独立视角图通常比把多个视角拼在一张图中更稳定。

逐份说明素材职责

上传参考素材后,需要说明每份素材具体提供什么。素材中的人物、背景或构图容易被误带入成片时,再写明不采用什么。

素材映射关系必须写进提示词

不要只依赖图片中的文字标注,也不要让模型自行判断多份素材分别对应哪个人物、道具或场景。

TEMPLATE / 素材职责模板

@图片1用于<主体>的<外貌、服装、结构或材质>。
@视频1用于<动作、运镜或节奏>。
@音频1用于<角色或声音类型>的<音色、台词、环境声或音乐>。<主体>在<场景>中完成<主要动作或事件>。
画面呈现<视觉风格>,镜头采用<镜头表达>。
EXAMPLE / 示例

@图片1用于<陶艺师>的五官、发型和深绿色围裙,不采用图片背景。
@图片2用于<陶艺工作室>的木质工作台、窗户位置和晨间光线,不采用图中人物。
@视频1用于双手拉坯、托起陶杯和放置陶杯的动作节奏,不采用视频中的人物身份、服装和场景。<陶艺师>在清晨的<陶艺工作室>完成一只浅蓝色陶杯,将它从转盘上取下并放到木架中央。
镜头先以中景记录拉坯动作,再缓慢推近陶杯表面的纹理;保留转盘转动声、陶土摩擦声和室内环境声。

如果多张图片是同一个人物或商品的不同视角,可以明确写成:

EXAMPLE / 多视角

@图片1定义同一盏折叠台灯的正面外观。
@图片2定义同一盏折叠台灯的左侧结构。
@图片3定义同一盏折叠台灯的右侧结构。
@图片4定义同一盏折叠台灯的背面结构。
四张图片共同定义同一盏折叠台灯,成片中始终只有一盏折叠台灯。

当参考视频已经准确给出动作、运镜和顺序时,提示词只需说明继承哪些内容,不必逐动作复述;重复描述可能与素材本身冲突。白模视频主要提供运动和空间骨架,仍需要写清希望生成的主体、场景、动作和风格。

1.3

声音与文字的特殊字符

提示词可以直接使用自然语言。需要进一步区分音乐、音效、台词和字幕时,可以使用下面的特殊字符:

SYNTAX

四种符号

音乐  ·  ( )

(背景播放舒缓节奏的钢琴乐)
音效  ·  < >

<远处传来钟声>
台词  ·  { }

{你好,欢迎回来}
字幕  ·  【 】

【第一章:启程】

需要控制字幕或声音时,可以直接写明保留和不采用的声音类别。画面内容仍优先使用正向描述,只有素材职责、编辑范围和容易误带入的内容需要明确限制。

EXAMPLE

无背景音乐,只保留人物对白、环境声和动作音效。
不要字幕。
不要任何声音。

台词语言强化

台词不是中文时,建议在台词前明确语言:

女孩用日语轻声说:{もう大丈夫です}

当台词文本是英语,但模型说成中文,或者需要控制地区语言习惯时,可以在台词前进一步明确语言。推荐公式:

FORMULA

台词语言 + 地区变体或口音 + 表达方式 + 说话人 + {台词内容}
EXAMPLE

台词语言:美式英语。女孩用自然、口语化的美式英语说:{I thought you weren’t coming.}台词语言:地道的洛杉矶美式英语。年轻男子用自然的洛杉矶口语说:{No way, you actually made it.}
SECTION02

亮点技法

 
2.1

多素材创作:让模型知道每个场景该使用什么

可以组合使用图片、视频和音频。素材较多时,提示词的重点不是把全部素材都写进同一句话,而是明确人物、道具、场景、动作和声音之间的对应关系

推荐按照下面的顺序组织:

ORDER

逐份素材职责 → 主体映射 → 按类型分组 → 主体设定 → 分场景调用
STEP 01

为不同主体逐一命名

不同人物、商品和道具需要分别绑定素材:

<人物A>对应@图片1,只采用外貌、发型和服装。
<人物B>对应@图片2,只采用外貌、发型和服装。
<道具A>对应@图片3,只采用结构、材质和颜色。
<场景A>参考@图片4,只采用空间布局、建筑和光线,不采用图中人物。
不要写成“@图片1至@图片4分别定义四名角色”

这种写法没有明确哪张图片对应哪个角色。

STEP 02

按类型整理素材

【人物】
<修复师>对应@图片1,只采用外貌、发型和服装。
<记录员>对应@图片2,只采用外貌、发型和服装。
<布展员>对应@图片3,只采用外貌、发型和服装。
<讲解员>对应@图片4,只采用外貌、发型和服装。
四人的外貌、服装、动作、站位和台词不互相交换。【道具】
<样本盒>对应@图片5,只属于<修复师>。
<记录板>对应@图片6,只属于<记录员>。【场景】
<修复室>参考@图片7,只采用空间、材质和光线。
<展厅>参考@图片8,只采用空间、材质和光线。【动作与声音】
@视频1用于<修复师>打开样本盒的动作,不采用视频中的人物和场景。
@音频1用于<讲解员>的音色和指定台词。
STEP 03

集中描述重要主体

当同一人物需要跨场景使用多份素材时,可以增加主体设定:

【主体设定:修复师】
外貌与服装:@图片1。
固定道具:@图片5中的<样本盒>。
出现地点:<修复室>和<展厅>。
动作参考:@视频1的开盒动作、@视频2的放置样本动作。
不采用:其他人物的服装,不持有<记录板>或讲解设备。
STEP 04

按场景调用素材

场景一|修复室检查
使用:<修复师>、<样本盒>、<修复室>和@视频1的开盒动作。
事件:<修复师>在工作台前打开样本盒并检查内部样本。
结束时:<修复师>停在工作台内侧,样本盒始终位于<修复师>自身右手旁,也就是位于画面左侧。场景二|展厅登记
使用:<记录员>、<记录板>和<展厅>。
事件:<记录员>在展柜旁核对记录板上的编号。
结束时:记录板仍由<记录员>双手持有,其他人物不进入展柜区域。

多素材创作的目标是让模型在当前场景中选择正确素材,不要求所有素材同时出现在画面中。

2.2

30 秒长视频:用阶段和结束状态组织事件

事件较多时,建议把故事拆成连续阶段。每个阶段只安排一个主要状态变化,并写清楚该阶段结束时画面中可以直接看到的状态。

TEMPLATE / 长视频模板

【生成目标】
生成一段<视频类型>。核心主体是<主体>,主要事件是<故事概要>。【阶段一】
开始时:<人物、道具和场景的初始状态>。
主要事件:<一个主要动作或事件>。
结束时:<人物位置、道具归属或画面状态>。【阶段二】
承接上一阶段:<需要保持的状态>。
主要事件:<一个主要动作或事件>。
结束时:<可观察状态>。【阶段三】
主要事件:<收束事件>。
结束时:<最终画面状态>。【保持一致】
保持<人物身份、数量、服装、道具归属、空间方向和声音关系>稳定。
EXAMPLE / 一般示例

花店订单包装流程

生成一段花店订单包装流程说明视频。<花艺师>和<店员>共同完成花束整理、包装和交付。

1

阶段一
开始时

<花艺师>站在工作台后,桌面放有散开的花枝、剪刀和包装纸。
主要事件

<花艺师>整理花枝并修剪长度。
结束时

花束握在<花艺师>左手,剪刀放回工作台右侧。
2

阶段二
承接上一阶段

两人保持相同身份和服装,花束仍由<花艺师>持有。
主要事件

<店员>展开包装纸,<花艺师>放入花束并系上绿色丝带。
结束时

包装完成的花束平放在工作台中央,丝带结朝向镜头。
3

阶段三
主要事件

<店员>拿起花束并放到取货架上。
结束时

花束只在取货架中央,两人站在工作台后方检查成品。
保持一致

保持<花艺师>和<店员>的身份、服装、工作台方向、剪刀位置和花束归属稳定。

时间戳与节奏控制

普通叙事优先使用“阶段”。只有关键交接、进出场、转场或明确节拍需要控制时,再使用以 1 秒为单位的时间表达。时间区间适合分配剧情节奏,时间点适合指定一次关键事件,相对时间适合描述事件之间的等待关系。

EXAMPLE

0-5秒:展示空置的木质展示台;一只手放下白色陶盘;结束时手已离开,展示台中央只有白色陶盘。
5-10秒:移走白色陶盘,再放下透明玻璃杯;结束时展示台中央只有透明玻璃杯。
10-15秒:移走透明玻璃杯,再放下绿色陶瓶;结束时展示台中央只有绿色陶瓶。
时间区间

0-3秒……3-7秒……7-12秒……
明确时间点

第5秒,镜头快速向左横移并完成转场。
相对时间

人物按下按钮3秒后,房间灯光逐渐熄灭。

时间段应连续、不重叠。时间段表示事件的时间预算,不是精准剪辑点,动作可能在边界附近提前或延后。一个时间段中的内容过少会增加模型的发挥空间,内容过多则可能造成过度切镜或剧情遗漏。

不要用时间戳控制“一秒完成三次动作”等频率
2.3

编辑 / 首尾帧 / 延长任务类型参数规则

视频编辑、首帧或首尾帧生视频、视频延长会根据输入素材自动锁定部分生成参数,具体规则如下。

AUTO LOCK

三类任务的比例与时长规则

视频编辑

画幅比例

自动保持输入视频的比例,不支持另行设置

时长

自动基本保持输入视频的时长,不支持另行设置;受输入帧处理影响,可能存在最大约 0.3 秒的差异
首帧或首尾帧生视频

画幅比例

自动使用首帧图片的比例;首帧与尾帧应使用相同画幅,避免尾帧被拉伸

时长

支持设置
视频延长

画幅比例

自动保持输入视频的比例,不支持另行设置

时长

支持设置

这些任务中被自动锁定的参数不能在生成页面或接口中另行指定,其余参数以当前可用选项为准。

2.4

视频编辑:明确母版、修改范围和保持内容

编辑已有视频时,先把原视频定义为唯一母版,再说明编辑对象、作用范围、目标素材和保持内容。编辑任务的输出比例自动保持输入视频比例,输出时长自动基本保持输入视频时长,这两项不支持另行设置;受输入帧处理影响,输出时长可能存在最大约 0.3 秒的差异;差异通常来自过渡帧处理,整体内容和事件顺序仍基本保持。

通用编辑写法

TEMPLATE / 模板

【编辑目标】
编辑@视频1,在<全片或明确时间段>对<画面对象、区域或声音类别>进行<增加、移除、替换或调整>。【原视频职责】
@视频1是唯一编辑母版,负责<人物、场景、动作、构图、镜头、遮挡关系、声音和事件顺序>。【目标素材职责】
@图片1或@音频1用于<目标对象或声音的指定属性>。【编辑范围】
只处理<对象、区域、时间段或声音类别>。【保持内容】
保持@视频1中的<不应变化的画面、动作、声音和时间关系>。
EXAMPLE / 示例

【编辑目标】
编辑@视频1,只在4-7秒把画面右侧墙面的冷蓝色灯光调整为暖橙色灯光。【原视频职责】
@视频1是唯一编辑母版,负责人物、房间布局、动作、构图、镜头运动、声音和事件顺序。【编辑范围】
只调整右侧墙面及其照亮区域的光线颜色;人物肤色随环境光自然变化。【保持内容】
人物身份、服装、表情、位置、动作、房间结构、镜头运动、对白和环境声保持@视频1。
CASE A

主体替换

模板

【编辑目标】
编辑@视频1,只把<原对象>修改为<目标对象>。【原视频职责】
@视频1是唯一编辑母版,负责原始场景、机位、镜头运动、动作轨迹、遮挡关系和事件顺序。【目标素材职责】
@图片1用于<目标对象>的<外观、结构或材质>,不采用<无关背景、人物或构图>。【编辑对象与范围】
只修改<明确对象和区域>。全片目标对象数量为<数量>。不修改<需要保持的内容>。【时间线继承】
<目标对象>继承<原对象>每次出现、运动、遮挡和离开的时点、持续时长、路径与速度变化。
除以上明确修改对象或区域外,@视频1中的其他人物、道具、场景内容、镜头运动、镜头切换和事件顺序保持原样。
示例

【编辑目标】
编辑@视频1,只把视频中的黄色折叠台灯替换为@图片1中的白色折叠台灯。【原视频职责】
@视频1是唯一编辑母版,负责书桌、书本、手部动作、机位、镜头运动、遮挡关系和事件顺序。【目标素材职责】
@图片1只用于白色折叠台灯的外观、结构和材质,不采用图片中的背景、构图或其他物体。【编辑对象与范围】
全片始终只有一盏白色折叠台灯。只替换原黄色折叠台灯,不修改书本、书桌、手部和背景。【时间线继承】
白色折叠台灯继承原黄色折叠台灯每次出现、转动灯臂、被手遮挡和离开画面的时点、路径与速度变化。
除以上明确修改对象或区域外,@视频1中的其他人物、道具、场景内容、镜头运动、镜头切换和事件顺序保持原样。
CASE B

背景替换

模板

【编辑目标】
编辑@视频1,只把<原背景区域>替换为@图片1中的<目标环境>。【原视频职责】
@视频1是唯一编辑母版,负责人物、前景物体、动作、构图、镜头运动和事件顺序。【目标素材职责】
@图片1只用于<目标环境>的空间布局、材质、景深、环境色和光线方向,不采用图片中的人物或前景物体。【编辑对象与范围】
只修改<主体轮廓之外的背景区域>。不修改<主体身份、五官、发型、服装、表情、位置、大小和动作>。【时间线继承】
人物动作与遮挡关系保持@视频1。除以上明确修改对象或区域外,@视频1中的其他人物、道具、场景内容、镜头运动、镜头切换和事件顺序保持原样。
示例

@视频1是唯一编辑母版,负责人物、动作、构图、镜头和事件顺序。
@图片1只提供日间玻璃温室的空间布局、景深、环境色和光线方向,不采用图片中的人物。只把@视频1中人物轮廓之外的浅灰色背景替换为@图片1中的日间玻璃温室。
人物身份、五官、发型、服装、表情、位置、大小和抬手动作保持@视频1。
除以上明确修改对象或区域外,@视频1中的其他人物、道具、场景内容、镜头运动、镜头切换和事件顺序保持原样。

声音编辑

对白、语言、音色、背景音乐和音效可以分别处理。提示词需要写清说话人或声音类别、目标变化,以及其他声音是否保持。

编辑@视频1,只移除原有背景音乐,保留人物对白、口型、环境声和动作音效;画面内容、镜头和剪辑节奏保持@视频1。编辑@视频1,把<讲解员>的台词语言调整为自然的美式英语,台词内容和说话时点保持不变;其他人物声音、背景音乐、环境声和画面保持@视频1。
2.5

视频延长:先对齐边界画面,再描述前置或后续内容

视频延长是在原视频边界之外继续创作。输出比例自动保持输入视频比例,延长时长由用户设置。

BOUNDARY

两个方向的边界画面

原视频向前延长向后延长首帧尾帧边界画面必须连续

向后延长时,延长片段的第一个画面需要承接原视频尾帧;向前延长时,延长片段的最后一个画面需要衔接原视频首帧。除了边界画面,还要保持人物、道具、背景、运动趋势和声音连续。

向后延长

先描述原视频尾帧的连续状态,再描述尾帧之后发生的内容。

TEMPLATE / 基础模板

@视频1是需要向后延长的原视频。向后延长@视频1。延长片段的第一个画面直接承接@视频1的尾帧:保持<主体姿态与朝向>、<道具位置>、<背景与空间关系>、<机位与构图>、<光线>、<声音状态>和<运动趋势>连续。随后,<描述需要延长的新动作、事件、镜头或声音>。延长过程中保持<人物身份与服装>、<关键道具>、<背景布局>、<摄影轴线>和<原有声音环境>连续。
同一主体始终保持为同一个连续对象,不重复、不分裂;人物外形或物体部件数量保持稳定。
EXAMPLE / 示例

@视频1是需要向后延长的原视频。向后延长@视频1。延长片段的第一个画面直接承接@视频1的尾帧:保持同一固定中景、橙色纸飞机的位置与朝向、教室窗边背景、午后光线和向画面右侧飞行的趋势连续。随后让橙色纸飞机继续向画面右侧滑行并飞出画面,窗边白色纱帘轻微摆动。镜头和教室背景保持原视频尾帧状态。
WITH REFS

向后延长:有其他参考素材时

先逐一说明其他素材负责什么,再明确原视频负责延长边界。其他素材可以提供人物、道具或声音,但不能替代原视频尾帧对起始画面的控制。

模板

@图片1定义<人物A>的面部特征。
@图片2定义<人物A>的服装。
@图片3定义<关键道具>的结构与材质。
@视频1是需要向后延长的原视频。向后延长@视频1。延长片段的第一个画面直接承接@视频1尾帧:保持<边界画面与声音状态>连续。随后,<人物A使用关键道具完成的新动作或事件>。延长过程中保持<人物身份与服装>、<关键道具>、<背景布局>、<摄影轴线>和<原有声音环境>连续。
同一主体始终保持为同一个连续对象,不重复、不分裂;人物外形或物体部件数量保持稳定。
示例

@图片1定义<园艺师>的面部特征。
@图片2定义<园艺师>的浅绿色工作围裙。
@图片3定义<藤编花篮>的结构与材质。
@视频1是需要向后延长的原视频。向后延长@视频1。延长片段的第一个画面直接承接@视频1尾帧:保持温室工作台、<园艺师>的站位和<藤编花篮>的位置连续。随后,<园艺师>双手提起<藤编花篮>并把它放到身后的木架中层。延长过程中保持<园艺师>的面部、围裙、温室布局和镜头方向连续。

向前延长

先描述原视频开始之前发生的内容,再把原视频首帧写成延长片段的明确结束状态。只写“随后承接原视频”可能使模型提前引入后续人物或特效,或者到达目标状态后再次改变画面。

TEMPLATE / 基础模板

@视频1是需要向前延长的原视频。向前延长@视频1。在原视频开始之前,<描述前置动作、事件、镜头或声音>。延长片段的最后一个画面自然衔接@视频1首帧:<主体姿态与朝向>,<道具位置>,<背景与空间关系>;保持<机位与构图>、<光线>、<声音状态>和<运动趋势>与@视频1首帧一致。延长过程中保持<人物身份与服装>、<关键道具>、<背景布局>、<摄影轴线>和<原有声音环境>连续。
同一主体始终保持为同一个连续对象,不重复、不分裂;人物外形或物体部件数量保持稳定。
EXAMPLE / 示例

@视频1是需要向前延长的原视频。向前延长@视频1。在原视频开始之前,呈现同一座玻璃温室空镜:晨雾贴近地面缓慢散开,顶部遮阳帘逐渐升起,画面中暂时没有人物。延长片段的最后一个画面自然衔接@视频1首帧:保持温室中央通道、两侧种植台、玻璃框架、柔和晨光和固定广角构图与@视频1首帧一致;结束时遮阳帘已经完全升起,通道中没有人物,叶片仍在轻微摆动。
WITH REFS

向前延长:有其他参考素材时

逐一声明素材职责,并说明哪些素材在向前延长片段中使用、哪些只在原视频开始后使用。这样可以减少后续人物、道具或特效被提前带入前置片段。

模板

@图片1定义<人物A>的面部特征。
@图片2定义<人物A>的服装。
@图片3定义<关键道具>的结构与材质。
@视频1是需要向前延长的原视频。向前延长@视频1。在原视频开始之前,<人物A完成前置动作或事件>。延长片段的最后一个画面自然衔接@视频1首帧:<人物A的姿态与朝向>,<关键道具的位置与状态>,<其他人物的站位>;保持<背景与空间关系>、<机位与构图>、<光线>、<声音状态>和<运动趋势>与@视频1首帧一致。延长过程中保持<人物身份与服装>、<关键道具>、<背景布局>、<摄影轴线>和<原有声音环境>连续。
同一主体始终保持为同一个连续对象,不重复、不分裂;人物外形或物体部件数量保持稳定。
<只在原视频开始后出现的素材>不在向前延长片段中提前出现。
示例

@图片1定义<策展员>的面部特征。
@图片2定义<策展员>的深蓝色工作外套。
@图片3定义<木质展示盒>的结构与材质。
@图片4定义两名<布展助理>的灰色工作服。
@图片5定义<展陈准备室>的空间和光线。
@视频1是需要向前延长的原视频。向前延长@视频1。在原视频开始之前,<策展员>走到工作台前,拿起闭合的<木质展示盒>并打开盒盖。延长片段的最后一个画面自然衔接@视频1首帧:<策展员>站在画面中央,双手托住打开的<木质展示盒>;两名<布展助理>分别站在其身后左右两侧。保持竖屏正面中景、工作台位置、准备室背景和左侧晨光与@视频1首帧一致。

边界画面应追求视觉上的自然衔接,不应理解为逐像素完全相同。

延长结果的音量可能与原视频存在轻微变化;使用同代模型生成的视频继续延长时,画面与声音通常更容易自然衔接。验收时需要同时检查边界前后的画面、声音和完整延长片段。

SECTION03

进阶玩法

 
3.1

关键帧、分镜与白模参考

首尾帧与参考素材

在多模态参考模式中,可以直接在提示词首句写明@图片1作为首帧、@图片2作为尾帧,不必切换到单独的首尾帧模式。系统会以首帧画幅锁定输出比例,时长由生成页面或接口设置;首帧与尾帧应使用相同画幅,比例不一致时尾帧可能出现拉伸。其余参考图仍可分别定义人物、道具、场景和材质。

TEMPLATE / 基础模板

@图片1作为首帧,定义视频开始时的构图、主体位置、姿态、道具状态、场景和镜头方向。
@图片2作为尾帧,定义视频结束时的构图、主体位置、姿态、道具状态、场景和镜头方向。
@图片3用于<主体A>的<外貌、服装、结构或材质>,不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。
@图片4用于<主体B、道具或场景>的<指定属性>,不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。<描述一个连续动作或事件>。
画面从@图片1定义的首帧自然开始,经过连续动作后到达@图片2定义的尾帧。
首尾之间保持<人物身份、道具结构与归属、场景布局和镜头方向>连续。
EXAMPLE / 示例

@图片1作为首帧,定义视频开始时香水工坊的构图、人物位置、姿态、桌面道具状态和镜头方向。
@图片2作为尾帧,定义视频结束时香水工坊的构图、人物位置、姿态、桌面道具状态和镜头方向。
@图片3用于<调香师>的面部、发型和深绿色围裙,不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。
@图片4用于<玻璃香水瓶>的造型、材质和标签位置,不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。<调香师>从首帧姿态开始,拿起滴管和<玻璃香水瓶>,把琥珀色香精滴入瓶中,轻轻摇匀并盖好瓶塞,再把成品放到桌面中央,最后自然到达@图片2定义的尾帧。
首尾之间保持<调香师>的身份与服装、香水瓶数量与结构、木桌布局、暖色侧光和镜头方向连续。
每张锚点图需要单独说明

不要合并成“图片1和图片2作为首尾帧”。首帧和尾帧应使用相同画幅。其他参考图只提供指定属性,不替代首尾帧的构图。

MULTI KEYFRAME

多关键帧顺序控制

当多张独立图片分别定义过程中的不同阶段时,提示词第一句先写“以@图片1至@图片N的顺序作为关键帧”,再逐张说明每张图对应的关键状态。独立关键帧通常比把多个画面拼在一张宫格图中更容易对齐,但它控制的是阶段顺序和关键状态,不等于逐帧复刻。

基础模板

以@图片1至@图片N的顺序作为关键帧。@图片1作为首帧,定义<开始时的构图、主体位置、姿态、道具状态和镜头方向>。
@图片2定义第二个关键帧:<第一阶段结束时的可见状态>。
@图片3定义第三个关键帧:<第二阶段结束时的可见状态>。
@图片N作为尾帧,定义<结束时的构图、主体位置、姿态、道具状态和镜头方向>。画面依次经过@图片1、@图片2、@图片3至@图片N定义的状态,各阶段之间使用连续动作自然过渡。
全过程保持<主体身份、道具结构与归属、场景布局、光线和摄影轴线>连续。
示例

以@图片1至@图片4的顺序作为关键帧。@图片1作为首帧,定义橙色纸飞机静置在教室木桌左侧,机头朝向画面右侧,固定中景。
@图片2定义第二个关键帧:同一架橙色纸飞机被一只手从桌面托起,机头方向不变。
@图片3定义第三个关键帧:同一架橙色纸飞机从窗边掠过,窗帘向右轻微摆动。
@图片4作为尾帧,定义同一架橙色纸飞机落在右侧书架中层,机头仍朝向画面右侧。画面依次经过@图片1、@图片2、@图片3和@图片4定义的状态,各阶段之间保持飞行方向和速度连续。
全过程保持纸飞机的橙色材质、大小与折痕,教室布局、午后侧光和镜头轴线连续。

宫格分镜与故事板

宫格分镜用于给出整体故事、镜头顺序和大致构图,不适合要求每格细节严格复刻。建议控制在15 格以内,使用简洁线稿或干净示意图并减少文字标注。提示词应明确读取顺序,再写出每格的主体动作、景别或运镜、最终画风和声音。

TEMPLATE / 基础模板

@图片1提供<N格宫格分镜>的镜头顺序和大致构图,按照<从左到右、从上到下>的顺序读取;不采用图中的<线稿画风、文字标注或占位人物>。
@图片2定义<主体A>的<外貌与服装>。
@图片3定义<关键道具或场景>的<结构、材质或光线>。镜头1:<景别、主体动作、场景状态>。
镜头2:<景别、主体动作、运镜或切换方式>。
……
镜头N:<结束动作和结束画面状态>。最终画面采用<视觉风格>,声音包括<对白、环境声、动作音效或音乐>。
EXAMPLE / 示例

@图片1提供四格陶艺制作分镜的镜头顺序和大致构图,按照从左到右、从上到下的顺序读取;不采用图中的线稿画风和文字标注。
@图片2定义<陶艺师>的面部、短发和深灰色围裙。
@图片3定义<蓝釉杯>的杯身比例、釉面颜色和弧形杯把。镜头1:广角呈现安静的陶艺工作室,<陶艺师>坐在拉坯机前。
镜头2:中景侧拍<陶艺师>双手扶住旋转的湿陶坯,杯身逐渐成形。
镜头3:特写手指修整杯口与杯把连接处,泥浆沿指尖缓慢滑落。
镜头4:中近景呈现烧制完成的<蓝釉杯>被放上木架,<陶艺师>收回双手。最终画面采用写实纪录片质感,保留拉坯机转动声、湿泥摩擦声和工作室环境声。

白模参考与渲染

白模参考分为粗粒度白模和细粒度白模。粗粒度白模主要提供动作、动线、站位、运镜、切镜、光影和声音等时序信息;细粒度白模已经具有完整结构,主要用于材质、色彩、人物、场景和视觉风格的重渲染。先判断白模负责运动骨架还是完整建模,再选择对应写法。

COMPARE

两类白模的分工

粗粒度白模

适合情况

用简单几何体预演动作、动线、站位、运镜或切镜

素材要求

几何体关系清楚,动作序列完整;可叠加人物、道具和场景图片

提示词重点

逐一映射白模主体,并说明继承哪些时序与空间信息
细粒度白模

适合情况

已有完整建模,需要更换人物、材质、色彩、场景或风格

素材要求

模型结构完整且画面干净,避免轨迹线、坐标线和相机锥体

提示词重点

保持结构、动作和镜头,明确需要重渲染的属性
粗粒度白模

粗粒度白模适合锁定动作轨迹、运动方向、人物站位、进出场、机位路径、切镜位置、光影变化和声音节奏。白模中的每个几何体都应单独映射到最终主体或道具;人物、道具和场景外观可以由其他参考图片定义。

MAPPING

白模信息 → 需要说明的内容

动线

动作轨迹、运动方向、人物站位和进出场顺序
运镜

机位、镜头路径、运动方向和速度变化
光照

光线方向、明暗变化和变化发生的时机
切镜

切镜位置,以及切镜前后的主体与构图
声音

是否继承对白、音乐、环境声或动作音效

优先使用关系清楚的简单几何体。手臂、翅膀等附属结构只有在动作序列完整时才适合作为白模信息,否则容易造成动作僵硬或结构误判。

TEMPLATE / 基础模板

@视频1是粗粒度白模参考,仅提供<动作路径、人物站位、机位、运镜、切镜、光影变化、声音节奏或空间关系>,不采用其中的白模外观、材质和场景。
@视频1中的<白模主体A>对应<主体A>。
@视频1中的<白模主体B或几何道具>对应<主体B或关键道具>。
@图片1定义<主体A>的<外貌、服装或结构>。
@图片2定义<主体B、关键道具或场景>的<指定属性>。<主体>在<场景>中完成<主要动作或事件>。
保持@视频1中的<动作路径、站位、运镜、切镜、光影或声音节奏>。
最终画面采用<人物、场景、材质和视觉风格>,声音包括<对白、环境声或动作音效>。
EXAMPLE / 示例

@视频1是粗粒度白模参考,仅提供人物行走路径、展车移动方向、固定机位、一次推镜和两次切镜,不采用其中的灰色几何体外观与空白场景。
@视频1中的高圆柱体对应<讲解员>。
@视频1中的长方体对应<移动展车>。
@图片1定义<讲解员>的面部、蓝色制服和胸牌。
@图片2定义<移动展车>的白色金属框架和透明展罩。
@图片3定义科技展厅的弧形墙面、灰色地面和顶部条形灯。<讲解员>推着<移动展车>沿弧形墙面前进,在中央展台前停下并打开透明展罩。
保持@视频1中的行走路径、主体站位、推镜方向和切镜位置。
画面采用明亮写实的展馆纪录片风格,保留脚步声、车轮声和展厅环境声。
细粒度白模

细粒度白模已经具备完整人物、道具或场景结构,适合更换材质、色彩、人物形象、场景和整体视觉风格。白模画面应尽量干净,不要保留轨迹线、坐标轴、控制器或相机锥体等制作标记。

TEMPLATE / 基础模板

@视频1是细粒度白模参考,保持<主体结构、动作、空间布局、机位、运镜和切镜>,不采用原有灰模材质和空白背景。
@图片1定义<主体>的<人物形象、材质、颜色或表面细节>。
@图片2定义<场景>的<空间、材质、光线或视觉风格>。将@视频1中的<主体>重渲染为<最终主体>,场景重渲染为<最终场景>。
保持@视频1中的<结构、动作、镜头和空间关系>,画面呈现<材质、色彩和风格>,声音包括<环境声、音效或音乐>。
EXAMPLE / 示例

@视频1是细粒度白模参考,保持环形装置的完整结构、三层圆环转动关系、展台位置、环绕运镜和切镜,不采用原有灰模材质与空白背景。
@图片1定义装置外环的拉丝黄铜材质。
@图片2定义内层叶片的半透明蓝色玻璃材质。
@图片3定义当代艺术展厅的白色曲面墙、深灰地面和顶部柔光。将@视频1中的环形装置重渲染为黄铜与蓝色玻璃组成的动态雕塑,场景重渲染为当代艺术展厅。
保持@视频1中的结构、转动节奏、环绕运镜和切镜,保留装置低沉转动声与安静的室内环境声。
3.2

一键成片

一键成片适合把多张图片,或图片与风格参考视频,组织成具有统一节奏和包装风格的完整视频。提示词需要说明每份素材的职责、图片顺序、画面动态、剪辑节奏、视觉包装和声音;不要只写“把这些素材做成视频”

ORDER

素材职责 → 图片顺序 → 动态幅度 → 剪辑风格 → 视觉包装 → 声音
TEMPLATE / 基础模板

【素材职责】
@图片1用于<人物、商品、场景或开场画面>。
@图片2用于<人物、商品、场景或过程画面>。
@图片3用于<人物、商品、场景或结尾画面>。
@视频1仅用于<剪辑节奏、转场、字幕包装或音乐风格>,不采用其中的人物身份和场景(可选)。【编排方式】
图片按照<上传顺序、指定顺序或主题自由编排>出现。
<说明需要保持的人物、商品、地点和事件关系>。【画面动态】
每张图片采用<轻微Live动效、视差、推拉、横移或局部动作>。
保持<主体外观、商品结构、文字或背景关系>稳定。【成片风格】
采用<剪辑节奏、转场方式、字幕或图形包装、色彩风格>。【声音】
包括<对白、环境声、音效或音乐>。
EXAMPLE

夜市旅行短片

素材职责

@图片1用于夜市入口和开场环境。
@图片2用于<旅行者>沿街行走的画面。
@图片3用于灯笼摊位和手工艺细节。
@图片4用于三位朋友围桌用餐。
@图片5用于河边夜景和倒影。
@图片6用于三人在桥边合影的结尾画面。
@视频1仅用于轻快剪辑节奏、手绘贴纸和转场方式,不采用其中的人物身份与地点。
编排方式

画面按照@图片1至@图片6的顺序出现,形成“到达夜市、沿街游览、用餐、散步、合影”的完整过程。
保持三位朋友的外貌与服装稳定,不互相混合。
画面动态

环境图片采用缓慢推近和轻微视差;人物图片只增加自然眨眼、转头、举杯和衣物随风摆动。
保持摊位结构、餐桌位置和桥边栏杆稳定。
成片风格

采用明快的旅行短片节奏,场景之间使用自然遮挡和相近色彩衔接,手绘贴纸只出现在画面边缘。
声音

保留夜市人声、餐具轻响和河边风声,配合轻快但不过分抢眼的器乐音乐。

图片顺序重要时,应逐张写明出现顺序;允许模型自由编排时,也要明确写出“可按主题自由编排”。涉及多个人物或多个商品时,仍需逐一命名并绑定素材。

3.3

视频无缝转场

视频无缝转场是在两段视频之间生成连续的过渡内容。提示词需要先说明哪一段是转场前视频、哪一段是转场后视频,再写清触发动作、镜头运动、画面如何变化、最终到达的状态和声音衔接。

ORDER

转场前视频 → 转场后视频 → 触发动作 → 镜头运动 → 画面变形 → 到达状态 → 声音
FIVE WAYS

五种转场方式的写法重点

俯冲或折返

说明镜头方向、速度变化,以及何时进入下一场景
人物旋转

说明人物姿态、旋转方向,以及服装或背景如何连续变化
前景遮挡

说明遮挡物何时覆盖全屏,以及遮挡后出现的构图
物体变形

说明前后物体对应的形状、材质和变形过程
推拉或焦点变化

说明镜头运动、焦点对象,以及前后空间的连续关系
TEMPLATE / 基础模板

@视频1是转场前片段,采用其<尾部主体、动作、构图、镜头方向和声音>。
@视频2是转场后片段,采用其<开头主体、构图、镜头方向和声音>。
保持@视频1和@视频2原有片段中的<人物身份、商品结构、场景和主要动作>稳定。在@视频1尾部,<主体或前景物>通过<动作>触发转场。
镜头<运动方向和速度变化>,画面中的<形状、材质、光线或空间>逐渐变化为@视频2开头的<对应元素>。
转场结束时自然到达@视频2的开头构图,并保持<主体位置、镜头方向和运动趋势>连续。
声音从<前段声音>平滑过渡到<后段声音>。
EXAMPLE / 示例

@视频1是转场前片段,采用雨夜街道、红色雨伞、缓慢向前推近的镜头和雨声。
@视频2是转场后片段,采用展厅圆形天窗、向上抬升的镜头和安静室内混响。
保持两段原视频中的人物、街道、展厅结构和主要动作稳定。在@视频1尾部,红色雨伞靠近镜头并逐渐覆盖整个画面,触发转场。
镜头继续向前推进,雨伞的圆形边缘逐渐变成展厅天窗的金属圆环,红色伞面逐渐过渡为天窗透入的白色天光。
转场结束时自然到达@视频2开头的仰拍构图,镜头由向前推进平滑转为向上抬升。
雨声逐渐减弱,并平滑过渡为展厅内的脚步回声。

无缝转场的目标是让画面与声音自然衔接。提示词可以要求保持两段原视频的主要内容,但不能把生成式过渡理解为逐像素不变的剪辑拼接。

3.4

情绪方向与可观察表现

只写“紧张、温馨、压抑”等情绪词,模型可以理解整体方向,但具体表演方式会有更多发挥空间。如果希望稳定控制人物演技,建议写明眼神、眉头、嘴角、呼吸、视线和手部动作等能够直接看到或听到的表现。

不必罗列所有面部细节。单次情绪转折通常选择 2 至 4 个最明确的表现即可;只有当情绪包含多次转折时,才需要按触发事件分阶段描述。

DEFAULT

单次情绪转折:默认写法

整体情绪从<起始情绪>转为<结束情绪>。
发生<触发事件>后,<主体>先出现<即时可观察反应>。
随后,<眼神、眉头、嘴角、呼吸、视线或手部动作>逐渐发生<变化>。
最终,<主体>以<克制或明确的外在表现>表达<目标情绪>。
MULTI STAGE

多阶段情绪:按触发事件递进

听到或看到<第一个触发事件>时,<主体的第一个可观察反应>。
当<第二个触发事件>出现后,<主体的表情、视线或呼吸发生的变化>。
确认<关键信息>后,<主体试图克制或掩饰的情绪>通过<可观察表现>逐渐显现。
最终,<主体的最终动作、表情或说话方式>。
EXAMPLE / 示例

舞台后方传来演出结束的掌声。年轻演员握住节目单的手指突然停住,视线缓慢转向幕布方向,肩膀仍然紧绷。
确认谢幕后,她先轻轻呼出一口气,肩膀逐渐放松,嘴角浮现克制的微笑,眼眶慢慢湿润,但始终没有转身离开。
3.5

专业摄影术语

基础镜头语言和热门运镜方式可以直接写进提示词。术语较少见、可能存在多种理解,或需要精确控制画面变化时,应同时说明术语作用于谁、画面如何变化,以及希望看到的结果。

BASIC

基础镜头语言

景别

大全景、全景、中景、近景、特写
运镜

推、拉、摇、移、跟、环绕、俯冲、后拉、上摇、手持晃动
机位与视角

低角度、俯视、第一人称
POPULAR

七种热门运镜的建议写法

以下热门的运镜方式可以直接使用;若画面中有多个主体,仍需说明运镜围绕谁、从哪里开始、到哪里结束。

一镜到底

说明镜头连续经过的主体、空间和事件顺序
希区柯克变焦

说明主体保持的大小,以及背景空间被拉近或推远的效果
航拍视角

说明俯视高度、移动方向和需要展示的环境范围
FPV

说明第一人称飞行或穿行路径、速度和转向
子弹时间

说明被冻结或放慢的动作,以及镜头环绕方向
手持镜头

说明跟拍对象和晃动程度,避免只有“手持感”而没有镜头目标
回弹变速

说明动作在哪个节点加速、减速或回弹,以及最终停留状态

过于小众的摄影术语

过于小众、行业含义不统一或模型可能不熟悉的术语,应保留术语名称,同时把它翻译成可以直接观察的画面变化。

FORMULA

专业术语 + 作用主体 + 画面变化 + 前景/背景关系 + 方向或速度
移焦:焦点从前景树叶平滑转移到背景人物。树叶逐渐虚化,背景人物的面部由模糊变得清晰。

涉及精确转场时,还要写清触发时刻、遮挡物、镜头运动方向、切换方式,以及切换后需要保持的构图或运动趋势。

FIVE EXAMPLES

摄影表达示例

示例 1 · 浅景深人像

<糕点师>的眼睛和面部保持清晰,身后的玻璃罐和灯光虚化成柔和圆形散景。
示例 2 · 追随摄影

镜头与<滑板者>同速水平移动,人物保持清晰,街边墙面形成从右向左的水平拖影。
示例 3 · 黄金时刻

暖色低角度阳光从<登山者>左后方照入,山脊地面形成较长阴影。
示例 4 · 自然暗角

画面四角逐渐变暗,中心<钢琴演奏者>的亮度和肤色保持正常,不出现黑色边框。
示例 5 · 甩镜转场

第5秒镜头快速向左横移;前景书架完成整屏遮挡时切换到下一场景,切换后镜头继续保持向左运动和相近速度。

光圈、焦距和快门数值可以写入提示词,但最终画面的可见结果通常比单独写一个数值更明确。

SECTION04

提交前检查

 
是否说清楚了主体和主要动作或事件?
每份参考素材是否明确说明采用什么、不采用什么?
不同人物、商品和道具是否逐一命名并绑定素材?
多素材是否按场景选择,而不是要求全部同时出现?
长视频的每个阶段是否只有一个主要变化,并写清结束状态?
人物数量、服装、道具归属和空间关系是否稳定?
视频编辑是否明确唯一母版、修改范围、目标数量和保持内容?
抽象情绪和摄影术语是否对应了可以直接看到或听到的表现?
首尾帧和多关键帧是否逐张说明职责,首帧与尾帧是否使用相同画幅?
宫格分镜是否写清继承的结构;白模是否先判断粗粒度或细粒度,并写清需要继承的时序、结构、材质和风格?
视频编辑、首尾帧生成和视频延长是否遵循自动锁定的比例与时长规则?
视频延长是否同时检查边界画面、运动趋势和声音连续性?
一键成片是否说明素材职责、图片顺序、动态幅度、剪辑风格和声音?
无缝转场是否写清两段视频的职责、触发动作、过渡过程和到达状态?
SECTION05

使用边界

 
BOUNDARIES

九条能力边界

01

时间戳只能用于分配事件节奏,不是帧级剪辑点。
02

视频编辑提示词可以提高关键事件与原视频对齐的概率,但不能保证逐帧完全重合。
03

多素材创作的重点是正确选择和组合素材,不是让所有素材同时出现。
04

必须完全准确的字幕、公式、标牌、产品参数和帧级时间点,建议通过前期合成好的素材+视频生成+后期制作完成。
05

视频编辑会锁定输入视频比例和基本时长;这两项不支持另行设置,输出时长与输入视频可能有最大约 0.3 秒的差异。
06

首帧或首尾帧生成会以首帧画幅锁定比例,时长可以设置;首尾图比例不同可能使尾帧出现拉伸。
07

视频延长会锁定输入视频比例,延长时长可以设置;延长片段的音量可能与原视频存在轻微差异。
08

一键成片中,如果图片顺序或人物对应关系重要,需要在提示词中明确指定。
09

视频无缝转场追求视觉与声音连续,不代表两段原视频能够逐像素保持不变。
SECTION06

指南声明

 

本指南中的示例仅用于说明提示词写法。实际生成效果可能受到输入素材、任务复杂度和生成参数影响。

本文由作者@小互AI,原创/授权发布于平台,未经许可禁止转载。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 素材职责映射那段是这版指南里最见功底的部分。素材一多,模型确实容易搞混谁是谁。把每份素材的角色、不采用什么、跨场景怎么继承都写清楚,系列短片和广告分集的连续性才有基础。

    来自广东 回复