什么是视频反推提示词?
直接答案:视频反推提示词是从现有视频中提取主体状态、场景、镜头、动作阶段、节奏和连续性约束,再整理成可供视频生成模型执行的首尾帧描述与 Motion Prompt。运动反推提示词重点描述动作起点、变化路径、速度、运镜和结束状态。
高质量结果应该回答四个问题:开始时画面是什么状态、过程中发生什么变化、结束时落到什么状态、哪些身份和空间关系不能改变。

第一步:选择有作用的关键帧
关键帧不是越多越好。应按用途区分:
- 开始锚点:生成任务的稳定初始状态。
- 结束锚点:动作完成后的稳定落点。
- 观察帧:用于判断动作路径、速度、表情变化和遮挡关系,但不一定作为生成输入。
- 转折帧:动作方向、镜头运动或场景状态发生明显改变的位置。
如果相邻帧只包含轻微重复变化,可以保留信息更清楚的一帧,避免模型把冗余画面误读为多个事件。
第二步:分开静态 Prompt 与运动反推提示词
| 信息类型 | 应该描述什么 | 不应混入什么 |
|---|---|---|
| 静态画面 Prompt | 主体、服装、环境、构图、镜头尺度、光线、色彩、材质 | 先后顺序、速度、持续时间 |
| Motion Prompt | 动作起点、变化路径、节奏、镜头运动、结束状态 | 与动作无关的冗长美学形容词 |
这一步可以减少两个常见问题:静态图被迫“做动作”,以及视频模型只复现画面风格却没有完成动作链路。
第三步:把动作写成时间线
时间线需要体现因果和节奏,而不是机械平均切段。例如:
0-5 秒:人物闭眼,目光内收,头部轻微下沉。 5-10 秒:表情先发生变化,随后头部平稳抬起。 10-15 秒:目光移向左前方人物并保持稳定注视。
动作较少时,可以使用“开始—变化—稳定”的三段结构;镜头复杂时,再增加转折点和镜头运动阶段。
第四步:写明连续性约束
- 人物身份、面部、发型和服装保持一致。
- 机位、画面方向和人物空间关系保持一致。
- 动作衔接平滑,不突然跳帧或改变姿态。
- 没有明确需要时,不增加手部、道具、字幕或新人物。
- 光线与背景变化必须有场景内原因。
连续性约束应具体指出“保持什么”和“避免什么”,比笼统写“画面稳定、高质量”更有效。
第五步:组织最终输出
镜头:单镜头中近景,机位稳定,主体位于画面右侧。 首帧:主体闭眼,头部微低,空间关系与光线状态明确。 动作:主体短暂停顿后抬头,将目光移向左前方并保持注视。 节奏:表情变化先于头部动作,动作结束后保持稳定。 连续性:身份、服装、构图、环境和画面方向不变。 负面约束:无镜头切换,无额外人物,无手部突然入镜。
常见错误
把所有帧都当作生成锚点
这会让模型同时追逐过多状态。应该把多数帧当作观察证据,只保留必要的开始、结束和转折锚点。
只描述结果,不描述变化路径
“人物抬头”没有说明从什么状态开始、以什么节奏完成、结束后是否保持。动作路径越清楚,可控性越高。
风格词覆盖动作信息
大量“电影感、超清、精美”会稀释真正的动作约束。风格 DNA 与运动方案应分栏保存,最后按平台限制精简。