核心区别
图片反推提示词主要提取主体、构图、镜头、光线、色彩和材质等静态事实。视频反推提示词在此基础上还要提取关键帧角色、动作顺序、时间节奏、镜头运动、开始与结束状态以及连续性约束。
完整对比
| 比较项 | 图片反推 | 视频反推 |
|---|---|---|
| 主要输入 | 单张图片或多张参考图 | 视频、关键帧序列或首尾帧 |
| 核心证据 | 单一时刻的视觉事实 | 多个时刻之间的变化关系 |
| 主要输出 | 静态 Prompt、风格 DNA、负面约束 | 首尾帧、时间线、Motion Prompt、连续性约束 |
| 时间信息 | 通常不需要 | 必须表达顺序、速度、停顿和持续时间 |
| 镜头信息 | 机位、尺度、焦段感、景深 | 静态镜头信息加上推进、跟随、平移或环绕路径 |
| 常见风险 | 主体与风格混淆、形容词堆积 | 锚点过多、动作跳变、身份与空间漂移 |
| 适合任务 | 图生图、画面复现、风格提取 | 图生视频、镜头复现、动作与节奏分析 |
什么时候使用图片反推提示词?
- 需要复现一张画面的构图与光线。
- 想提取某种视觉风格并迁移到其他主体。
- 需要整理产品、人物、建筑或场景的静态生成规格。
- 只有单张参考图,没有可靠的时间证据。
图片反推不应猜测复杂动作。没有时间证据时,可以把动作写成创作假设,但要与观察到的事实分开。
什么时候使用视频反推提示词?
- 需要复现已有视频中的动作链路。
- 需要判断哪些帧应该作为生成锚点。
- 要明确镜头运动和人物动作的先后关系。
- 需要建立首帧、尾帧和连续性检查条件。
视频反推的重点不是逐帧描述,而是用最少的关键状态解释完整变化。
如何选择?
只有静态参考图时先做图片反推,再人为设计 Motion Prompt;有完整视频时先做视频全量反推,再从中提取风格 DNA 和平台执行稿。多张关键帧但没有原视频时,可以采用中间方案:把帧按时间排序,明确哪些关系是观察事实,哪些只是推断。
组合使用的推荐流程
- 用图片分析锁定主体、环境和视觉风格。
- 用视频分析确定动作、镜头和时间线。
- 把身份、服装、材质与空间关系放入连续性约束。
- 根据目标平台的长度和能力编译最终执行稿。