抽取关键帧
选择开始、结束和变化明显的中间帧。首尾帧作为生成锚点,中间帧负责证明动作路径,而不是把每一帧都塞进最终 Prompt。
视频反推提示词,是把视频中可观察的画面和时序变化转成可生成的文字结构:每一帧负责“此刻是什么样”,跨帧分析负责“如何从起点变化到终点”。
直接把整段视频概括成一段话,常会漏掉动作先后、停顿和镜头稳定性。分层处理能让每类证据承担明确职责。
选择开始、结束和变化明显的中间帧。首尾帧作为生成锚点,中间帧负责证明动作路径,而不是把每一帧都塞进最终 Prompt。
逐帧记录人物、服装、姿态、构图、光线和背景。这样可防止模型在分析运动时反过来改写已经确认的静态外观。
把主体动作、速度曲线、物理反馈、镜头响应和结束状态按因果顺序合并,再分别输出即梦、可灵等平台可用的版本。
真实处理记录 · 2026-08-03
以下来自本地项目的一条真实反推记录。原始视频约 15.045 秒,智能选择 7 张关键帧,其中首帧和尾帧为硬锚点。这里只展示实际分析证据,不展示未经验证的“生成后对比”,也不把同一素材的两次运行伪装成两个案例。



主体为长黑发、齐刘海、穿深蓝白条纹水手领服装的年轻女性;左侧前景人物仅有失焦肩背轮廓,身份不可确认。构图为平视越肩近景,背景高度虚化,主镜头基本稳定。
人物关系、动作心理动机、是否真实流泪和极轻微机位修正都无法仅凭离散帧确认,因此不写进事实层;同时禁止补全左侧人物面部、凭空新增拥抱或对白。
最终提示词应让模型知道主要事件、起点、路径和终点,同时避免把审计说明、模型猜测和所有逐帧细节原样复制进去。
连续或切镜模式、主要视觉事件、动作先后、速度变化、关键姿态、视线方向、环境运动、物理反馈、摄影机运动和明确的收束状态。
不确定项、身份对齐警告、质量检查、源文件路径、内部结构字段与分析依据。这些对人工复核有价值,但不适合作为生成正文。
首尾帧只能证明起点和终点,无法可靠表达中间动作、停顿、速度曲线、视线变化和短暂遮挡。中间关键帧能减少错误补全。
不是。过多相似帧会重复占用上下文;应选择状态变化明显、能证明动作路径的帧,并保留稳定的首尾锚点。
视觉反推与音频分析应分开。没有音频证据时不虚构对白、音乐或音效;需要声音时应单独提取节奏、环境声和对白。