一个简单、适合病毒视频克隆的提示词结构

August 16, 2026
别再用长段落提示词和 AI 较劲了。试试这个简短、可复用的结构,得到稳定、可发布的结果。

长提示词的问题

大多数失败的生成,源于提示词"想做的事太多"。一段 200 字、同时描述灯光、氛围、镜头、动作、服装和配乐的段落,会让模型无法判断哪个最重要。结果通常是"哪里都没错,但哪里都不对"。

解决办法是结构化:用一个小而可复用的模板,替代大段文字。

四行提示词模板

  1. 主体:画面里是谁 / 是什么。一行,写具体("穿红色夹克的女士",而不是"一个人")。
  2. 动作:主体在做什么。一个动词或一个短短语。
  3. 场景:发生在哪里。包含时间、天气、地点。
  4. 风格:画面感觉。电影感、手持感、纪录片感、动漫感 —— 取决于参考视频传达的。

示例

参考视频:一位厨师在忙碌的厨房中摆盘。

  • 主体:一位袖子卷起的年轻厨师
  • 动作:仔细地摆盘一块煎过的鱼
  • 场景:晚餐高峰的开放式厨房,暖色灯光
  • 风格:电影感手持镜头,浅景深

组合起来:"A young chef with rolled sleeves carefully plates a piece of seared fish in an open kitchen at dinner rush, warm lighting, cinematic handheld, shallow depth of field."

为什么这个结构有效

  • 模型能拿到清晰的层级:谁、做什么、在哪里、长什么样。
  • 每一行都很短,不会有哪一行"抢戏"。
  • 可以直接对应到反向提示词 —— 把每一行取反就行。
  • 你可以一行一行地 A/B 测试。

迭代时不要全篇重写

如果结果不对,只改一行,而不是整个提示词。如果主体没问题,但灯光不对,那就只改场景那一行。这样把变量隔离开,你才能看清到底是什么在影响模型。

再叠一层反向提示词

四行模板稳定之后,再叠一层简短的反向提示词。应用自带的默认值覆盖了基础项;再加入与你场景相关的:"no watermark"、"no subtitles"、"no extras in the background"。

把成功存下来

如果某个提示词产出了一段你真的愿意发的视频,把那段原话存下来。随着时间推移,你会积累一个"已知有效"的提示词库,专门用于你常拍的主题。这个库会成为你的竞争优势 —— 每次新生成都从一个已经赢过的起点出发。

一个简单、适合病毒视频克隆的提示词结构 | FacelessReels