长提示词的问题
大多数失败的生成,源于提示词"想做的事太多"。一段 200 字、同时描述灯光、氛围、镜头、动作、服装和配乐的段落,会让模型无法判断哪个最重要。结果通常是"哪里都没错,但哪里都不对"。
解决办法是结构化:用一个小而可复用的模板,替代大段文字。
四行提示词模板
- 主体:画面里是谁 / 是什么。一行,写具体("穿红色夹克的女士",而不是"一个人")。
- 动作:主体在做什么。一个动词或一个短短语。
- 场景:发生在哪里。包含时间、天气、地点。
- 风格:画面感觉。电影感、手持感、纪录片感、动漫感 —— 取决于参考视频传达的。
示例
参考视频:一位厨师在忙碌的厨房中摆盘。
- 主体:一位袖子卷起的年轻厨师
- 动作:仔细地摆盘一块煎过的鱼
- 场景:晚餐高峰的开放式厨房,暖色灯光
- 风格:电影感手持镜头,浅景深
组合起来:"A young chef with rolled sleeves carefully plates a piece of seared fish in an open kitchen at dinner rush, warm lighting, cinematic handheld, shallow depth of field."
为什么这个结构有效
- 模型能拿到清晰的层级:谁、做什么、在哪里、长什么样。
- 每一行都很短,不会有哪一行"抢戏"。
- 可以直接对应到反向提示词 —— 把每一行取反就行。
- 你可以一行一行地 A/B 测试。
迭代时不要全篇重写
如果结果不对,只改一行,而不是整个提示词。如果主体没问题,但灯光不对,那就只改场景那一行。这样把变量隔离开,你才能看清到底是什么在影响模型。
再叠一层反向提示词
四行模板稳定之后,再叠一层简短的反向提示词。应用自带的默认值覆盖了基础项;再加入与你场景相关的:"no watermark"、"no subtitles"、"no extras in the background"。
把成功存下来
如果某个提示词产出了一段你真的愿意发的视频,把那段原话存下来。随着时间推移,你会积累一个"已知有效"的提示词库,专门用于你常拍的主题。这个库会成为你的竞争优势 —— 每次新生成都从一个已经赢过的起点出发。