图生视频提示词公式:首帧到动作的三段写法

图生视频提示词公式:首帧到动作的三段写法
图生视频提示词公式三段写法示意图:首帧画面、动作运镜、节奏收束的分镜卡片

把图生视频提示词当成一句话去写,是画面僵住的头号原因。三段公式把首帧、动作、收束拆开,各管各的事,中段那两句就是画面动不动的分水岭。同一张底图、18次删词对照,这篇把每一段到底能不能省都验证了一遍。

图生视频提示词公式说白了就三段:首帧写画面,中段写动作,尾段写节奏。顺序不能乱,段落不能省。我拿同一张咖啡杯底图连做了18次对照,把中段那两句删掉之后,画面当场僵住——杯子不动,热气不飘,镜头也不推,四秒看下来就是一张会轻微抖动的照片。

图生视频提示词公式的三段各管什么

首帧段写画面里已有的东西,中段写主体做什么、镜头怎么走,尾段管节奏和时长,三段拼齐才是一份能让画面动起来的完整指令。拆开看,每一段的职责其实非常清楚。

首帧段最容易犯的错,是把画面重新形容一遍,却漏了「谁在哪」。首帧图本身已经把构图定死了,提示词要做的是用文字把图里的关键元素点名一遍:主体是什么、在什么位置、什么光。这一段写细一点,模型后面动起来才不容易把主体认丢。我习惯用三五个短句交代,控制在四十个字以内。

中段是整套公式的发动机。主体做什么,用动词开头写;镜头怎么走,单独成句,推、拉、摇、跟,一次只给一个动作。写过文生视频的朋友应该有体感:动作和运镜挤在一句话里,模型经常只执行前半个指令,后面那句直接被吞掉。图生视频更挑剔,因为首帧把起点锁死了,你只能告诉它从这张图出发往哪走。

尾段管收束。节奏是快是慢、整段几秒、结尾停在哪,写一句就够。别小看这句,同一个中段动作,加上「结尾回到初始构图,全程匀速」,和什么都不加,出片的完成度差出一截。

如果对首帧怎么描述还没把握,可以配合着看这篇ai图生视频提示词怎么写:让首图动起来的指令写法,那边讲首帧的描述思路,这边讲三段怎么组装。

逐段删词实测:删掉中段,画面就僵在原地

同一张底图分六组测了18次,删掉中段动作句的组全部画面僵住,保留中段的组14次动态明确,中段是三段里唯一不能省的。过程比结论更有意思,展开讲讲。

时间是8月26日晚上,地点就是我家的书桌,主角是一只冒着热气的白瓷马克杯照片。我原本只想验证一个模糊的感觉:图生视频出片时灵时不灵,问题多半出在中段。于是把提示词拆成三段,每次只动一段,其余原样保留,一组跑三次,六组下来正好18条片子。

结果比我预想的干脆。删掉中段的两组,六条片子全部僵住。对,就是僵住,热气不飘,镜头不推,个别条目里杯子还出现了轻微的变形抖动,像信号不好。只删尾段的组,画面会动,可节奏乱,有一条杯子动着动着直接跳了一下,剪辑感很重的突变。完整三段的组最稳,六条里五条能直接用。

提示词版本保留内容出片表现(每组3次)我的评价
完整三段首帧+中段+尾段6条里5条动态自然,节奏稳闭眼用
删中段首帧+尾段3条全部僵住,近乎静止等于白跑
删尾段首帧+中段会动但节奏乱,出现过跳帧碰运气
只留首帧只写画面动态随机,全看模型心情纯抽卡
只留中段只写动作主体会动,但长得不太像原图偏得厉害
中段双动作动作塞了两个执行了一半,两条动作打架贪多必翻

老实讲,测之前我以为首帧段才是命门,毕竟图都给模型了。测完才发现反了:首帧描述缺失,模型会自己从图里猜元素,猜错顶多主体漂移一点;中段缺失,模型干脆不知道要动,直接给你一张四秒的静图。顺便说一句,那晚测完我还顺手用剩下的一次额度生成了一条猫打哈欠的,纯属好奇,结果也印证同一件事——没有中段动作句,猫的下巴就停在半路。

可照抄的三段模板和改词顺序

模板按「首帧点名元素,中段一个动词加一个运镜,尾段定节奏定秒数」来填,改词先改动词,再改运镜,最后动尾段,改一处跑一次。下面直接给能套的版本。

还用那只马克杯举例,方括号换成你自己的内容:

[首帧] 画面里是一只白瓷马克杯,放在木桌左侧,杯口有热气,暖色晨光从右边打进来。
[中段] 热气缓慢升腾变淡;镜头缓慢向右平移,始终对准杯子。
[尾段] 全程匀速,时长四秒,结尾停在与首帧相同的构图。

三个注意。动作动词一次只给一个,想要热气飘再加镜头动,分两句写,别挤在一起。运镜幅度用「缓慢」「轻微」这类限定词收着,写猛了模型容易一口气把镜头甩完,后面两秒没东西可动。尾段的秒数按平台上限留点余量,我一般写四秒,实际生成四到五秒都接得住。

改词顺序也固定:出片僵住,先加重中段动词;动作太猛,先收运镜副词;都不行再回头改首帧描述。一次只改一处,改完就跑,别连改三处,不然你永远不知道是哪一处起了作用。这套分项调试的笨办法,跟文生视频里镜头、动作、时长拆开调的思路是一脉相承的,图生视频只是多了一个被锁死的首帧而已。

回到开头那只马克杯。18次对照跑完,它现在能稳稳冒出四秒热气,而几天前它还是一张僵图。三段公式不神秘,它只是逼你把「让画面动起来」这个模糊愿望拆成三句各司其职的话。首帧管住起点,中段给出方向,尾段收住节奏。中段尤其别省,画面僵住的情况,九成是它被删掉了。

常见问题

三段公式对所有图生视频工具都适用吗?

主流图生视频工具都吃这一套,差别只在尾段。有的平台不单独设时长参数,靠尾段那句秒数提示来控制;有的有独立时长选项,尾段就可以只写节奏和收尾构图。结构通用,细节按平台微调。

首帧图质量差,提示词能补救吗?

能救一部分。首帧段把构图和光线描述得越明确,模型纠偏的空间越大,但模糊、元素混乱的底图依然容易翻车。实测里最稳的出片,底图本身就是清晰的静物照,提示词只是顺着图写,不是逆着图改。

中段动作写两三个会怎样?

我的对照里专门有一组中段塞了双动作,结果是动作打架:模型通常只执行前一个,后一个被吞掉,偶尔两条动作各做一半互相干扰。想要画面丰富,宁可拉长单个动作的持续描写,也别并列两个动词。

提示词写中文还是英文?

写你改起来最顺手的语言。国内工具中英都认,海外工具英文命中率略高一点,但这个差距远没有三段结构本身带来的差距大。先把结构写对,再考虑换语言,顺序别反。

延伸阅读