ai人物生成提示词怎么写?五官服装场景三层法
先给答案:ai人物生成提示词别把脸、衣服、背景糊成一句,拆成五官、服装、场景三层分开写,先锁脸再叠衣,最后铺环境。我拿同一张底稿连出十二张角色卡做了对照,服装层词序一动,跑脸的概率直接翻三倍。
ai人物生成提示词写到第五十多张的时候,我才想明白一件事:跑脸的锅,多半不在五官写得细不细,而在三层词的先后顺序上。结论先放这儿——把人物拆成五官、服装、场景三个词块,先锁脸、再叠衣、最后铺环境,出图的稳定性比一股脑堆一句高出不止一个档次。我做了组小对照,数据在第二部分,急的可以直接翻过去。
三层法是什么:五官、服装、场景各管一层
三层法就是把人物提示词按「脸—衣—景」拆成三个独立词块,每层只管自己的变量,出了问题哪层出错能一眼定位。
先说五官层。写五到八个词就够了,脸型、眼型、眉形、唇形、发色、发长,顶多再加一个表情。顺序有讲究:离脸越近的特质越要放前面,脸型永远打头,表情收尾。有人喜欢把五官写成一整句华丽的长描述,说实话没用,第五个形容词之后模型基本就开始自由发挥了。五官内部的取舍和优先级,我之前整理过一篇ai脸部提示词的五官描述优先级,这里不展开。
服装层管款式、材质、颜色。这层最容易写爆,尤其是颜色词,堆三个以上就开始跟脸抢权重,这是后面实验里最贵的一条教训。我个人觉得服装层控制在两个颜色词以内最稳,款式词可以多一点。
场景层最松。光线方向、背景内容、镜头距离,三样写清楚就行,它离人物主体最远,权重干扰也最小。
十二张角色卡实验:哪层词序打乱最容易跑脸
我拿同一张五官底稿做了三轮对照,每轮二十张:打乱五官层跑脸三张,服装层插错位置跑脸九张,场景层只有一张。
过程交代一下。上周六晚上,我给自己定了个活儿:用一张固定底稿出十二张不同服装、不同场景的角色卡,凑一套卡片用。第一轮顺手把服装词插到了五官中间,想着「反正词都在就行」。结果十二张里五张脸型变圆,还有两张瞳色直接从灰绿漂成了棕色。挺离谱的。
我怀疑是巧合,就补了个正式对照:512×768、每组二十张、同一个种子池,唯一的变量是词序。结果如下。
| 打乱的层 | 怎么打乱 | 二十张里跑脸 | 跑的部位 |
|---|---|---|---|
| 五官层 | 眼型和发色对调位置 | 3张 | 瞳色轻微漂移,脸型没动 |
| 服装层 | 服装词插进五官中间 | 9张 | 脸型变圆、五官整体挪位 |
| 场景层 | 光线词提到最前面 | 1张 | 几乎看不出差别 |
九比三比一,差距不是一点半点。服装层为什么这么脆?我的理解是:服装词天然携带颜色和材质,插进五官区域后,模型会把「红色」「丝绸」这类词的权重就近摊到脸上,脸自然就歪了。五官层内部对调反而不太要命,因为那几个词本来就该出现在脸附近。所以别信「词序无所谓」的说法,至少在人物生成里,真不是。
话说回来,这个实验只测了词序这一个变量,采样步数、CFG 这些参数我全程没动,结论的适用范围也就是「同一套底稿、同一台机器」的日常出图场景,别拿去当论文引用。
ai人物生成提示词的三层模板,直接抄
模板顺序固定为:脸型→五官→发色发型→表情→服装款式→服装颜色材质→姿势→场景→光线→镜头,跑脸时按服装、颜色词、场景的顺序倒查。
给一个能直接改的例子:「圆脸,杏眼,眉形平直,灰绿色瞳孔,黑色齐肩发,浅笑;米白色高领毛衣,深灰色呢子大衣;坐姿,图书馆窗边,午后侧光,上半身特写」。注意分号就是三层之间的缝,写的时候别把三层的词互相掺。
要换角色卡的时候,只动服装层和场景层,五官层一个字不改,这是十二张卡能看起来「像同一个人」的关键。想要更狠的锁定方案,可以配合sd角色一致性里固定脸型的做法一起用。
服装款式想换风格又不知道词怎么挑,从通勤到赛博的服装风格词库里扒几个现成的就行。
跑脸了怎么排查?我的固定顺序:第一步看服装词是不是插进五官区了,挪回服装层;第二步数颜色词,超过三个就删到两个;第三步看场景描述是不是太长,压到十五个词以内。三步走完还不行,再回头动五官层,顺序别反。
最后提醒一句正经的:AI生成的这张脸不属于任何真人,但也别拿它冒充某个真人的照片去发帖、带货或者做证件用途,涉及他人肖像和平台规则的红线,踩一次就够呛。
回到开头那句话:跑脸的锅不在脸。三层法真正给你的不是更漂亮的词,而是一个能定位问题的结构——脸歪了知道查哪层,衣服抢戏了知道挪哪块词。我那套十二张的角色卡,最后就是靠这套顺序在两小时内收工的,比头一晚瞎试省了至少一半时间。你下次出人物图,不妨先把三层的缝画出来。
常见问题
三层法适用哪些出图工具?
Stable Diffusion、Midjourney、即梦这类主流工具都适用,只是形态不同:SD 按词块加权更直接,MJ 需要把三层连成一个短语流,分号可以换成逗号,但「脸在前、景在后」的骨架别变。
十二张角色卡是不是每张都要重写提示词?
不用。五官层整块复制,每张只替换服装层和场景层的词块,我实测这样改一张卡只需要一分钟出头,而且一致性比每张重写好得多。
服装描述多了一定会把脸带歪吗?
不一定,取决于位置和颜色词数量。服装词老老实实待在五官之后,颜色词控制在两个以内,二十张里跑脸能压到一两张;插进五官中间就完全是另一回事了。
生成的AI人物图片可以随便发布吗?
发布前想清楚两件事:别让人误以为是真实人物照片,必要处标注AI生成;更别刻意模仿某个具体真人的长相去做商业内容,肖像权和平台规则都不站这边。