看图写提示词怎么做?画面要素到指令的还原
开门见山:看图写提示词,靠的不是工具反推,而是一份五格要素清单——主体、环境、光线、风格、构图逐格打勾,一张普通照片就能还原出能出图的指令。先挑一张你手机里的照片,照着文末模板走一遍。
图片推提示词这件事,不装任何工具也能干:把画面拆成五个格子,逐格回答问题,再连成一条指令,还原度足够日常出图用。很多人卡在这一步,是因为一上来就盯着成图找"神级关键词",顺序反了。
正确顺序是先看后写。眼睛先把图拆开,手上才有东西可写。下面这份清单和那次实测,都是我拿真图一遍遍磨出来的。
图片推提示词的五格清单法
图片推提示词的核心动作是把画面拆成五个格子:主体、环境、光线、风格、构图,每格只回答一个问题,打完勾再连成一条指令。
每个格子只负责一件事,混着看就容易漏。我给自己定的规矩是一条格子一个问题,答不上来就留空,绝不硬编。
- 主体:图里最不能错的东西。数量、动作、穿着、朝向,一样一问。
- 环境:主体在哪。室内室外、天气、前后景各有什么。
- 光线:光从哪边来,硬还是软,偏暖还是偏冷。
- 风格:照片感、插画、水彩还是3D。这格允许主观,写实和风格化差一个词,出图差一个次元。
- 构图:景别、视角、主体在画面里站哪个位置。
模板直接抄:
- 主体:____(几个、在做什么、穿什么)
- 环境:____(地点、天气、前后景)
- 光线:____(方向、软硬、色温)
- 风格:____(媒介加质感词)
- 构图:____(景别、视角、位置)
留空比硬编强。编出来的格子最会带偏出图,你以为写了细节,模型拿到的却是一个不存在的东西。
一张朋友照片的手写还原实录
拿五格清单还原一张实拍照片,全程手写约8分钟,改两轮后出图的还原度能到八成,漏掉的格子会立刻在图里露馅。
2026年8月17日,朋友小舟在杭州一条老巷里拍了张照片发我:雨刚停,青石板路积着水反光,一位大爷撑黑伞背对镜头往巷子深处走,两侧白墙斑驳,头顶横着几股电线,整张偏冷的青灰调。
说实话,我第一反应是想直接丢给反推工具的。话说回来,那天我偏想知道手写到底能到几成,于是打开备忘录照着五格打勾,写了大概8分钟,得到这条指令:雨天傍晚的老巷,青石板路面反光积水,一位穿深色外套的老人撑黑伞背对镜头走向巷子深处,两侧白墙斑驳带水渍,头顶横着杂乱电线,冷灰色调,写实照片感,中景平视,老人位于画面中下部。
第一轮出图四张,三张把光的方向弄反了,影子全打在人物前面。挺离谱的,我明明写了"傍晚"。回头对格子才发现,我只写了时间,没写光的软硬和方向。第二轮在光线格补上"乌云压着的漫射光,没有明确投影",第三轮基本对上了。我个人给第三轮打80分,扣掉的20分在伞的褶皱和白墙水渍的分布。
更有意思的是对照组。我把"电线"那格故意删掉再跑,出图立刻变成一张干净的旅游宣传照,味道全变了。真不是玄学,一格就是一处画面记忆点。
手写法和工具反推法,准确度差在哪?
画面越简单,手写还原越准,工具容易把细节洗成泛泛的风格词;复杂画面上工具抓材质和参数更稳,两种方法各管一段。
光说不算数。我挑了五张复杂度不同的照片做对照,一边手写五格,一边丢给反推工具,各自出图再跟原图比,结果摆在这里:
| 画面类型 | 手写五格法 | 工具反推 | 我的选择 |
|---|---|---|---|
| 简单图,单一主体加纯背景 | 两三轮能对上,还原度约八成 | 常脑补出原图没有的元素 | 手写 |
| 中等复杂,两三个元素 | 约8-10分钟,容易漏小物件 | 十几秒出结果,漏得比手写少 | 看任务急不急 |
| 复杂图,人多景密 | 主干还行,漏项明显变多 | 材质、镜头参数抓得细 | 工具打底再手改 |
简单图上手写更准,这事我一开始也没想到。挺意外的。想想又通:工具反推爱给"安全描述",把"杂乱电线"这种具体物件洗成"街巷氛围",把"背对镜头"这种关键朝向直接略过,出图自然变成一张谁都能拍的大路货。手写会漏,但漏得明明白白,对着格子就知道缺哪;工具是暗着错,你根本不知道哪句是它编的。
工具也不是没用。复杂图上,它的材质词和镜头参数词确实省事,主流反推工具的准确率水平,这篇图片转提示词怎么用?反推工具的准确率实测测得更细。
反推结果跑偏了怎么补,另一篇逆推提示词怎么做?看图反写的准确度和修补里给了一套修补顺序。
后来小舟问我那张图是怎么做出来的,我把五格清单发给他,他自己花了十来分钟也还原出一条能用的指令。图片推提示词练的是眼力,不是手速:格子打全了,指令就在那里等着你连起来。下次刷到喜欢的画面,别急着存图,先在心里把五个格子过一遍。
常见问题
五格清单必须按固定顺序打勾吗?
不用。顺序只影响写得顺不顺,主体格永远先答,剩下四格颠倒没关系。真要固定一个顺序,就按主体、环境、光线、风格、构图来,写多了会形成肌肉记忆。
还原出来的指令用中文还是英文写?
看你用的模型吃哪套。国内模型中文指令就够,部分海外模型对英文短语的响应更稳。拿不准就中英各写一版跑同题对比,五分钟分出高下。
照片里有人脸,还原时要注意什么?
别追求还原长相,靠文字锁不出一张具体的脸。写穿着、动作、神态和景别就够了,不要写真实人名,也不要拿熟人照片去生成可识别的肖像。
某一格完全看不出答案怎么办?
留空。比如光线软硬实在判断不了,就跳过这格先出图,看结果缺什么再回头补。硬编一个格子,等于给模型塞了一条错误线索。
延伸阅读
光线格总答不好,可以看ai光影提示词怎么写?光线方向和氛围词,把方向词和氛围词一次补齐。