看图写提示词怎么做?画面要素到指令的还原

看图写提示词怎么做?画面要素到指令的还原
图片推提示词五格要素清单手写还原示意

开门见山:看图写提示词,靠的不是工具反推,而是一份五格要素清单——主体、环境、光线、风格、构图逐格打勾,一张普通照片就能还原出能出图的指令。先挑一张你手机里的照片,照着文末模板走一遍。

图片推提示词这件事,不装任何工具也能干:把画面拆成五个格子,逐格回答问题,再连成一条指令,还原度足够日常出图用。很多人卡在这一步,是因为一上来就盯着成图找"神级关键词",顺序反了。

正确顺序是先看后写。眼睛先把图拆开,手上才有东西可写。下面这份清单和那次实测,都是我拿真图一遍遍磨出来的。

图片推提示词的五格清单法

图片推提示词的核心动作是把画面拆成五个格子:主体、环境、光线、风格、构图,每格只回答一个问题,打完勾再连成一条指令。

每个格子只负责一件事,混着看就容易漏。我给自己定的规矩是一条格子一个问题,答不上来就留空,绝不硬编。

  • 主体:图里最不能错的东西。数量、动作、穿着、朝向,一样一问。
  • 环境:主体在哪。室内室外、天气、前后景各有什么。
  • 光线:光从哪边来,硬还是软,偏暖还是偏冷。
  • 风格:照片感、插画、水彩还是3D。这格允许主观,写实和风格化差一个词,出图差一个次元。
  • 构图:景别、视角、主体在画面里站哪个位置。

模板直接抄:

  • 主体:____(几个、在做什么、穿什么)
  • 环境:____(地点、天气、前后景)
  • 光线:____(方向、软硬、色温)
  • 风格:____(媒介加质感词)
  • 构图:____(景别、视角、位置)

留空比硬编强。编出来的格子最会带偏出图,你以为写了细节,模型拿到的却是一个不存在的东西。

一张朋友照片的手写还原实录

拿五格清单还原一张实拍照片,全程手写约8分钟,改两轮后出图的还原度能到八成,漏掉的格子会立刻在图里露馅。

2026年8月17日,朋友小舟在杭州一条老巷里拍了张照片发我:雨刚停,青石板路积着水反光,一位大爷撑黑伞背对镜头往巷子深处走,两侧白墙斑驳,头顶横着几股电线,整张偏冷的青灰调。

说实话,我第一反应是想直接丢给反推工具的。话说回来,那天我偏想知道手写到底能到几成,于是打开备忘录照着五格打勾,写了大概8分钟,得到这条指令:雨天傍晚的老巷,青石板路面反光积水,一位穿深色外套的老人撑黑伞背对镜头走向巷子深处,两侧白墙斑驳带水渍,头顶横着杂乱电线,冷灰色调,写实照片感,中景平视,老人位于画面中下部。

第一轮出图四张,三张把光的方向弄反了,影子全打在人物前面。挺离谱的,我明明写了"傍晚"。回头对格子才发现,我只写了时间,没写光的软硬和方向。第二轮在光线格补上"乌云压着的漫射光,没有明确投影",第三轮基本对上了。我个人给第三轮打80分,扣掉的20分在伞的褶皱和白墙水渍的分布。

更有意思的是对照组。我把"电线"那格故意删掉再跑,出图立刻变成一张干净的旅游宣传照,味道全变了。真不是玄学,一格就是一处画面记忆点。

手写法和工具反推法,准确度差在哪?

画面越简单,手写还原越准,工具容易把细节洗成泛泛的风格词;复杂画面上工具抓材质和参数更稳,两种方法各管一段。

光说不算数。我挑了五张复杂度不同的照片做对照,一边手写五格,一边丢给反推工具,各自出图再跟原图比,结果摆在这里:

画面类型手写五格法工具反推我的选择
简单图,单一主体加纯背景两三轮能对上,还原度约八成常脑补出原图没有的元素手写
中等复杂,两三个元素约8-10分钟,容易漏小物件十几秒出结果,漏得比手写少看任务急不急
复杂图,人多景密主干还行,漏项明显变多材质、镜头参数抓得细工具打底再手改

简单图上手写更准,这事我一开始也没想到。挺意外的。想想又通:工具反推爱给"安全描述",把"杂乱电线"这种具体物件洗成"街巷氛围",把"背对镜头"这种关键朝向直接略过,出图自然变成一张谁都能拍的大路货。手写会漏,但漏得明明白白,对着格子就知道缺哪;工具是暗着错,你根本不知道哪句是它编的。

工具也不是没用。复杂图上,它的材质词和镜头参数词确实省事,主流反推工具的准确率水平,这篇图片转提示词怎么用?反推工具的准确率实测测得更细。

反推结果跑偏了怎么补,另一篇逆推提示词怎么做?看图反写的准确度和修补里给了一套修补顺序。

后来小舟问我那张图是怎么做出来的,我把五格清单发给他,他自己花了十来分钟也还原出一条能用的指令。图片推提示词练的是眼力,不是手速:格子打全了,指令就在那里等着你连起来。下次刷到喜欢的画面,别急着存图,先在心里把五个格子过一遍。

常见问题

五格清单必须按固定顺序打勾吗?

不用。顺序只影响写得顺不顺,主体格永远先答,剩下四格颠倒没关系。真要固定一个顺序,就按主体、环境、光线、风格、构图来,写多了会形成肌肉记忆。

还原出来的指令用中文还是英文写?

看你用的模型吃哪套。国内模型中文指令就够,部分海外模型对英文短语的响应更稳。拿不准就中英各写一版跑同题对比,五分钟分出高下。

照片里有人脸,还原时要注意什么?

别追求还原长相,靠文字锁不出一张具体的脸。写穿着、动作、神态和景别就够了,不要写真实人名,也不要拿熟人照片去生成可识别的肖像。

某一格完全看不出答案怎么办?

留空。比如光线软硬实在判断不了,就跳过这格先出图,看结果缺什么再回头补。硬编一个格子,等于给模型塞了一条错误线索。

延伸阅读

光线格总答不好,可以看ai光影提示词怎么写?光线方向和氛围词,把方向词和氛围词一次补齐。