GPT-6 Astra提示词技巧:让新模型听话的五个写法
GPT-6 Astra提示词技巧的答案是做减法,不是堆料。新模型不吃彩虹屁那一套,我把五个常见写法逐一开关对比,反例示范把返工从平均2.8轮压到1.2轮,老咒语「一步步思考」反而帮倒忙。先删再加,比往里塞东西管用得多。
GPT-6 Astra提示词技巧这件事,我这几天被问最多的版本是:旧提示词原样搬过去,为什么突然不灵了。我的结论先放这——不是不灵,是收益结构变了。以前靠堆形容词、堆客套话能换来那点质量,新模型默认就给;你真正要花力气的地方,换到了别处。
先交代背景。Astra 9月初的发布不算顺利,The Verge 的报道提到首批付费用户一度被锁在门外,Altman 道歉之后才陆续放开(The Verge 的持续报道)。我拿到资格是9月5日晚上,九点半开的第一个会话,干的第一件事就是把手里那套用了两年的提示词原样丢进去。结果能跑,但平平。有点像换了台新烤箱,还用旧纸杯蛋糕的配方,烤出来没错,也没惊喜。
实验怎么做的:一个任务,五个开关,二十次一轮
我把五个写法拆成独立开关,每个开关单独打开跑20次,用同一批真实工作任务盲评打分,只认返工轮数和盲评分两个指标。
任务选了两件我每周都得干的活:把一小时访谈录音的转写稿整理成一页决策简报;给一个内部工具写版本更新公告。一个偏整理,一个偏写作,都不刁钻,但足够日常——提示词好不好,日常任务上才看得出来。
基线指令就一句:「把这份转写稿整理成决策简报。」六个组分别是:基线、只开角色扮演、只开格式约束、只开反例示范、只开步步思考、只开背景压缩。每组跑20次,一共120次。评分隔两天做,免得当天心情掺水;主要记两样——要追问几轮才达到能用(返工轮数),以及1到5分的盲评分。
顺带跑题一句:这模型这两周里还顺手打通关了游戏Portal,据外媒算账花了571.18美元的token。我一个整理简报的跟它比实在寒酸。拉回来,继续说开关。
GPT-6 Astra提示词技巧:五个写法逐个开,收益差得很远
五个写法的收益排序是反例示范、格式约束、背景压缩、角色扮演、步步思考,第一个让返工近乎砍半,最后一个在新模型上是负分。
角色扮演开场(「你是一位有十年经验的资深编辑」):盲评分3.1对基线3.0,几乎没动。有两回它还接了戏,公告写得文绉绉,像给投资人看的。老实讲,这个写法可以退休了,新模型自己知道该怎么端专业架子。
格式约束(先给三条结论、固定字段、整份不超过400字):一次过率从35%提到70%,返工从2.8轮降到1.9轮。收益实打实。Astra默认话多,你不给容器,它就给你倒一桶。
反例示范(把上一份不满意的产出贴回去,标出「结论埋在第四段」「简报里混进了我的评论」这两处毛病):返工平均1.2轮,盲评分4.2,全场最高。这一条也是唯一让我起鸡皮疙瘩的——它不只改那两处,还会自己顺着找同类毛病。第三次实验时,它把一条我忘了写的免责声明补上了,位置对,语气也对。
关于「标出毛病」,我后来搭配让模型分情况讨论的指令一起用,边界场景的处理明显稳了,写法可以看之前那篇临界条件提示词怎么写,思路是通用的。
步步思考(「请一步一步思考后再输出」):负收益。盲评分掉到2.7,简报写成流水账,思考过程占了快一半篇幅。旧模型的咒语,在新模型上是累赘——它内部本来就走得通,你非要它把草稿吐出来。没救了,直接扔。
背景压缩(背景材料从七行压到三行,只留受众、用途、禁忌三项):盲评分3.4,小幅为正。我试了下反过来——把七行长背景整段贴回去,它反而抓错重点,把背景里的旧数据当成了新结论。料多,不等于情浓。
汇总一张表(主观判断列是我自己的体感,不背书):
| 开关 | 平均返工轮数 | 盲评分 | 我的判断 |
|---|---|---|---|
| 反例示范 | 1.2 | 4.2 | 必开 |
| 格式约束 | 1.9 | 3.9 | 必开 |
| 背景压缩 | 2.3 | 3.4 | 顺手开 |
| 角色扮演 | 2.7 | 3.1 | 无所谓 |
| 步步思考 | 3.1 | 2.7 | 删掉 |
基线是2.8轮、3.0分,放在这当参照。表不算漂亮,数字也只是我一个人的样本,但方向够清楚了。
为什么反例比夸奖好使
反例示范给出的是可对照的具体缺陷,模型能从「错在哪」反推「对长什么样」,比正向形容词的信息密度高一个量级。
我想了几天为什么是这样。夸奖类提示词(「专业一点」「深度思考」)给的是模糊目标,模型只能猜你要哪种专业;反例给的是确定的排除项——别埋结论、别混私货。错法是有限的,排掉了,剩下的就是对。说实话,这更接近纠错,而不是许愿。
9月8日早上我又做了一轮小验证:同一个简报任务,只贴反例、不写一句正面要求。20次里17次一次过。我把结果截图发给同事,他回了句「那你这两年的提示词库白写了」。扎心,但差不多是实话。
所以你只带走一条的话:翻出最近一次不满意的AI产出,花两分钟标出毛病,贴进提示词。比任何模板都快。
回到开头那个问题——旧提示词为什么不灵了。不是玄学,它们大部分篇幅都在做新模型已经默认会做的事。五个开关测下来,真正值钱的是把「错」讲清楚、把「形」框出来,其余都可以删。我现在的提示词比两年前短了一半,效果反而好。这大概是Astra给我最反直觉的一课:模型越强,指令越要省着写。
常见问题
换上 GPT-6 Astra 之后,旧提示词要全部重写吗?
不用。先删后加:删掉角色扮演和「一步步思考」这类旧咒语,加上反例示范和格式约束。我实测里基线指令本身就能跑,只是平平,真正拖后腿的是那些多余部分。
反例示范会不会把模型带偏,只盯着我提过的毛病?
这120次里我没观察到这个现象,多数时候它会顺着找出你没提的同类问题。保险起见,反例控制在两三个具体缺陷,别把不满情绪写成一大段,模型会误以为整篇都要推翻。
没有 Pro 订阅,现在能用上 Astra 吗?
截至发稿的公开口径是 Pro、Enterprise 和 Business Premium 用户可用,全量时间没有官方说法,等就好。上面五个写法里,格式约束和反例示范在旧模型上也成立,不必非等新模型。
这套对照实验的方法能搬到别的模型上吗?
能,而且建议搬。五个开关、每组20次、盲评打分,成本不高,一晚上能跑完一轮。每个模型脾气不一样,别人给的结论只能当起点,自己跑出来的那组数字才算数。