Minimax H3提示词怎么写?新模型的指令偏好实测

Minimax H3提示词怎么写?新模型的指令偏好实测
Minimax H3提示词写法实测:三种指令风格喂题得分对照

三种指令风格、三十道题、同一套评分标准跑完,Minimax H3 明显偏吃分镜结构化这一套。标签堆叠风得分垫底,自然语言段落风居中,差距比我想的大。这篇把每项得分、翻车现场和能直接套用的五行模板都摆出来。

Minimax H3提示词写法没有玄学。三十道题测下来,结论就一句:它吃结构,不吃形容词。你把镜头、动作时序、音频分行写清楚,出片的听话程度肉眼可见地往上跳;反过来堆一堆"电影感、8K、大师级构图",它大概率当没看见。下面从头讲。

先把口径对齐:H3 是个什么模型

截至发稿的公开口径,H3 是 MiniMax 开源的视频加同步立体声生成模型,单次最长 15 秒,开放权重托管在 Hugging Face 和魔搭。这个定位决定了它的提示词逻辑和文生图不是一回事。

官方开源页写得明白:两个变体,一个走文生视频加首尾帧控制,一个吃最多 9 张参考图加 3 段视频、3 段音频参照;开源权重原生 768p,API 端最高 2K。本地部署方面,pruned int8 整包下载约 42GB,12GB 显存的卡(3060 这一档)能出 480p。参数量官方没公布,我不瞎猜。这些数字都出自MiniMax H3 的开源页,属于截至发稿的口径。

为什么要先说这个?因为不少教程把 H3 当文生图模型讲提示词,一上来就是权重括号、负面词那一套。方向错了。H3 出的是 15 秒的片子,还带声音,你指挥的其实是一条时间轴,不是一张静态画布。

三种风格各喂十题,我这样测的

我把同一组题目改写成标签堆叠、自然语言段落、分镜结构化三种版本,每种十题,按主体、动作、镜头、音频四项各打 2.5 分。不满意不重抽,评的是"听懂了多少",不是抽卡运气。

题目池三十个,覆盖静物、人物动作、多阶段过程、天气氛围几类,每道题三种风格各跑一次。打分四项:主体还原、动作执行、镜头听懂程度、音频对位,满分 10。

这里头我最看重的是自己出的一道"陶罐碎片还原":让模型拍一段考古人员把一地碎陶片按纹路拼回完整罐子的画面。这题毒就毒在它有明确的先后顺序——先铺片、再对纹、最后合缝——顺序一乱,"还原"这个动作就不成立。上周四晚上十点半,我在出租屋那块 3060 上跑到这道题:标签堆叠版给我拍了个碎罐子静态特写,还加了层做旧滤镜;段落版拍到了拼接,但 15 秒里就一个"拿起碎片"的动作来回重复;结构化版,三段时序全对上,合缝那一下罐口还有一圈高光。有点意外,差距会这么大。

(跑题一句:测到二十几题时楼下开始装修,电钻声混进外放,害我把两段音频反复听了三遍才确认没被污染。拉回来。)

Minimax H3提示词写法:H3 吃哪一套

分镜结构化均分 8.1,自然语言段落 6.7,标签堆叠只有 4.9——H3 对分行指令和镜头语言的响应,明显好过关键词罗列。逐项拆开看更有意思。

指令风格均分(10 分制)最稳的题最翻车的题我的主观评价
标签堆叠4.9静物特写多动作序列词全喂进去了,它权当没看见
自然语言段落6.7单主体日常场景音频指令听话,但记不住顺序,后半段常被丢掉
分镜结构化8.1陶罐碎片还原要求画面出字幕闭着眼抄都稳,前提是每行只讲一件事

标签堆叠翻车的姿势很统一,翻得稀碎。十道题里有六道我写了"8K,HDR",出来的片子不是过曝就是泛着塑料感;有两次干脆在画面里生成了类似水印的字符牌。老实讲,这套词是文生图时代留下的老习惯,我自己也是顺手就打出来,改掉花了小半个晚上。

自然语言段落风的问题在"后半程衰减"。一段话前 40 字左右的指令它执行得很好,越往后越糊,写到第三个动作基本就丢了。段落里夹音频描述("伴随碎片轻响")更惨,十题只对上两次。相比之下,结构化风里音频单独占一行的,十题对上了七次,连立体声的左右移动都给出来了——碎裂声从左声道滚到右声道那次,我来回听了三遍。

还有一个发现想单独记一笔:条件句全灭。"如果有人入画就切特写"这种写法,H3 一次都没执行过,它不处理分支逻辑。写分情况讨论类的指令本来就是另一门手艺,我之前整理过一篇临界条件提示词怎么写,那套思路放在 H3 身上用不上,别硬套。

能直接抄的五行模板,和三个坑

模板五行就够:镜头、主体、动作时序、光线氛围、音频,一行只讲一件事,按 15 秒的时间轴排。拿陶罐那题当例子:

  • 镜头:固定机位微俯,缓慢推近(0-5 秒)
  • 主体:考古工作台上一地陶罐碎片,纹路朝上
  • 动作时序:先铺片对纹,第 8 秒左右合缝,结尾罐口对光
  • 光线氛围:室内暖黄台灯,尘埃在光柱里浮动
  • 音频:陶片轻碰的脆响,由近及远,右声道收尾

坑也一并说了。第一,别堆画质词,8K、HDR、超高清在 H3 身上基本是负分项。第二,一行别塞两个动作,"拼接并拍照记录"这种写法它只执行前一半。第三,别指望它生成字幕或条件逻辑,想要文字信息后期加,比在提示词里哀求靠谱得多。

回头再看开篇那句话:H3 吃结构,不吃形容词。它把"导演思维"的门槛直接写进了提示词里——你得先在脑子里把 15 秒拆成时间轴,它才接得住。三种风格、三十道题跑完,我自己的习惯已经彻底改了:动笔先分行。你要是还在用一大段话糊它,先试试这个最小的改动。

常见问题

H3 的提示词用中文还是英文?

我三十道题全用的中文,主体还原没有掉档,官方社区里的演示也以中文居多。英文长指令我没系统测过,不瞎下结论。

一条 H3 提示词最长写多少字合适?

结构化五行、一百字上下最稳。我的实测里超过 150 字的题,第三个动作之后的指令开始被丢掉,宁短勿长。

H3 能在提示词里指定声音吗?

能。官方口径是视频加同步立体声,我的实测里音频单独成行的十题对上了七次,埋在段落里的十次只中两次。想要什么声音,单独给它一行。

本地跑 H3 需要什么配置?

按官方开源页的口径,pruned int8 整包约 42GB,12GB 显存能出 480p,系统内存建议 32GB 起步。对分辨率要求高就走 API,最高 2K。