纪录片解说提示词怎么写?旁白的节奏和留白

纪录片解说提示词怎么写?旁白的节奏和留白
纪录片提示词的旁白节奏标记与留白设计手写示意

先说我的结论:纪录片提示词最该花力气的地方,不是让AI把每一秒都填满,而是把节奏标记、留白标记和画面对应关系写进指令。依据是我2026年8月给一部家乡短片写解说词的三版实测,改到第三版,字数砍掉六成才像样。你先做的只有一件事:在指令里替片子划出不许说话的位置。

纪录片提示词里最值钱的部分,不是教AI描述画面,是规定哪里不说话。2026年8月,我给一部拍家乡的短片写解说词,片子四分二十秒,二十一个镜头。第一版指令只写了「庄重大气」,出来的稿子满篇四字句,配画面像县级台的专题片。挺离谱的。

折腾到第三版,我摸出三个东西:节奏标记管一句话说多久,留白标记管哪里闭嘴,画面对应关系管每句话落在哪个镜头上。下面按翻车的顺序讲。

第一版为什么像新闻联播

第一版翻车的根源,是指令里只有「庄重大气」这类形容词,没有节奏信息,AI只能套用它见得最多的播音腔。

那版指令我的原话是:「为这部四分二十秒的家乡短片写解说词,语言庄重大气,有文化感。」三十秒出稿。四百一十二个字,二十一个镜头平均每个摊到二十个字,中间没有一处停顿。朋友听完只说了一句:像县志朗读。

问题出在哪?AI对「解说词」的默认想象就是播音腔,训练语料里最工整的解说样本基本都长这样。指令里不写节奏,等于把节奏的决定权交给了默认值。老实讲,我一开始还怪模型笨,回头看清第一版指令,才发现自己一个字都没提「怎么读」。

顺带说个判断:口播稿的断句和提词节奏,跟解说词是两回事。前者服务人读,后者服务片子呼吸。我参考过播音提词器怎么用?口播稿的断句和提词节奏里的断句思路,直接照搬会把片子带快,只借了它「按气口断句」这一条。

纪录片提示词的三类标记:节奏、留白、画面对应

节奏标记管一句多久、留白标记管哪里不说话、画面对应关系管每句话落在哪个镜头,三样都写进指令,AI才不会自己发挥。

先说节奏标记。我用了两种写法,一种是硬约束:「每句不超过十二个字,两句之间空一拍」;另一种是标调子:「这段用陈述调,句尾下沉,不要上扬」。单用前一种,句子是短了,读起来还是赶。加上后一种,才松下来。

留白标记是这次最大的发现。短片的第三个到第六个镜头是清晨的溪埠头,捶衣声、鸭群下水、雾还没散。我在指令里写:「[00:32-00:48]此处只有环境声,不配任何旁白」。第一版没有这行,AI很贴心地把这段也填满了词。环境声本身怎么描述,我单独整理过一篇音效提示词怎么写?给视频配环境声的描述方法,两份指令可以对着用。

画面对应关系最简单,也最容易被省掉:要求AI按镜头号输出,一行一条,格式固定为「镜头号|旁白|预计时长」。有这个格式,哪句话压着哪个镜头一目了然,改哪句直接定位,不用整篇重读。

三版解说词的读感对比

同一个溪埠头镜头,新闻腔版在讲解,聊天腔版在碎嘴,只有低语态版像蹲在你旁边说话,字数差了一半还多。

版本指令要点成稿字数读感(我个人觉得)
第一版·新闻腔庄重大气,有文化感412字每个字都对,连起来像县志朗读,画面成了配图
第二版·聊天腔像跟朋友聊天一样讲356字前三个镜头还行,第五个镜头开始碎嘴,「大家看」出现了七次,压不住画面
第三版·低语态低语态,一句一事,形容词每句最多一个168字旁白退到画面后面,和环境声轮着说话,成片用的就是这版

同一个镜头摆出来更直观。第一版写的是「青石板路蜿蜒千年,见证着古镇的沧桑变迁」;第三版写的是「路比镇上最老的人还老」,后面跟一行留白标记,空四秒。

从第二版到第三版,我只往指令里加了三条硬规矩:一,只用陈述句,全稿不许出现感叹号;二,一个镜头只说一件事;三,形容词每句最多留一个。字数从三百五十六掉到一百六十八,砍了快一半。不夸张地说,成片读感提升最大的就是这三条。

话说回来,低语态也不是处处适用。讲工艺流程、讲数据变化的段落,还是得让句子立起来,信息密度优先,溪埠头那套留白就要收着用。情绪段落用低语态,说明段落用正常语态,一部片子里两种语态换着来,比一路到底更像人话。

可以直接抄走的成稿指令

成稿指令的关键,是先给AI分好段的镜头清单和几条硬规定,再让它按「镜头号|旁白|留白」输出,最后自己动手删三分之一。

第三版定稿用的指令原样放在这里,镜头清单部分换成你自己的就行:

你是一部4分20秒家乡短片的解说词作者,片子共21个镜头,清单如下(粘贴镜头号和每个镜头的画面描述)。

写法规定:
1. 低语态:只用陈述句,不用感叹号,每句不超过12个字,每句最多1个形容词;
2. 一个镜头最多一句旁白,一个镜头只说一件事;
3. 我标注「留白」的镜头,只输出「此处只有环境声」,不写任何字。

输出格式:镜头号|旁白|预计时长(秒)。
写完自检:删掉所有「见证」「诉说」「岁月」「变迁」,删完再读一遍,能删的字都删掉。

末尾那句自检不是摆设。模型对「解说词」这个词的惯性很重,不加这句,它写完会顺手把大词塞回去。我试了下,加与不加,返工次数差出一倍。

短片最后定在凌晨五点半的溪埠头:四秒只有水声和捶衣声,那句「路比镇上最老的人还老」才进来。回头翻那份纪录片提示词,没一条是什么高级技巧,全是给自己划的禁区——哪里不许说,一句说几个字,形容词留几个。旁白的呼吸感不是写出来的,是删出来的。

常见问题

留白一段留多长合适?

我的经验值:单一动作的画面留3到5秒,情绪落点留6到8秒,超过10秒观众就开始走神,除非那段声音本身是主角,比如雷雨或者庙会锣鼓,那就让声音撑满整个镜头。

旁白可以先于画面半拍出现吗?

可以,这叫引导式进入,旁白先抛半句,画面跟上来补完,适合转场镜头。我用过一次,比严格对位要活。但一部片子里别超过两三处,多了显得刻意。

AI写的解说词一股翻译腔怎么办?

在指令里加两条:主语前置,删掉「这是……的」结构。出稿后再通读一遍,凡是你自己读着会停顿半秒的句子,直接拆成两句。

没有分镜清单,只有一个主题能写吗?

能,但别直接要成稿。先让AI按主题列一份镜头清单,你来砍掉三分之一,剩下的再进解说环节。清单不过你的手,旁白就跟画面对不上。