一次性让 AI 把骨架、歌词、编曲全做完,结果往往是每一层都差一点,也说不清到底该回头改结构、改词还是改配器。可操作的做法是把一次生成拆成三轮推进:第一轮只出段落结构和大致走向,第二轮冻结旋律只改歌词,第三轮在定稿的人声上先加一件乐器,每轮结束留一份可回退的版本记录,下一轮开工前先确认上一轮已经能听住,否则就回退,不要带着问题往下叠。
先把段落骨架定死,再隔离变量只改歌词,最后一件一件加乐器;每轮结束用固定命名的文件留档,下一轮动手前先确认上一轮没有未解决的问题。收尾用「还能不能跟着一起哼」作为唯一判断标准,哼不出来就是堆复杂了,回退到还能哼的那一轮重来。适用于个人用 AI 出歌的迭代流程,不追求一次成型。
第一轮只要骨架:段落和大致走向
第一轮的目标不是好听,而是让整首歌有一个能站住的结构,避免后面越改越乱。段落顺序先写死,通常按 intro / verse / pre-chorus / chorus / verse2 / chorus / bridge / chorus / outro 这类顺序排,段数控制在能一口气说完的范围内,段落多了后面改歌词时会找不到重点。
每段时长用「哼一遍要几拍」来感受,不必精确到毫秒。主歌一般 8 到 16 小节,副歌 8 小节左右;如果副歌比主歌短太多或长太多,听众会抓不住重心,这时先调段落长度而不是调旋律。
整体走向是否单调,用两个动作判断:把主歌第一句和副歌第一句单独哼出来,如果音区、节奏密度几乎一样,说明段落之间没有抬升;再把整首从头哼到尾,如果中途想不起「现在是第几段」,说明走向太平。停止条件可以定为:段落顺序能一次说清、副歌相对主歌有一处明显不同、整首哼一遍不卡壳,满足就冻结这一轮,进入下一轮。
只输出歌曲结构,不要歌词,不要编曲建议。
按下面格式给出段落顺序、每段大概小节数、这一段的走向变化:
- 段落名 / 小节数 / 走向(音区升高或降低、节奏变密或变疏)
整首的段落数控制在 9 个以内。
如果副歌与主歌在走向上几乎没有区别,请直接指出,并给一版调整后的结构。
第二轮只改歌词,旋律原封不动
这一轮的意义是把变量隔离:旋律和骨架保持不动,才能确认之前不满意的地方到底出在词还是曲。做法是把第一轮的结构和旋律当成不可变输入,只让 AI 在给定字数与韵脚约束下改词。
可以改的范围通常包括:字词替换、句尾韵脚、单句字数(前提是不改变原有重音位置)、语气词和口语化处理。这一轮明确不许动的是:段落顺序、每段小节数、旋律音高与节奏、副歌进入点、hook 所在的位置。哪怕某句旋律听起来别扭,也先记下来留到后面单独讨论,不要在这一轮顺手改掉,否则两轮的问题会混在一起。
以下是已固定的旋律与结构,请只改歌词,不要改变每行字数、韵脚位置和重音位置。
约束:
- 每行字数固定,超出或不足的句子请标注出来
- 韵脚方案:AABB 或 ABAB,请标明每行韵脚
- 不要新增段落,不要删除段落
输出格式:行号 / 新词 / 字数是否合规 / 该行韵脚
改完后的验证方式只有一个:对着原旋律清唱一遍。如果某句必须拖拍或挤字才能唱进去,说明字数已经越界,正确做法是换掉那句词,而不是改旋律。
第三轮再加编曲层,先只加一件乐器
控制每轮的变化量,才能让改动可听辨。先加一件节奏类乐器(如底鼓、军鼓或简单打击),或者一件和声类乐器(如一把吉他、一个 pad),不要一次加鼓加贝斯加弦乐,那样混音里的问题会互相掩盖,最后说不清是哪件东西出的问题。
加完后的判断点有两类。第一是混不混:把音量拉到平时听歌的大小,人声是否还清楚;如果人声变糊,先降新乐器的音量,而不是先加压缩。第二是有没有盖住人声:新乐器的频段是否和人声主频段重叠,通常人声集中在中频,重叠时优先做减法,让这件乐器让出中频,而不是把人声推上去。
还要回到旋律本身再清唱一句,确认加了乐器之后原旋律仍然听得出来。停止条件可以定为:人声清楚、能跟着哼、新增乐器确实在推进某一段的情绪,而不是让整首只是变响了。只加一件乐器时,这一轮要做的事本来就少,宁可多跑一轮,也不要在同一轮里同时调编曲和混音。
每轮结束留一份可回退的版本记录
避免越改越差却回不到上一版,靠的是一条简单的命名规则加一次确认。文件名可以用「轮次 + 改动点」的形式,不用很复杂:
r1_skeleton_v1
r2_lyrics_v1
r3_inst_drum_v1
r3_inst_drum_v2_vol_down
如果习惯用 git,把每次改动提交成一次 commit,提交信息写清这一轮动了哪一层,效果一样。关键是不覆盖上一版,并保留一个短文本记下每版改了什么,方便回头对比。
每次改动前必须先确认的一件事:上一轮的版本能完整播完,而且你认可它。也就是说,先手里有一份「可以回去」的文件,再动手改。这一条看起来多余,但它决定了后面出现问题时你还能不能退回来。
对比第一轮与最后一轮,确认是变好还是变复杂
收尾时只放两版:第一轮的骨架版和最后一轮的完整版,来回切换听。判断标准只用一条——还能不能跟着一起哼。能哼,而且比骨架版更容易记住,说明这几轮是真变好了,可以定稿。
哼不出来,或者要费劲找旋律,说明只是把简单的东西堆复杂了,这时按层回退:如果合起来听不清人声,回到第三轮里某个乐器版本或回到 r2,先确认不带编曲时人声是否清楚;如果是歌词唱不顺导致哼不下去,回到 r2 重改那一两句;如果拿掉编曲之后结构本身听完还是记不住,就回到 r1 重做段落走向。回退不是失败,而是把结论留在能验证的那一层上。