AI 手册 06 · 失败模式与修复速查

AI 生成经验手册章节《AI 手册 06 · 失败模式与修复速查》,全文约 3047 字,免费在线研读;读完标记可得积分。属于诗韵乐府古风音乐百科系列。

AI 手册 06 · 失败模式与修复速查

AI 手册 06 · 失败模式与修复速查

AI 生成古风的五大类失败、成因与修复手段。排查顺序建议:先定位是词的问题还是曲的问题(把词单独拿去人声朗读——读着不通是词的病),再按表下药。

6.1 失败模式总表

#失败模式典型表现根因修复手段
1中文吐字含糊/吞字人声含混、多音字读错、句子粘连中英混排;多音字;前奏过长盖人声;生僻字同音字替换 → 拼音标注(nǐ hǎo/ni3 hao3,可能需重 roll)→ [Pronunciation: 字 = pīn yīn] 标签;歌词只用汉字、声明 Mandarin;行尾不加标点;逐段生成排查
2戏腔出不来 / 像普通假声副歌只有普通女声假音,没有戏曲味"京剧/戏腔"笼统词无参数意义;戏腔句没有拖腔标记三件套:style 写 Beijing Opera vocals, high pitch female vocal hook + 副歌首句前 (belting) + 歌词拖腔"~"("哎呀呀~ 江山如画~");或改用 Cover 功能换戏腔人声;终极方案 X Studio/ACE 逐字雕滑音颤音
3编曲不古风(电音/西式和弦混入)古筝+ EDM 鼓组混搭、前半古风后半电音(风格漂移)泛化风格词被英文训练分布主导;style prompt 过长被截断Exclude Styles:Electronic, Synthesizer, Drum Machine, Autotune;点名真乐器 guzheng/erhu/pipa/dizi + pentatonic scale;删掉英文流行词;style 控制在关键信息 200 字符内;多次重 roll
4歌词堆砌空洞(AI 版伪古风)意象名词连排、无故事、无动词、每首都像同一首大模型默认行为 = 堆华丽意象分步问答模板;"每句必须有一个具体动作/细节,禁止连续 3 个以上意象名词";三维多变法(情绪×视角×冷门意象群);先写两句话故事再动笔;化用率 30-60% 约束
5爆款同质化6415/4536 和声、AI 感人声、结构与全网神曲一样算法强化最大公约数Cover 改风格;Persona 建立个人音色;自训 Custom Models(Suno v5.5);换非常规和声(如 6451 主歌 + 小调 4536 变体);换冷门意象与非常规曲式(板式结构)

6.2 词阶段专项问题

问题修复
LLM 无视 JSON 指令直接写歌词(总控路由跑飞)别重试——输出已是完整歌词就直接采用("降级直出"),省一次调用
词牌字数对不上(长词牌失败率高)用短词牌(浣溪沙 42 / 鹧鸪天 55)起步;要求逐句标注字数自检;长词牌拆成两轮生成再拼接
平水韵出韵喂韵部字表而不是只报名字(LLM 对平水韵记忆不完整)
押韵但句子不通(强行押韵)加约束"每句必须通顺、允许隔句押";人工只检查韵脚句的语法
标题永远返回同一个兜底值思考模型 <think> 吃光 max_tokens——预算给到 2000(见 6.5)
每次生成都是"思念+月+酒"三维多变法 + 明确禁用词表(月/花/酒/青衫/红颜/春风/柳/雨)

6.3 曲阶段专项问题

问题修复
前奏太长 / 没有人声歌词区第一行就写 [Verse] 直接进主歌;或 style 写 short intro;生成后用 Extend 从主歌起点截取
民乐间奏被唱词占用[Guzheng Solo] / [Instrumental Break] 标签 + 该段不写词
副歌没有记忆点副歌第 4 句做 ≤4-7 字 Hook 短句;副歌尾句与主歌末句相同(循环洗脑结构)
歌曲戛然而止[Outro] + [Fade Out] 标签;或 Extend 补尾奏
全曲 BPM/情绪漂移style 里锚定 BPM 数值;避免在歌词区写风格描述(混写是漂移主因)
男女声乱入style 明确 female vocals only;歌词区加 [Female Vocal]
生成结果每次都不一样、好坏随机正常随机性:一次出 2-4 版挑选;满意段落用 Cover 保留;音色满意用 Persona 固定

6.4 兜底手段优先级


轻 → 重:

1. 重 roll(同 prompt 多次生成)

2. 改 prompt(换词/加锚定/加 Exclude)

3. 改歌词(同音字替换、拆并句子)

4. Extend / Cover / Remaster(保留好的部分)

5. Persona / Custom Model(音色级控制)

6. X Studio / ACE Studio 重做人声(终极控制)

7. DAW 手工修(剪接两版的好段落、手动混音)

6.5 工程级陷阱(API/管线向,来自本地项目实战)

  • 思考模型吃 max_tokens:起标题等小任务 max_tokens=50 会被 <think> 全部吃掉,永远返回兜底值;highspeed 模型也会思考(reasoning_tokens 1500+)。修复 = 预算 2000。
  • 同步谱曲请求阻塞 1-3 分钟:改异步任务 + 前端轮询;服务重启时把 init/running 僵尸任务标 failed。
  • LLM-as-judge 打分虚高:加保守锚定("AI 古风平均 6-7 分");音频维度明说"无法听歌,保守 6.0±0.5";8 维不全时 overall 强制 NULL 而非硬算平均。
  • prompt 超长截断:MiniMax music prompt 上限 2000 字,超长编曲指令丢失 → 后半首风格漂移。
  • 测试依赖真实 API:做确定性 mock(按 prompt hash 返回假数据),smoke/UI 测试全离线可重复(详见 05)。
  • 宽容解析:对 LLM 的 JSON 输出剥 markdown 围栏、截取首个 { 到末个 };解析失败但内容可用时直接采用而非机械重试。

6.6 一分钟体检单(发布前)

  • [ ] 通读歌词:有无堆砌句?有无生僻字?多音字标注了吗?
  • [ ] 全曲听一遍:风格前后一致?咬字全清?戏腔出现了吗?
  • [ ] 15 秒内有人声记忆点吗?
  • [ ] 无突兀电音/西式段落?
  • [ ] 商用授权确认(平台条款 + 无他人版权词曲)?
  • [ ] 标注 AI 生成(按发布平台要求)?

五项里破两项 → 回 6.4 兜底阶梯升级处理。