AI 手册 06 · 失败模式与修复速查
AI 生成经验手册章节《AI 手册 06 · 失败模式与修复速查》,全文约 3047 字,免费在线研读;读完标记可得积分。属于诗韵乐府古风音乐百科系列。
AI 手册 06 · 失败模式与修复速查
AI 手册 06 · 失败模式与修复速查
AI 生成古风的五大类失败、成因与修复手段。排查顺序建议:先定位是词的问题还是曲的问题(把词单独拿去人声朗读——读着不通是词的病),再按表下药。
6.1 失败模式总表
| # | 失败模式 | 典型表现 | 根因 | 修复手段 |
| 1 | 中文吐字含糊/吞字 | 人声含混、多音字读错、句子粘连 | 中英混排;多音字;前奏过长盖人声;生僻字 | 同音字替换 → 拼音标注(nǐ hǎo/ni3 hao3,可能需重 roll)→ [Pronunciation: 字 = pīn yīn] 标签;歌词只用汉字、声明 Mandarin;行尾不加标点;逐段生成排查 |
| 2 | 戏腔出不来 / 像普通假声 | 副歌只有普通女声假音,没有戏曲味 | "京剧/戏腔"笼统词无参数意义;戏腔句没有拖腔标记 | 三件套:style 写 Beijing Opera vocals, high pitch female vocal hook + 副歌首句前 (belting) + 歌词拖腔"~"("哎呀呀~ 江山如画~");或改用 Cover 功能换戏腔人声;终极方案 X Studio/ACE 逐字雕滑音颤音 |
| 3 | 编曲不古风(电音/西式和弦混入) | 古筝+ EDM 鼓组混搭、前半古风后半电音(风格漂移) | 泛化风格词被英文训练分布主导;style prompt 过长被截断 | Exclude Styles:Electronic, Synthesizer, Drum Machine, Autotune;点名真乐器 guzheng/erhu/pipa/dizi + pentatonic scale;删掉英文流行词;style 控制在关键信息 200 字符内;多次重 roll |
| 4 | 歌词堆砌空洞(AI 版伪古风) | 意象名词连排、无故事、无动词、每首都像同一首 | 大模型默认行为 = 堆华丽意象 | 分步问答模板;"每句必须有一个具体动作/细节,禁止连续 3 个以上意象名词";三维多变法(情绪×视角×冷门意象群);先写两句话故事再动笔;化用率 30-60% 约束 |
| 5 | 爆款同质化 | 6415/4536 和声、AI 感人声、结构与全网神曲一样 | 算法强化最大公约数 | Cover 改风格;Persona 建立个人音色;自训 Custom Models(Suno v5.5);换非常规和声(如 6451 主歌 + 小调 4536 变体);换冷门意象与非常规曲式(板式结构) |
6.2 词阶段专项问题
| 问题 | 修复 |
| LLM 无视 JSON 指令直接写歌词(总控路由跑飞) | 别重试——输出已是完整歌词就直接采用("降级直出"),省一次调用 |
| 词牌字数对不上(长词牌失败率高) | 用短词牌(浣溪沙 42 / 鹧鸪天 55)起步;要求逐句标注字数自检;长词牌拆成两轮生成再拼接 |
| 平水韵出韵 | 喂韵部字表而不是只报名字(LLM 对平水韵记忆不完整) |
| 押韵但句子不通(强行押韵) | 加约束"每句必须通顺、允许隔句押";人工只检查韵脚句的语法 |
| 标题永远返回同一个兜底值 | 思考模型 <think> 吃光 max_tokens——预算给到 2000(见 6.5) |
| 每次生成都是"思念+月+酒" | 三维多变法 + 明确禁用词表(月/花/酒/青衫/红颜/春风/柳/雨) |
6.3 曲阶段专项问题
| 问题 | 修复 |
| 前奏太长 / 没有人声 | 歌词区第一行就写 [Verse] 直接进主歌;或 style 写 short intro;生成后用 Extend 从主歌起点截取 |
| 民乐间奏被唱词占用 | 用 [Guzheng Solo] / [Instrumental Break] 标签 + 该段不写词 |
| 副歌没有记忆点 | 副歌第 4 句做 ≤4-7 字 Hook 短句;副歌尾句与主歌末句相同(循环洗脑结构) |
| 歌曲戛然而止 | [Outro] + [Fade Out] 标签;或 Extend 补尾奏 |
| 全曲 BPM/情绪漂移 | style 里锚定 BPM 数值;避免在歌词区写风格描述(混写是漂移主因) |
| 男女声乱入 | style 明确 female vocals only;歌词区加 [Female Vocal] |
| 生成结果每次都不一样、好坏随机 | 正常随机性:一次出 2-4 版挑选;满意段落用 Cover 保留;音色满意用 Persona 固定 |
6.4 兜底手段优先级
轻 → 重:
1. 重 roll(同 prompt 多次生成)
2. 改 prompt(换词/加锚定/加 Exclude)
3. 改歌词(同音字替换、拆并句子)
4. Extend / Cover / Remaster(保留好的部分)
5. Persona / Custom Model(音色级控制)
6. X Studio / ACE Studio 重做人声(终极控制)
7. DAW 手工修(剪接两版的好段落、手动混音)
6.5 工程级陷阱(API/管线向,来自本地项目实战)
- 思考模型吃 max_tokens:起标题等小任务 max_tokens=50 会被
<think> 全部吃掉,永远返回兜底值;highspeed 模型也会思考(reasoning_tokens 1500+)。修复 = 预算 2000。
- 同步谱曲请求阻塞 1-3 分钟:改异步任务 + 前端轮询;服务重启时把 init/running 僵尸任务标 failed。
- LLM-as-judge 打分虚高:加保守锚定("AI 古风平均 6-7 分");音频维度明说"无法听歌,保守 6.0±0.5";8 维不全时 overall 强制 NULL 而非硬算平均。
- prompt 超长截断:MiniMax music prompt 上限 2000 字,超长编曲指令丢失 → 后半首风格漂移。
- 测试依赖真实 API:做确定性 mock(按 prompt hash 返回假数据),smoke/UI 测试全离线可重复(详见 05)。
- 宽容解析:对 LLM 的 JSON 输出剥 markdown 围栏、截取首个
{ 到末个 };解析失败但内容可用时直接采用而非机械重试。
6.6 一分钟体检单(发布前)
- [ ] 通读歌词:有无堆砌句?有无生僻字?多音字标注了吗?
- [ ] 全曲听一遍:风格前后一致?咬字全清?戏腔出现了吗?
- [ ] 15 秒内有人声记忆点吗?
- [ ] 无突兀电音/西式段落?
- [ ] 商用授权确认(平台条款 + 无他人版权词曲)?
- [ ] 标注 AI 生成(按发布平台要求)?
五项里破两项 → 回 6.4 兜底阶梯升级处理。