AI 手册 03 · 演唱精修、后期与国风 MV
AI 手册 03 · 演唱精修、后期与国风 MV
全自动生成的音质与咬字有天花板。本章讲三个升级手段:AI 歌声精修(X Studio / ACE Studio)、传统混音后期、以及"歌 + MV"的完整出品流。
3.1 为什么需要精修
Suno 等端到端模型的典型短板:中文多音字偶错、拖腔与转音不可控、戏腔"形似神不似"、响度与动态不平衡。当目标是"能发布的作品"而非 demo 时,标准做法是把人声层重做:
Suno 生成(曲风 + 和声框架 OK)
↓ 提取伴奏 / 参考旋律
X Studio / ACE Studio 重做中文干声(MIDI + 歌词)
↓ 可逐字调:滑音、转音、颤音、咬字、气口
DAW 合成 + 混音
3.2 X Studio(免费)与 ACE Studio(订阅)
| 维度 | X Studio | ACE Studio |
| 出品 | 网易云音乐 × 小冰 | 时域科技 |
| 形态 | 桌面软件(Mac/Win),免费 | 桌面软件 + 订阅 |
| 输入 | MIDI + 歌词,3 秒出干声 | MIDI + 歌词(支持 8 语种) |
| 可调项 | 滑音、转音、颤音、咬字 | 同左,另加声音克隆、转声线,140+ 免版税音色 |
| 歌手库 | 洛天依等十余位 AI 歌手 | 丰富声线库 + 自训 |
| 古风用法 | 免费精修咬字;虚拟歌手路线 | 高表现力人声、戏腔细节雕琢、系列作品统一音色 |
旋律来源三选一:① 让 Suno 生成后凭听感扒旋律(简单歌可行);② 用网易云天音等工具先出 MIDI;③ 自己/LLM 辅助写旋律(五声音阶内随手哼,成功的概率比想象高——见百科第三章配方卡)。
3.3 戏腔人声的精修要点
- 戏腔段的灵魂在拖腔与滑音:在 X Studio/ACE 里给尾字加下滑音 + 长颤音,比 prompt 里写一百遍 "Beijing Opera" 都有效。
- 咬字戏曲化:尖团字(如"见"读 jian 而非 jin 类传统分尖团)可选做,做一两处即可点味,全做反而怪。
- 混音上:戏腔段加 1.5x 混响 + 轻微 delay,念白加 200ms delay(生产提示词验证的参数)。
- 真人戏腔参考:把《赤伶》《神女劈观》的戏腔段作为 A/B 参照,逐句比对滑音走向。
3.4 混音后期 checklist
古风混音的审美目标是"空间感/山水感",与流行混音的差异点:
- [ ] 人声本位:人声略靠前,民乐为对话者而非背景墙
- [ ] 民乐干声突出(少效果),现代弦乐 30% wet reverb 铺空间
- [ ] 禅意向用长混响(30-40% wet);赛博向用短混响(与治愈相反)
- [ ] 低频管理:中国大鼓 -3dB 防过载;808 与古筝做 sidechain duck
- [ ] 间奏民乐 solo 段留足呼吸(别用压缩抹掉动态)
- [ ] 母带响度:流媒体 -14 LUFS 左右,短视频可到 -9(响度战争在抖音版另做)
- [ ] 导出两版:完整版(网易云/B站)+ 15 秒高光版(抖音卡点用副歌+戏腔段)
3.5 AI 国风 MV 工作流
主流管线(约 1-2 小时/支):
歌词分镜(LLM 把每段歌词转成 3-5 个画面描述)
↓ 关键词锁定画风:水墨风 / 工笔风 / 敦煌风 / 青绿山水
即梦 / 可灵 / Seedance:图生视频(每段 3-5 秒镜头)
↓
剪辑对齐:副歌用高动态镜头,戏腔段给"人物亮相"镜头
↓
字幕(逐句歌词,戏腔拖腔字加 ~ 装饰)+ 封面(同画风出图)
要点:
- 风格词一致性:每条镜头提示词都重复同一组画风关键词,否则镜头间画风漂移。
- 古风画面高性价比元素:飘带/灯笼/雪/长镜头回眸/书法字转场。
- 官方级参照:央视频《千秋正风华》AI 古风 MV。
- 版权注意:视频模型产出商用条款各异,与音乐平台商用授权分开确认。
3.6 发布渠道策略
| 渠道 | 策略 |
| 抖音/汽水 | 15 秒高光版 + 完整版双发;汽水对 AI 音乐推荐包容度高 |
| B站 | 完整 MV + 歌词文案(背景故事文案是古风传统,认真写) |
| 网易云 | 完整版 + 评论区置顶故事;考虑入驻音乐人计划 |
| 标注 | 按平台要求标注 AI 生成内容;商用前核对平台与模型商用条款 |
| 系列化 | 用 Persona 固定音色,做成"专辑/人物曲系列"——算法偏爱系列更新 |