# 《好了歌》道教童声合唱 · 发音修正版（3 版）

**日期**：2026-09-16
**文本**：曹雪芹《红楼梦》第一回《好了歌》（**公有领域**，18 世纪）
**曲**：YuE2-3B · 48kHz 立体声 · 道教童声合唱 · `cot=full` + `cfg=1.2`

---

## 一、本次要修的三处发音（+ 上一轮的"了"）

你听出来的问题，逐条对应处理：

| 原文 | 正确读音 | 问题 | 本次改法 |
|---|---|---|---|
| 了（句尾/结尾） | **liǎo** | 模型读成 le（上一轮"瞭"字版你说更好，本版沿用） | 句尾完成体的 **了 → 瞭**；结尾 **好便是瞭 / 瞭便是好** |
| 荒**冢** | huāng **zhǒng** | 读音出错 | **冢 → 塚**（"冢"的异体字，同音 zhǒng，字形更常见于传统文献） |
| 终**朝** | zhōng **zhāo** | 读成 cháo | **朝 → 日**（"终日"＝"终朝"，同为"整天"义，无同音替字可用） |
| **姣**妻 | **jiāo** qī | 读音出错 | **姣 → 娇**（同音常用字，且"娇妻"本就是通行写法） |
| 忘不了 | wàng bù **liǎo** | 未报错 | **保持原样**（此处的"了"是"不＋了"结构，模型本来就读对） |

> 说明：这不是"改诗"，而是**用字形去逼读音**——YuE2 只吃文本、不接受拼音/音素输入，同音（或同义）替字是目前唯一能在文本层面施加影响的杠杆。原始字形完整保留在 `脚本/歌词-未修正(对照).txt`，**你若不认可任何一处替换，告诉我即可回退**。

**另需更正我上一轮的说法**：我曾根据乐谱规划 ABC 里 `outro` 的 Vocal 全是休止符，断言"结尾那句不会唱"。**这个推断是错的**——你实际听到了它，说明语义阶段照样把 outro 歌词唱了出来。抱歉，是我把"规划"当成了"结果"。

---

## 二、交付三版

| # | 文件 | 时长 | 中位 F0 | 音域(5–95%) | 编曲侧重 |
|---|---|---|---|---|---|
| 1 | `01-道教童声-纯童声木鱼钟磬` | 2:28 | **330 Hz (E4)** | A3 – D5 | 纯童声齐唱＋木鱼钟磬颂钵，60 BPM |
| 2 | `02-道教童声-童声加成人低音衬底` | 2:07 | 199 Hz (G3)* | C#3 – D4 | 童声之上加**成人男声低音持续音**，66 BPM |
| 3 | `03-道教童声-科仪诵唱铃杵节奏` | 1:48 | **349 Hz (F4)** | C3 – C5 | 科仪诵唱感＋铃杵与木鱼节奏，72 BPM |

\* 第 2 版中位偏低到 G3，是因为分离出的人声轨里**含成人男声低音衬底**，把统计拉下来了——不是童声变低，这点听感上以你判断为准。第 1、3 版（330/349 Hz）是标准的童声音区。

三版**歌词完全相同**（都是修正版），差别只在编曲、速度与 seed（313131 / 323232 / 333333）。

---

## 三、歌词（发音修正版全文）

```
[verse]  世人都晓神仙好 / 惟有功名忘不了 / 古今将相在何方 / 荒塚一堆草没瞭
[verse]  世人都晓神仙好 / 只有金银忘不了 / 终日只恨聚无多 / 及到多时眼闭瞭
[bridge] 世人都晓神仙好 / 只有娇妻忘不了 / 君生日日说恩情 / 君死又随人去瞭
[verse]  世人都晓神仙好 / 只有儿孙忘不了 / 痴心父母古来多 / 孝顺儿孙谁见瞭
[outro]  好便是瞭 / 瞭便是好
```

---

## 四、三版风格提示词（原文）

```
第1版 Taoist temple ritual chant, pure children's choir singing in unison, boys and girls voices,
      clear high child timbre, wooden fish and temple bells, singing bowls, guqin, xiao flute,
      deep drone, very slow sacred pulse, serene devotional and transcendent, 60 BPM

第2版 Taoist temple chant with children's choir over a low adult male drone, layered children voices
      in unison, temple bells, singing bowls, guqin and xiao flute, slow solemn ritual pulse,
      spacious and transcendent, 66 BPM

第3版 Taoist ritual recitation chant with children's choir, chanting style, hand bell and vajra
      percussion, wooden fish rhythm, temple bells, guqin drone, processional and devotional,
      steady ritual pace, 72 BPM
```

参数：`cot=full`、`semantic_max_tokens=5500`、`cfg_scale=1.2`、`attention_backend=sdpa`、16GB 显存档。

---

## 五、必须说清的局限（第三次重申，也是这套链路的硬边界）

1. **拼音/音素无法输入**：YuE2 的歌词入口只有汉字文本，"了 le/liǎo"、"朝 cháo/zhāo" 这类**多音字**完全由模型自己决定，我只能靠改字形去影响它，**不保证生效**。
2. **我无法验证发音**：本机没有 ASR；中文 ASR 输出汉字（le 与 liǎo 都写作"了"），区分不了；Demucs+YIN 只能测音高，测不了声母韵母。**所以最终判定只能靠你的耳朵。**
3. 若三版仍有字读错，**文本层面基本已到极限**（能换的同音/同义字都换过了）。剩下的路只有：
   - 换**支持拼音/音素控制**的歌声合成（DiffSinger 一类）；
   - 或人工演唱 / 找人声后期；
   - 或接受"读音近似"，把它当作音乐化处理。

---

## 六、复现命令

```bash
python3 yue2-run.py --cot full --lyrics-file 歌词-发音修正版.txt --sem-mx 5500 \
  --attn sdpa --cfg 1.2 --seed 313131 \
  --style "$(cat style-dao-1.txt)" --tag dao-tongsheng-1 --outdir <输出目录>
```

---

## 七、可继续做

- 三版逐字听校后，**只改仍错的字**再定向重出（单字替换 → 同 seed 重跑，便于 A/B）；
- 想更"科仪"：加 `sutra recitation, no melodic singing, wooden fish only, no bells`；
- 想要更大的童声群感：加 `large children choir, layered unison, slight detune, hall reverb`。
