# 数字人·沙县小吃对口型（竖屏 480P）

## 目标
用角色三视图生成"数字人对口型"短视频：竖屏 9:16、480P、近距离特写固定机位、半身带手部动作，
台词为指定 A2/沙县 段子；第 1 句手持手机低头念粉丝留言（慢速），之后手机放下（倒扣桌面）语速加快、认真说教，
全程温暖微笑；场景为即梦生成的沙县小吃店内部。

## 目录结构
- `01-场景/`  即梦生成的沙县小吃店内景（2K，0 积分权益）
- `02-角色/`  三视图原图、裁出的正面视图、两张合成底图（A=手持手机 / B=手机倒扣桌面）
- `03-配音/`  9 句配音 + 全台词试听
- `04-视频/`  分段成片与最终成片
- `05-记录/`  提示词/参数/早期试跑/日志

## 关键参数
| 项 | 值 |
|---|---|
| 分辨率 | 480×864（9:16 竖屏） |
| 帧率 | 24fps |
| 视频模型 | MiniMax H3（ref2va int8_convrot + 官方 ref2v turbo 4-step LoRA） |
| 采样 | 4 步 / dual_clock_euler / native_flow / shift 12:3 |
| 配音 | H3 语音工作室，描述音色（甜美少女音），逐句生成 |
| 口型 | 音频锁定 `audio_mode=lock_source`（配音直接驱动口型） |
| 节奏 | 第1句慢（念留言）；第2-9句按用户要求在原始基础上加快 32.25% |
| 稳定性 | 每任务前后：GPU≤55°C 且可用内存≥8GB 才起跑；**任何任务结束强制等 90 秒**；全程记录温度/功耗/显存/内存 |
| 主机 | GPU 机 192.168.31.31（RTX 5060 Ti 16GB / 32GB RAM） |

## 进度
- [x] 场景（即梦，0 积分）
- [x] 角色三视图 → 正面裁切
- [x] 合成底图 A（手持手机+微笑）、B（手机倒扣桌面+微笑）
- [x] 配音 9 句（待改用参考音色统一音色）
- [x] 视频链路打通：音频锁定试跑（口型对上了）
- [ ] 镜头漂移修复
- [ ] 逐段生成 + 组装

## 已知问题
1. **镜头漂移**：音频锁定生成的画面会缓慢推拉/位移（首帧锚定不够强）。
2. **音色不统一**：逐句独立生成导致个别句（如第6句，40–49s）音色与其他句不同 → 改用 `reference_voice` 参考音色统一。
