交付说明-v2.md

22S 对口型唱歌视频 — v2 交付说明

生成时间:2026-09-04 | 分辨率:480×848(竖屏 9:16,24fps,H.264) 时长:22.16s(两段 11s 拼接)| 音轨:上传视频原音轨前 22s(44.1kHz 立体声,多余音频已废弃)

三个修改点的落实情况

用户要求落实情况
片段改两个 11 秒,整片 22s,多余音频废弃✅ 第一段 0-11s(audio-only 参考 0-11s),第二段 11-22s(tail 末帧续接 + audio-only 参考 11-22s),拼接后截断 22.16s,音轨 = 原音频前 22s
嘴型必须严格匹配⚠️ 分段缩到 11s(H3 对口型可靠窗口内的上限)+ 提示词显式写入 "syllable-by-syllable sync, every mouth shape matching, no drift" + retention 标记 <Audio 1>: fully_copy。单帧无法验证口型对齐,需要你播放确认;若后半段仍有漂移,下一步建议缩到 5-6s/段(H3 对口型最稳窗口)
画面风格改香港武侠电影质感⚠️ 生成提示词加入低照度/烟雾/青橙影调/暖琥珀灯 vs 冷青阴影/戏剧性明暗;另出后期胶片强化版(强烈对比曲线 + 降饱和 + 胶片颗粒)供对比。识图评估:已具备烟雾+青橙+低照度基础,但原生生成仍偏"AI 精修古风",胶片颗粒感靠后期版补齐

成片下载

版本链接
v2 成片(推荐先看)http://192.168.31.76:8899/10-视频生成流水线/25S对口型唱歌任务/v2_final/22S_对口型哀怨忧伤武侠质感_480P.mp4
v2 胶片质感后期强化版http://192.168.31.76:8899/10-视频生成流水线/25S对口型唱歌任务/v2_final/22S_对口型武侠胶片感后期强化.mp4
第一段 11shttp://192.168.31.76:8899/10-视频生成流水线/25S对口型唱歌任务/v2_seg1/v2_seg1.mp4
第二段 11shttp://192.168.31.76:8899/10-视频生成流水线/25S对口型唱歌任务/v2_seg2/v2_seg2.mp4

(本地路径 /home/zyw/Downloads/dl-hub/10-视频生成流水线/25S对口型唱歌任务/v2_final/)

抽帧识图评估(7 个时间点)

时间点景别风格表情
t=1s怼脸近特写 ✅低照度+烟雾+暖灯,缺胶片颗粒❌ 甜美微笑
t=5s怼脸特写 ✅烟雾+青橙+低照度 ✅✅ 哀怨忧伤(眼神微睁空洞、唇微启)
t=10.5s怼脸大头照 ✅烟雾+青橙,偏亮❌ 甜美微笑
t=11.2s(拼缝)近景 ✅ 无断裂干净柔和⚠️ 温柔偏甜
t=11.6s(拼缝)中近景 ✅ 连贯精致平滑⚠️ 凝视微怔
t=16s近景 ✅缺粗粝感❌ 惊讶/无辜
t=21s近特写 ✅平滑⚠️ 嘴部僵硬(疑似口型过渡)

结论与下一步选项

  1. 对口型:请先播放 v2 成片确认嘴型匹配度。若后半段仍乱,最有效的下一招是把每段缩到 5-6s(4-5 段,H3 对口型最可靠窗口),或对第二段改用更长的 tail 参考
  2. 香港武侠质感:若后期胶片版的方向 OK,可把它做成标准后处理(生成原片 → 统一调色+颗粒);若不够,v3 提示词再加"胶片扫描/颗粒/暗部细节/硬光"等更强措辞
  3. 表情:v3 需在 detailed_description 每段都重复"保持哀怨忧伤、无微笑"的正面动作描述,并考虑把裁出的正面图换成一张更哀怨的表情参考

告诉我你看完动态后的反馈(口型是否严格同步?风格方向对不对?),我据此出 v3。

下载此文件