25S 对口型唱歌视频 — 第一版交付说明
生成时间:2026-09-04 | 分辨率:480×848(竖屏 9:16,24fps,H.264+AAC)| 总时长 25.33s
成片下载
执行链路(全部跑通)
- 三视图预处理:识图定位正面在左 → ffmpeg 裁出正面视图(596×1008)作为
<Picture 1>,完整三视图作为 <Picture 2>
- 第一段 12s:REF2VA,参考 = 正面图 + 三视图 + 上传视频音轨 0-12s(
media_mode=audio 纯音频模式,画面帧完全不用)
- 末帧续接:从 seg1 末尾裁 2s → tail.mp4,作为第二段的
<Video 1> 视觉参考
- 第二段 13s:REF2VA,参考 = 正面图 + 三视图 + tail(
media_mode=video)+ 音轨 12-25s(media_mode=audio),提示词 [video continuation]
- 拼接:ffmpeg concat → 25.96s 成片;音轨替换为上传视频原音轨(44.1kHz 原样)
抽帧评估(DeepSeek-Vision 逐帧识别)
| 时间点 | 景别 | 表情 | 身份一致性 |
| t=1s | 中近景特写 | ❌ 甜美开朗微笑 | ✅ 黑长发+白花发簪+薄荷绿汉服 |
| t=6s | 近景/胸像特写 | ✅ 微微低头、眼神柔和、哀怨忧伤有美感 | ✅ |
| t=12.1s(拼缝前) | 近景特写 | ⚠️ 温柔无辜偏甜 | ✅ 同人同景 |
| t=12.3s(拼缝) | 怼脸特写 | ⚠️ 俏皮/惊讶/嘟嘴 | ✅ 服化道统一 |
| t=12.6s(拼缝后) | 近景/胸像 | ❌ 灿烂露齿笑 | ✅ |
| t=18s | 近景 | ⚠️ 清纯娇俏 | ✅ |
| t=24s | 近景/特写 | ❌ 甜美愉悦活泼 | ✅ |
结论
- ✅ 链路验证成功:audio-only 纯音频模式、两段生成、末帧续接(拼缝处同人同景、服化道与色调高度统一,无跳变)、原声保留——25s 完整视频跑通
- ✅ 身份一致性:全程黑长直发 + 白色花朵发簪 + 浅薄荷绿汉服,与三视图一致
- ⚠️ 景别:多数时间是中近景/胸像特写,脸部占比大但未完全填满画面,未达到"怼脸直拍"(extreme close-up)
- ❌ 表情是主要问题:模型把"哀怨忧伤"理解偏了,多个时间点是甜美微笑/俏皮/露齿笑,情绪基调完全不对——提示词对表情的控制没生效
下一步(重跑优化方向)
- 表情:提示词改为更明确的动作性描述(如 "gently biting lower lip / eyes welling with unshed tears / downward gaze with furrowed-brow-free sadness / lips barely parting"),并在
retention_analysis 把表情列为 fully_preserved;可考虑换正面图为更符合哀怨表情的参考
- 怼脸:
detailed_description 开头写死 "face fills 90% of the frame, top of head slightly cropped, chin near bottom edge",强调 "no shoulders visible";或把裁出的正面图再裁成脸部特写作为 Picture 1
- 两段一起重跑(seed 记录在 seg1/seg2/seed.txt)