交付说明-v1.md

25S 对口型唱歌视频 — 第一版交付说明

生成时间:2026-09-04 | 分辨率:480×848(竖屏 9:16,24fps,H.264+AAC)| 总时长 25.33s

成片下载

文件链接说明
成片(原声版,推荐)25S_对口型_哀怨忧伤480P原声.mp4音轨 = 上传视频原音轨(44.1kHz 立体声,未做任何改动)
成片(模型音轨版)25S_对口型_哀怨忧伤_480P.mp4音轨为 H3 模型合成(32kHz),供对比
第一段seg1.mp412.25s,Picture1+2 + audio-only 0-12s
第二段seg2.mp413.68s,tail 末帧续接 + audio-only 12-25s

执行链路(全部跑通)

  1. 三视图预处理:识图定位正面在左 → ffmpeg 裁出正面视图(596×1008)作为 <Picture 1>,完整三视图作为 <Picture 2>
  2. 第一段 12s:REF2VA,参考 = 正面图 + 三视图 + 上传视频音轨 0-12s(media_mode=audio 纯音频模式,画面帧完全不用)
  3. 末帧续接:从 seg1 末尾裁 2s → tail.mp4,作为第二段的 <Video 1> 视觉参考
  4. 第二段 13s:REF2VA,参考 = 正面图 + 三视图 + tail(media_mode=video)+ 音轨 12-25s(media_mode=audio),提示词 [video continuation]
  5. 拼接:ffmpeg concat → 25.96s 成片;音轨替换为上传视频原音轨(44.1kHz 原样)

抽帧评估(DeepSeek-Vision 逐帧识别)

时间点景别表情身份一致性
t=1s中近景特写❌ 甜美开朗微笑✅ 黑长发+白花发簪+薄荷绿汉服
t=6s近景/胸像特写✅ 微微低头、眼神柔和、哀怨忧伤有美感✅
t=12.1s(拼缝前)近景特写⚠️ 温柔无辜偏甜✅ 同人同景
t=12.3s(拼缝)怼脸特写⚠️ 俏皮/惊讶/嘟嘴✅ 服化道统一
t=12.6s(拼缝后)近景/胸像❌ 灿烂露齿笑✅
t=18s近景⚠️ 清纯娇俏✅
t=24s近景/特写❌ 甜美愉悦活泼✅

结论

下一步(重跑优化方向)

  1. 表情:提示词改为更明确的动作性描述(如 "gently biting lower lip / eyes welling with unshed tears / downward gaze with furrowed-brow-free sadness / lips barely parting"),并在 retention_analysis 把表情列为 fully_preserved;可考虑换正面图为更符合哀怨表情的参考
  2. 怼脸:detailed_description 开头写死 "face fills 90% of the frame, top of head slightly cropped, chin near bottom edge",强调 "no shoulders visible";或把裁出的正面图再裁成脸部特写作为 Picture 1
  3. 两段一起重跑(seed 记录在 seg1/seg2/seed.txt)
下载此文件